Completa antes de enviar
[site URL][Search Console property, or "none"][5 to 10 page URLs]
Comprueba si mi sitio [site URL] puede servir contenido a los buscadores de IA como ChatGPT, Claude, Perplexity, Gemini y Copilot. Mi propiedad de Search Console es [Search Console property, or "none"]. Mis páginas más importantes son: [5 to 10 page URLs]. Esta es una auditoría de solo lectura, no cambies nada.
1. robots.txt. Lee [site URL]/robots.txt con site_read_url y anota el código de estado. Si el archivo devuelve 5xx o entra en un bucle de redirecciones, indícalo al principio: es posible que los rastreadores no rastreen el sitio en absoluto. Después determina qué grupo de reglas se aplica a cada uno de estos rastreadores y si mis páginas clave están permitidas: OAI-SearchBot, ChatGPT-User, GPTBot, Claude-SearchBot, Claude-User, ClaudeBot, PerplexityBot, Perplexity-User, Googlebot, Google-Extended, Bingbot, Applebot, Applebot-Extended, CCBot, meta-externalagent. Cuando un rastreador tiene un grupo con su propio nombre, solo se aplica ese grupo y las reglas de `User-agent: *` no, así que tenlo en cuenta.
2. Clasifica los rastreadores por función. Los que rastrean para búsqueda y citas son OAI-SearchBot, Claude-SearchBot, PerplexityBot, Bingbot y Googlebot. Los que obtienen una página en directo cuando un usuario hace una pregunta son ChatGPT-User, Claude-User y Perplexity-User. Los que recopilan datos de entrenamiento son GPTBot, ClaudeBot, Google-Extended, Applebot-Extended, CCBot y meta-externalagent. Marca con la máxima gravedad cualquier rastreador de búsqueda bloqueado, porque el sitio no podrá ser citado en las respuestas de ese asistente. No trates un rastreador de entrenamiento bloqueado como un error, descríbelo como una decisión. Ten en cuenta que Google-Extended no afecta a Google Search ni a las AI Overviews y solo controla si el contenido se usa para los modelos de Gemini.
3. Códigos de estado y cabeceras. Lee cada página clave con site_read_url y max_bytes=0. Informa solo del código de estado, la cadena de redirecciones (redirects), las cabeceras `x-robots-tag` y `content-type` y el valor de `server`, no el volcado completo de cabeceras. Marca las cadenas de redirección de más de dos saltos, una URL final distinta de la canónica y cualquier cabecera noindex o nosnippet. Si una página devuelve 403, 429 o 503 y el valor de server muestra una capa de protección como Cloudflare, Sucuri o Akamai, indica que podría tratarse de un bloqueo de bots.
4. Contenido sin JavaScript. Lee las páginas clave con site_read_url y text=true. Esta vista se extrae del HTML que envía el servidor, que es lo que ve un rastreador de IA que no ejecuta JavaScript. Si la respuesta indica truncated es true, vuelve a leer la página con max_bytes=1000000; de lo contrario pensarás que falta contenido cercano al final. Para cada página, indica si el H1, el primer párrafo del contenido principal, los datos de precio o servicio y los datos de contacto aparecen en ese texto, y si internal_links contiene enlaces a las páginas del menú principal.
5. Contenido con JavaScript. Mide las tres páginas más importantes con seo_technical_audit, que renderiza la página con JavaScript. Señala por separado cualquier página en la que el título, el H1 o el idioma difieran entre las dos vistas. Una diferencia de idioma suele deberse a una redirección automática según el país o el idioma del navegador del visitante y, como la mayoría de los rastreadores de IA llegan desde servidores en Estados Unidos, puede hacer que vean la versión de idioma equivocada.
6. Qué ve Google. Si tengo una propiedad de Search Console, inspecciona las páginas clave en una sola llamada a gsc_inspect_urls: estado de cobertura, fecha del último rastreo y canónica elegida por Google. Enumera las páginas clave bloqueadas por robots.txt o que aparezcan como "Rastreada, actualmente sin indexar". Enumera los sitemaps enviados con sus advertencias y errores usando gsc_sitemaps.
7. Archivos de descubrimiento. Lee sitemap.xml y llms.txt con site_read_url. Comprueba que mis páginas clave estén en el sitemap y que los valores de lastmod parezcan reales, e indícalo si todas las URL llevan la misma fecha. Si falta llms.txt, anótalo como una carencia, pero no crítica, porque ninguno de los principales buscadores de IA ha dicho oficialmente que use este archivo como señal de posicionamiento o de citas.
Expón con claridad los límites de las herramientas. site_read_url envía su petición como un navegador y no puede hacerse pasar por GPTBot ni por ClaudeBot, de modo que una regla de firewall que bloquee solo por nombre de rastreador no aparecerá en esta auditoría. Si uso una CDN o un firewall, recuérdame que revise en su panel si hay un ajuste que bloquee los rastreadores de IA (en Cloudflare, "AI Crawl Control" o "Block AI bots"). Si el sitio está alojado en Opus Growth, no me remitas a ningún panel de CDN y, si ves un bloqueo, sugiere comunicarlo con report_issue.
Da formato a la salida así. Primero un resumen de tres frases: ¿está mi sitio abierto a la búsqueda con IA y, si no, cuál es el mayor obstáculo? Después una tabla de rastreadores: rastreador, función, decisión de robots.txt, la línea de regla que decide, gravedad. Después una tabla de páginas: URL, código de estado, redirecciones, x-robots-tag, H1 y primer párrafo en el texto sin JavaScript (sí o no), diferencia respecto a la vista con JavaScript, estado de cobertura en Google. Termina con una lista de correcciones ordenada por gravedad, cada una con su evidencia y quién debe hacerla (yo, un desarrollador, el proveedor de hosting). Cuando los datos no basten para una conclusión, no adivines: di qué falta.