• SEO con IA

Las 5 mejores formas de optimizar el archivo robots.txt para los rastreadores de IA, tras analizar 219 dominios

  • Felix Rose-Collins
  • 5 min read

Introducción

Todos los artículos sobre rastreadores de IA te advierten del mismo error. Bloqueaste GPTBot durante el pánico por el scraping de 2023, según la advertencia, y sin quererlo bloqueaste también a los nuevos agentes que recogen páginas para citarlas en respuestas en tiempo real. Tu intención era detener los rastreadores de entrenamiento y, sin darte cuenta, dejaste de aparecer en las recomendaciones.

Hemos comprobado si eso está ocurriendo realmente.

En 219 dominios, no ocurrió ni una sola vez.

Ni de forma esporádica. Ni en un puñado de casos. Ni una sola vez.

Método

Tomamos los veinte primeros resultados orgánicos de 26 consultas comerciales en siete categorías: SaaS, comercio electrónico, finanzas, salud, viajes, hogar y marketing. Esto dio como resultado 254 dominios únicos. Obtuvimos el archivo robots.txt de cada uno de ellos el 28 de julio de 2026, y se resolvieron 219. Siete de ellos no proporcionaban ningún archivo robots.txt, lo que equivale a permitir todo.

Para cada dominio, comparamos todos los agentes de usuario de IA con el archivo utilizando la regla de precedencia estándar: prevalece el grupo de User-agent más específico, por lo que una coincidencia exacta de agente anula a *. Se considera que un dominio bloquea un agente cuando su grupo ganador prohíbe el acceso a la raíz del sitio sin una autorización más específica.

Se comprobaron doce agentes, clasificados según el contenido que ofrecen.

Agente Operador Fuentes
GPTBot OpenAI Entrenamiento
OAI-SearchBot OpenAI Citas de búsqueda de ChatGPT
ClaudeBot Anthropic formación
Claude-SearchBot Anthropic Búsqueda de citas de Claude
PerplexityBot Perplexity respuestas
DuckAssistBot DuckDuckGo respuestas
Amazonbot Amazon respuestas
CCBot Common Crawl un corpus del que se nutren muchos modelos
Google-Extended Google Entrenamiento de Gemini, no de Búsqueda
Applebot-Extended Apple formación
Bytespider ByteDance formación
meta-agente externo Meta entrenamiento

Resultados

El 77 % de estos dominios permiten todos los agentes de IA. El 23 % bloquea al menos uno.

Agente Bloqueado Dominios que lo mencionan explícitamente
Bytespider 20 % 45
CCBot 20 % 47
ClaudeBot 17 % 50
Google-Extended 16 % 46
meta-externalagent 16 % 38
PerplexityBot 15 % 44
GPTBot 14 % 53
Applebot-Extended 14 % 39
Amazonbot 13 % 39
Claude-SearchBot 10 % 22
DuckAssistBot 10 % 24
OAI-SearchBot 9 % 34

El agente bloqueado con menos frecuencia es el que recaba páginas para que ChatGPT las cite. Los agentes bloqueados con mayor frecuencia son los que recopilan datos para corpus de entrenamiento.

Conoce Ranktracker

La plataforma todo en uno para un SEO eficaz

Detrás de todo negocio de éxito hay una sólida campaña de SEO. Pero con las innumerables herramientas y técnicas de optimización que existen para elegir, puede ser difícil saber por dónde empezar. Bueno, no temas más, porque tengo justo lo que necesitas. Presentamos la plataforma todo en uno Ranktracker para un SEO eficaz

¡Por fin hemos abierto el registro a Ranktracker totalmente gratis!

Crear una cuenta gratuita

O inicia sesión con tus credenciales

Ese orden no es casual, y constituye la conclusión principal.

Nadie está cometiendo un error. Todos están tomando una decisión

Fíjate en los dos operadores que gestionan tanto un rastreador de entrenamiento como un rastreador de búsqueda.

Bloquea ambos Bloquea el entrenamiento, permite la búsqueda Bloquea la búsqueda, permite el entrenamiento
OpenAI, GPTBot / OAI-SearchBot 9 % 5 % 0 %
Anthropic, ClaudeBot / Claude-SearchBot 10 % 7 % 0

Doce dominios bloquean a GPTBot mientras permiten deliberadamente a OAI-SearchBot. Quince hacen lo mismo con Anthropic. Se trata de una política coherente: no entrenéis con mi contenido, pero sí que me citéis.

Nadie hace lo contrario.

Hay otras dos cifras que apuntan en la misma dirección. Solo cuatro dominios de toda la muestra utilizan una prohibición general de tipo «User-agent: *», y exactamente uno bloquea a un agente de IA sin nombrar explícitamente a ningún agente de IA. Quienquiera que edite estos archivos sabe qué agentes existen y qué hace cada uno.

Así pues, la advertencia del sector aborda un problema que, en esta muestra, no existe. La pregunta interesante no es si bloqueaste los agentes de búsqueda por accidente, sino si lo hiciste a propósito.

Porque el 18 % de estos dominios bloquea al menos un agente de búsqueda y el 4 % bloquea los cuatro. Esos sitios han optado por no aparecer en las respuestas de IA y, a juzgar por estas pruebas, lo han hecho a propósito.

Las 5 formas de solucionar el tuyo hoy mismo

  1. Considera el entrenamiento y la búsqueda como dos cuestiones distintas. Son decisiones diferentes y el mercado ya las ha separado. La mayoría de los editores quieren lo segundo sin lo primero. Redacta el archivo de esa forma en lugar de tratar a los «rastreadores de IA» como una sola categoría.

  2. Nombra cada agente de forma explícita. Aquí solo cuatro dominios utilizan el comodín, y por una buena razón: un simple «User-agent: * disallow» bloquea a agentes que no existían cuando lo escribiste y bloqueará a agentes que aún no existen. Dos de los agentes más bloqueados en estos resultados, Bytespider y meta-externalagent, son posteriores a la mayoría de los consejos sobre robots.txt que aún circulan.

  3. Comprueba OAI-SearchBot y Claude-SearchBot por su nombre. Estos dos determinan si puedes ser citado. El 9 % y el 10 % de la muestra los bloquean. Si te encuentras en ese grupo y no era tu intención, esta es la línea que debes modificar, y es el único elemento de esta lista que conlleva un coste inmediato en términos de visibilidad.

  4. Vuelve a realizar una auditoría cada trimestre. En el último año han aparecido nuevos agentes en varias ocasiones. Un archivo creado hace dieciocho meses tendrá entradas que faltan, por mucho cuidado que se pusiera al redactarlo en su momento.

  5. Verifica en el perímetro, no solo en el archivo. Las reglas de gestión de bots de tu CDN pueden bloquear un agente que el archivo robots.txt permita explícitamente, y el archivo no te indicará nada al respecto. Este es el fallo que escapa a un archivo robots.txt perfecto.

Un punto de partida que distingue entre las dos decisiones:

# Cítame. Estos recogen páginas para citarlas en respuestas en tiempo real.
User-agent: OAI-SearchBot
Allow: /

User-agent: Claude-SearchBot Allow: /

User-agent: PerplexityBot Allow: /

Conoce Ranktracker

La plataforma todo en uno para un SEO eficaz

Detrás de todo negocio de éxito hay una sólida campaña de SEO. Pero con las innumerables herramientas y técnicas de optimización que existen para elegir, puede ser difícil saber por dónde empezar. Bueno, no temas más, porque tengo justo lo que necesitas. Presentamos la plataforma todo en uno Ranktracker para un SEO eficaz

¡Por fin hemos abierto el registro a Ranktracker totalmente gratis!

Crear una cuenta gratuita

O inicia sesión con tus credenciales

User-agent: DuckAssistBot Allow: /

No me utilices para el entrenamiento. Cambia estas entradas a «Allow» si no estás de acuerdo.

User-agent: GPTBot Disallow: /

User-agent: ClaudeBot Disallow: /

User-agent: Google-Extended Disallow: /

User-agent: CCBot Disallow: /

Esta configuración se asemeja a la que ya utilizan entre doce y quince dominios de esta muestra. En la actualidad, se trata de una postura mayoritaria más que de una estrategia ingeniosa.

¿Por qué nada de esto aparece en un informe que ya has generado?

Search Console informa sobre Googlebot. No dice nada sobre OAI-SearchBot. Analytics informa sobre sesiones, y un motor que nunca te cita no envía sesiones que puedan faltar. Los rastreadores de posicionamiento informan sobre posiciones, y tus posiciones no se ven afectadas por nada de esto.

Conoce Ranktracker

La plataforma todo en uno para un SEO eficaz

Detrás de todo negocio de éxito hay una sólida campaña de SEO. Pero con las innumerables herramientas y técnicas de optimización que existen para elegir, puede ser difícil saber por dónde empezar. Bueno, no temas más, porque tengo justo lo que necesitas. Presentamos la plataforma todo en uno Ranktracker para un SEO eficaz

¡Por fin hemos abierto el registro a Ranktracker totalmente gratis!

Crear una cuenta gratuita

O inicia sesión con tus credenciales

Hay dos formas de detectarlo. Leer el archivo directamente, que es lo que se hizo en este estudio. O trabajar a la inversa a partir del síntoma con un verificador de visibilidad basado en IA, planteando a los motores preguntas específicas de tu categoría de forma programada y prestando atención a la respuesta que indique que no te ven en absoluto.

La auditoría de rastreadores en la que se basa este estudio es la que llevamos a cabo en Honeyb, en la que se compara cada agente mencionado en el catálogo anterior con las reglas de robots de un sitio web de forma programada, en lugar de hacerlo de forma puntual. El acceso es el primero de los cuatro aspectos que comprueba. Los otros tres son si los motores te recomiendan, qué hay que cambiar concretamente y, a continuación, producir y publicar el contenido que introduce esos cambios.

Dos limitaciones que conviene señalar

Esta muestra corresponde a las SERP comerciales de EE. UU., por lo que se inclina hacia los grandes editores y las marcas consolidadas, que cuentan tanto con el conocimiento como con el asesoramiento jurídico necesarios para tomar una decisión meditada al respecto. Es muy probable que una muestra de sitios web de pequeñas empresas presentara un panorama diferente, y es muy posible que, en ese caso, la historia del bloqueo accidental resultara ser cierta. Eso es lo que analizaremos a continuación.

Además, un archivo robots.txt registra la intención, no la aplicación. No hemos comprobado si estos dominios realmente sirven contenido a cada agente, que es donde residen las reglas de la CDN y donde suele abrirse la brecha entre el archivo y la realidad.

La plataforma en la que se basa este estudio se encuentra en honeyb.ai.

Felix Rose-Collins

Felix Rose-Collins

Ranktracker's CEO/CMO & Co-founder

Felix Rose-Collins is the Co-founder and CEO/CMO of Ranktracker. With over 15 years of SEO experience, he has single-handedly scaled the Ranktracker site to over 500,000 monthly visits, with 390,000 of these stemming from organic searches each month.

Empieza a usar Ranktracker... ¡Gratis!

Averigüe qué está impidiendo que su sitio web se clasifique.

Crear una cuenta gratuita

O inicia sesión con tus credenciales

Different views of Ranktracker app