Introducción
Todos los artículos sobre rastreadores de IA te advierten del mismo error. Bloqueaste GPTBot durante el pánico por el scraping de 2023, según la advertencia, y sin quererlo bloqueaste también a los nuevos agentes que recogen páginas para citarlas en respuestas en tiempo real. Tu intención era detener los rastreadores de entrenamiento y, sin darte cuenta, dejaste de aparecer en las recomendaciones.
Hemos comprobado si eso está ocurriendo realmente.
En 219 dominios, no ocurrió ni una sola vez.
Ni de forma esporádica. Ni en un puñado de casos. Ni una sola vez.
Método
Tomamos los veinte primeros resultados orgánicos de 26 consultas comerciales en siete categorías: SaaS, comercio electrónico, finanzas, salud, viajes, hogar y marketing. Esto dio como resultado 254 dominios únicos. Obtuvimos el archivo robots.txt de cada uno de ellos el 28 de julio de 2026, y se resolvieron 219. Siete de ellos no proporcionaban ningún archivo robots.txt, lo que equivale a permitir todo.
Para cada dominio, comparamos todos los agentes de usuario de IA con el archivo utilizando la regla de precedencia estándar: prevalece el grupo de User-agent más específico, por lo que una coincidencia exacta de agente anula a *. Se considera que un dominio bloquea un agente cuando su grupo ganador prohíbe el acceso a la raíz del sitio sin una autorización más específica.
Se comprobaron doce agentes, clasificados según el contenido que ofrecen.
| Agente | Operador | Fuentes |
| GPTBot | OpenAI | Entrenamiento |
| OAI-SearchBot | OpenAI | Citas de búsqueda de ChatGPT |
| ClaudeBot | Anthropic | formación |
| Claude-SearchBot | Anthropic | Búsqueda de citas de Claude |
| PerplexityBot | Perplexity | respuestas |
| DuckAssistBot | DuckDuckGo | respuestas |
| Amazonbot | Amazon | respuestas |
| CCBot | Common Crawl | un corpus del que se nutren muchos modelos |
| Google-Extended | Entrenamiento de Gemini, no de Búsqueda | |
| Applebot-Extended | Apple | formación |
| Bytespider | ByteDance | formación |
| meta-agente externo | Meta | entrenamiento |
Resultados
El 77 % de estos dominios permiten todos los agentes de IA. El 23 % bloquea al menos uno.
| Agente | Bloqueado | Dominios que lo mencionan explícitamente |
| Bytespider | 20 % | 45 |
| CCBot | 20 % | 47 |
| ClaudeBot | 17 % | 50 |
| Google-Extended | 16 % | 46 |
| meta-externalagent | 16 % | 38 |
| PerplexityBot | 15 % | 44 |
| GPTBot | 14 % | 53 |
| Applebot-Extended | 14 % | 39 |
| Amazonbot | 13 % | 39 |
| Claude-SearchBot | 10 % | 22 |
| DuckAssistBot | 10 % | 24 |
| OAI-SearchBot | 9 % | 34 |
El agente bloqueado con menos frecuencia es el que recaba páginas para que ChatGPT las cite. Los agentes bloqueados con mayor frecuencia son los que recopilan datos para corpus de entrenamiento.
La plataforma todo en uno para un SEO eficaz
Detrás de todo negocio de éxito hay una sólida campaña de SEO. Pero con las innumerables herramientas y técnicas de optimización que existen para elegir, puede ser difícil saber por dónde empezar. Bueno, no temas más, porque tengo justo lo que necesitas. Presentamos la plataforma todo en uno Ranktracker para un SEO eficaz
¡Por fin hemos abierto el registro a Ranktracker totalmente gratis!
Crear una cuenta gratuitaO inicia sesión con tus credenciales
Ese orden no es casual, y constituye la conclusión principal.
Nadie está cometiendo un error. Todos están tomando una decisión
Fíjate en los dos operadores que gestionan tanto un rastreador de entrenamiento como un rastreador de búsqueda.
| Bloquea ambos | Bloquea el entrenamiento, permite la búsqueda | Bloquea la búsqueda, permite el entrenamiento | |
| OpenAI, GPTBot / OAI-SearchBot | 9 % | 5 % | 0 % |
| Anthropic, ClaudeBot / Claude-SearchBot | 10 % | 7 % | 0 |
Doce dominios bloquean a GPTBot mientras permiten deliberadamente a OAI-SearchBot. Quince hacen lo mismo con Anthropic. Se trata de una política coherente: no entrenéis con mi contenido, pero sí que me citéis.
Nadie hace lo contrario.
Hay otras dos cifras que apuntan en la misma dirección. Solo cuatro dominios de toda la muestra utilizan una prohibición general de tipo «User-agent: *», y exactamente uno bloquea a un agente de IA sin nombrar explícitamente a ningún agente de IA. Quienquiera que edite estos archivos sabe qué agentes existen y qué hace cada uno.
Así pues, la advertencia del sector aborda un problema que, en esta muestra, no existe. La pregunta interesante no es si bloqueaste los agentes de búsqueda por accidente, sino si lo hiciste a propósito.
Porque el 18 % de estos dominios bloquea al menos un agente de búsqueda y el 4 % bloquea los cuatro. Esos sitios han optado por no aparecer en las respuestas de IA y, a juzgar por estas pruebas, lo han hecho a propósito.
Las 5 formas de solucionar el tuyo hoy mismo
-
Considera el entrenamiento y la búsqueda como dos cuestiones distintas. Son decisiones diferentes y el mercado ya las ha separado. La mayoría de los editores quieren lo segundo sin lo primero. Redacta el archivo de esa forma en lugar de tratar a los «rastreadores de IA» como una sola categoría.
-
Nombra cada agente de forma explícita. Aquí solo cuatro dominios utilizan el comodín, y por una buena razón: un simple «User-agent: * disallow» bloquea a agentes que no existían cuando lo escribiste y bloqueará a agentes que aún no existen. Dos de los agentes más bloqueados en estos resultados, Bytespider y meta-externalagent, son posteriores a la mayoría de los consejos sobre robots.txt que aún circulan.
-
Comprueba OAI-SearchBot y Claude-SearchBot por su nombre. Estos dos determinan si puedes ser citado. El 9 % y el 10 % de la muestra los bloquean. Si te encuentras en ese grupo y no era tu intención, esta es la línea que debes modificar, y es el único elemento de esta lista que conlleva un coste inmediato en términos de visibilidad.
-
Vuelve a realizar una auditoría cada trimestre. En el último año han aparecido nuevos agentes en varias ocasiones. Un archivo creado hace dieciocho meses tendrá entradas que faltan, por mucho cuidado que se pusiera al redactarlo en su momento.
-
Verifica en el perímetro, no solo en el archivo. Las reglas de gestión de bots de tu CDN pueden bloquear un agente que el archivo robots.txt permita explícitamente, y el archivo no te indicará nada al respecto. Este es el fallo que escapa a un archivo robots.txt perfecto.
Un punto de partida que distingue entre las dos decisiones:
# Cítame. Estos recogen páginas para citarlas en respuestas en tiempo real.
User-agent: OAI-SearchBot
Allow: /
User-agent: Claude-SearchBot
Allow: /
User-agent: PerplexityBot
Allow: /
Conoce RanktrackerLa plataforma todo en uno para un SEO eficaz
Detrás de todo negocio de éxito hay una sólida campaña de SEO. Pero con las innumerables herramientas y técnicas de optimización que existen para elegir, puede ser difícil saber por dónde empezar. Bueno, no temas más, porque tengo justo lo que necesitas. Presentamos la plataforma todo en uno Ranktracker para un SEO eficaz
¡Por fin hemos abierto el registro a Ranktracker totalmente gratis!
Crear una cuenta gratuitaO inicia sesión con tus credenciales
User-agent: DuckAssistBot
Allow: /
No me utilices para el entrenamiento. Cambia estas entradas a «Allow» si no estás de acuerdo.
User-agent: GPTBot
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-agent: Google-Extended
Disallow: /
User-agent: CCBot
Disallow: /
Esta configuración se asemeja a la que ya utilizan entre doce y quince dominios de esta muestra. En la actualidad, se trata de una postura mayoritaria más que de una estrategia ingeniosa.
¿Por qué nada de esto aparece en un informe que ya has generado?
Search Console informa sobre Googlebot. No dice nada sobre OAI-SearchBot. Analytics informa sobre sesiones, y un motor que nunca te cita no envía sesiones que puedan faltar. Los rastreadores de posicionamiento informan sobre posiciones, y tus posiciones no se ven afectadas por nada de esto.
La plataforma todo en uno para un SEO eficaz
Detrás de todo negocio de éxito hay una sólida campaña de SEO. Pero con las innumerables herramientas y técnicas de optimización que existen para elegir, puede ser difícil saber por dónde empezar. Bueno, no temas más, porque tengo justo lo que necesitas. Presentamos la plataforma todo en uno Ranktracker para un SEO eficaz
¡Por fin hemos abierto el registro a Ranktracker totalmente gratis!
Crear una cuenta gratuitaO inicia sesión con tus credenciales
Hay dos formas de detectarlo. Leer el archivo directamente, que es lo que se hizo en este estudio. O trabajar a la inversa a partir del síntoma con un verificador de visibilidad basado en IA, planteando a los motores preguntas específicas de tu categoría de forma programada y prestando atención a la respuesta que indique que no te ven en absoluto.
La auditoría de rastreadores en la que se basa este estudio es la que llevamos a cabo en Honeyb, en la que se compara cada agente mencionado en el catálogo anterior con las reglas de robots de un sitio web de forma programada, en lugar de hacerlo de forma puntual. El acceso es el primero de los cuatro aspectos que comprueba. Los otros tres son si los motores te recomiendan, qué hay que cambiar concretamente y, a continuación, producir y publicar el contenido que introduce esos cambios.
Dos limitaciones que conviene señalar
Esta muestra corresponde a las SERP comerciales de EE. UU., por lo que se inclina hacia los grandes editores y las marcas consolidadas, que cuentan tanto con el conocimiento como con el asesoramiento jurídico necesarios para tomar una decisión meditada al respecto. Es muy probable que una muestra de sitios web de pequeñas empresas presentara un panorama diferente, y es muy posible que, en ese caso, la historia del bloqueo accidental resultara ser cierta. Eso es lo que analizaremos a continuación.
Además, un archivo robots.txt registra la intención, no la aplicación. No hemos comprobado si estos dominios realmente sirven contenido a cada agente, que es donde residen las reglas de la CDN y donde suele abrirse la brecha entre el archivo y la realidad.
La plataforma en la que se basa este estudio se encuentra en honeyb.ai.

