Introdução
Todos os artigos sobre rastreadores de IA alertam sobre o mesmo erro. Você bloqueou o GPTBot durante o pânico de scraping de 2023, diz o alerta, e acabou bloqueando acidentalmente os agentes mais recentes que buscam páginas para citar em respostas em tempo real. Sua intenção era impedir os rastreadores de treinamento e, sem perceber, você deixou de receber recomendações.
Verificamos se isso realmente está acontecendo.
Em 219 domínios, isso não aconteceu nenhuma vez.
Não foi raro. Não foi em alguns casos. Nem uma única vez.
Método
Selecionamos os vinte principais resultados orgânicos para 26 consultas comerciais em sete categorias: SaaS, comércio eletrônico, finanças, saúde, viagens, casa e marketing. Isso resultou em 254 domínios únicos. Buscamos o arquivo robots.txt de cada um deles em 28 de julho de 2026, e 219 foram resolvidos. Sete deles não apresentavam nenhum arquivo robots.txt, o que equivale a permitir tudo.
Para cada domínio, verificamos todos os agentes de usuário de IA em relação ao arquivo usando a regra de precedência padrão: o grupo de User-agent mais específico prevalece, portanto, uma correspondência exata de agente substitui *. Um domínio é considerado como bloqueador de um agente quando seu grupo vencedor proíbe o acesso à raiz do site sem uma permissão mais específica.
Foram verificados doze agentes, divididos de acordo com o tipo de conteúdo que alimentam.
| Agente | Operador | Feeds |
| GPTBot | OpenAI | treinamento |
| OAI-SearchBot | OpenAI | Citações de pesquisa do ChatGPT |
| ClaudeBot | Anthropic | treinamento |
| Claude-SearchBot | Anthropic | Pesquisa de citações do Claude |
| PerplexityBot | Perplexity | respostas |
| DuckAssistBot | DuckDuckGo | respostas |
| Amazonbot | Amazon | respostas |
| CCBot | Common Crawl | um corpus utilizado por muitos modelos |
| Google-Extended | Treinamento do Gemini, não da Pesquisa | |
| Applebot-Extended | Apple | treinamento |
| Bytespider | ByteDance | treinamento |
| meta-agente externo | Meta | treinamento |
Resultados
77% desses domínios permitem todos os agentes de IA. Vinte e três por cento bloqueiam pelo menos um.
| Agente | Bloqueado | Domínios que o mencionam explicitamente |
| Bytespider | 20% | 45 |
| CCBot | 20% | 47 |
| ClaudeBot | 17% | 50 |
| Google-Extended | 16% | 46 |
| meta-agente externo | 16% | 38 |
| PerplexityBot | 15% | 44 |
| GPTBot | 14% | 53 |
| Applebot-Extended | 14% | 39 |
| Amazonbot | 13% | 39 |
| Claude-SearchBot | 10% | 22 |
| DuckAssistBot | 10% | 24 |
| OAI-SearchBot | 9% | 34 |
O agente bloqueado com menos frequência é aquele que busca páginas para o ChatGPT citar. Os agentes bloqueados com mais frequência são aqueles que coletam dados para corpora de treinamento.
A plataforma All-in-One para uma SEO eficaz
Por trás de cada negócio de sucesso está uma forte campanha de SEO. Mas com inúmeras ferramentas e técnicas de otimização por aí para escolher, pode ser difícil saber por onde começar. Bem, não tenha mais medo, porque eu tenho exatamente o que ajudar. Apresentando a plataforma multifuncional Ranktracker para uma SEO eficaz
Finalmente abrimos o registro para o Ranktracker absolutamente grátis!
Criar uma conta gratuitaOu faça login usando suas credenciais
Essa ordem não é por acaso, e é toda a conclusão.
Ninguém está cometendo um erro. Todos estão tomando uma decisão
Observe os dois operadores que administram tanto um rastreador de treinamento quanto um rastreador de busca.
| Bloqueia ambos | Bloqueia o treinamento, permite a pesquisa | Bloqueia a pesquisa, permite o treinamento | |
| OpenAI, GPTBot / OAI-SearchBot | 9% | 5% | 0% |
| Anthropic, ClaudeBot / Claude-SearchBot | 10% | 7% | 0% |
Doze domínios bloqueiam o GPTBot enquanto permitem deliberadamente o OAI-SearchBot. Quinze fazem o equivalente com o Anthropic. Essa é uma política coerente: não treinem com meu conteúdo, mas citem-me.
Ninguém faz o contrário.
Mais dois números apontam na mesma direção. Apenas quatro domínios em toda a amostra usam uma proibição geral do tipo User-agent: *, e exatamente um bloqueia um agente de IA sem nomear explicitamente nenhum agente de IA. Quem quer que edite esses arquivos sabe quais agentes existem e o que cada um faz.
Portanto, o alerta do setor aborda um problema que, nesta amostra, não existe. A questão interessante não é se você bloqueou os agentes de busca por acidente. É se você fez isso de propósito.
Porque 18% desses domínios bloqueiam pelo menos um agente de busca e 4% bloqueiam todos os quatro. Esses sites optaram por não aparecer nas respostas de IA e, com base nessas evidências, fizeram isso de propósito.
As 5 maneiras de corrigir o seu hoje mesmo
-
Trate o treinamento e a pesquisa como duas questões distintas. São decisões diferentes, e o mercado já as separou. A maioria dos editores quer a segunda sem a primeira. Escreva o arquivo dessa forma, em vez de tratar os “rastreadores de IA” como uma única categoria.
-
Nomeie cada agente explicitamente. Apenas quatro domínios aqui dependem do curinga, e por um bom motivo: um simples User-agent: * disallow bloqueia agentes que não existiam quando você o escreveu e bloqueará agentes que ainda não existem. Dois dos agentes mais bloqueados nesses resultados, Bytespider e meta-externalagent, são posteriores à maioria das recomendações sobre o robots.txt que ainda circulam.
-
Verifique o OAI-SearchBot e o Claude-SearchBot pelo nome. Esses dois determinam se você pode ser citado. Nove e dez por cento da amostra os bloqueiam. Se você está nesse grupo e não tinha essa intenção, essa é a linha a ser alterada, e é o único item desta lista com um custo imediato de visibilidade.
-
Faça uma nova auditoria trimestralmente. Novos agentes surgiram várias vezes no último ano. Um arquivo criado há dezoito meses está com entradas faltando, por mais cuidado que tenha sido tomado na hora da criação.
-
Verifique na borda, não apenas no arquivo. As regras de gerenciamento de bots em sua CDN podem bloquear um agente que o robots.txt permite explicitamente, e o arquivo não indicará nada a respeito. Essa é a falha que sobrevive a um robots.txt perfeito.
Um ponto de partida que distingue as duas decisões:
# Cite-me. Esses agentes buscam páginas para citar em respostas em tempo real.
User-agent: OAI-SearchBot
Allow: /
User-agent: Claude-SearchBot
Allow: /
User-agent: PerplexityBot
Allow: /
Conheça o RanktrackerA plataforma All-in-One para uma SEO eficaz
Por trás de cada negócio de sucesso está uma forte campanha de SEO. Mas com inúmeras ferramentas e técnicas de otimização por aí para escolher, pode ser difícil saber por onde começar. Bem, não tenha mais medo, porque eu tenho exatamente o que ajudar. Apresentando a plataforma multifuncional Ranktracker para uma SEO eficaz
Finalmente abrimos o registro para o Ranktracker absolutamente grátis!
Criar uma conta gratuitaOu faça login usando suas credenciais
User-agent: DuckAssistBot
Allow: /
Não me use para treinamento. Altere essas configurações para “Allow” se você discordar.
User-agent: GPTBot
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-agent: Google-Extended
Disallow: /
User-agent: CCBot
Disallow: /
Essa configuração é semelhante à que já é utilizada por doze a quinze domínios neste exemplo. Atualmente, trata-se de uma prática comum, e não de uma estratégia inovadora.
Por que nada disso aparece em um relatório que você já executa
O Search Console relata o Googlebot. Ele não menciona nada sobre o OAI-SearchBot. O Analytics relata sessões, e um mecanismo que nunca cita seu site não envia sessões que possam estar faltando. Os rastreadores de classificação relatam posições, e suas posições não são afetadas por nada disso.
A plataforma All-in-One para uma SEO eficaz
Por trás de cada negócio de sucesso está uma forte campanha de SEO. Mas com inúmeras ferramentas e técnicas de otimização por aí para escolher, pode ser difícil saber por onde começar. Bem, não tenha mais medo, porque eu tenho exatamente o que ajudar. Apresentando a plataforma multifuncional Ranktracker para uma SEO eficaz
Finalmente abrimos o registro para o Ranktracker absolutamente grátis!
Criar uma conta gratuitaOu faça login usando suas credenciais
Há duas maneiras de detectar isso. Ler o arquivo diretamente, que foi o que este estudo fez. Ou trabalhar de trás para frente a partir do sintoma com um verificador de visibilidade baseado em IA, fazendo perguntas específicas sobre sua categoria aos mecanismos de busca em intervalos programados e observando se a resposta indica que eles não conseguem enxergar seu site de forma alguma.
A auditoria de rastreadores por trás deste estudo é a que executamos no Honeyb, comparando cada agente nomeado no catálogo acima com as regras de robôs de um site de forma programada, em vez de pontualmente. O acesso é o primeiro dos quatro itens que ela verifica. Os outros três são: se os mecanismos de busca recomendam você, o que especificamente deve ser alterado e, por fim, a produção e publicação do conteúdo que promove essas alterações.
Duas limitações que vale a pena mencionar
Essa amostra refere-se às SERPs comerciais dos EUA, portanto, apresenta um viés em favor de grandes editoras e marcas estabelecidas, que possuem tanto o conhecimento quanto a assessoria jurídica para tomar uma decisão ponderada nesse contexto. Uma amostra de sites de pequenas empresas provavelmente seria bem diferente, e a história do bloqueio acidental poderia muito bem se confirmar nesse caso. Faremos esse teste em seguida.
Além disso, um arquivo robots.txt registra a intenção, não a aplicação. Não testamos se esses domínios realmente fornecem conteúdo a cada agente, que é onde residem as regras de CDN e onde a lacuna entre o arquivo e a realidade tende a se abrir.
A plataforma por trás deste estudo está em honeyb.ai.

