• SEO com IA

As 5 melhores maneiras de corrigir o arquivo robots.txt para rastreadores de IA, após verificar 219 domínios

  • Felix Rose-Collins
  • 5 min read

Introdução

Todos os artigos sobre rastreadores de IA alertam sobre o mesmo erro. Você bloqueou o GPTBot durante o pânico de scraping de 2023, diz o alerta, e acabou bloqueando acidentalmente os agentes mais recentes que buscam páginas para citar em respostas em tempo real. Sua intenção era impedir os rastreadores de treinamento e, sem perceber, você deixou de receber recomendações.

Verificamos se isso realmente está acontecendo.

Em 219 domínios, isso não aconteceu nenhuma vez.

Não foi raro. Não foi em alguns casos. Nem uma única vez.

Método

Selecionamos os vinte principais resultados orgânicos para 26 consultas comerciais em sete categorias: SaaS, comércio eletrônico, finanças, saúde, viagens, casa e marketing. Isso resultou em 254 domínios únicos. Buscamos o arquivo robots.txt de cada um deles em 28 de julho de 2026, e 219 foram resolvidos. Sete deles não apresentavam nenhum arquivo robots.txt, o que equivale a permitir tudo.

Para cada domínio, verificamos todos os agentes de usuário de IA em relação ao arquivo usando a regra de precedência padrão: o grupo de User-agent mais específico prevalece, portanto, uma correspondência exata de agente substitui *. Um domínio é considerado como bloqueador de um agente quando seu grupo vencedor proíbe o acesso à raiz do site sem uma permissão mais específica.

Foram verificados doze agentes, divididos de acordo com o tipo de conteúdo que alimentam.

Agente Operador Feeds
GPTBot OpenAI treinamento
OAI-SearchBot OpenAI Citações de pesquisa do ChatGPT
ClaudeBot Anthropic treinamento
Claude-SearchBot Anthropic Pesquisa de citações do Claude
PerplexityBot Perplexity respostas
DuckAssistBot DuckDuckGo respostas
Amazonbot Amazon respostas
CCBot Common Crawl um corpus utilizado por muitos modelos
Google-Extended Google Treinamento do Gemini, não da Pesquisa
Applebot-Extended Apple treinamento
Bytespider ByteDance treinamento
meta-agente externo Meta treinamento

Resultados

77% desses domínios permitem todos os agentes de IA. Vinte e três por cento bloqueiam pelo menos um.

Agente Bloqueado Domínios que o mencionam explicitamente
Bytespider 20% 45
CCBot 20% 47
ClaudeBot 17% 50
Google-Extended 16% 46
meta-agente externo 16% 38
PerplexityBot 15% 44
GPTBot 14% 53
Applebot-Extended 14% 39
Amazonbot 13% 39
Claude-SearchBot 10% 22
DuckAssistBot 10% 24
OAI-SearchBot 9% 34

O agente bloqueado com menos frequência é aquele que busca páginas para o ChatGPT citar. Os agentes bloqueados com mais frequência são aqueles que coletam dados para corpora de treinamento.

Conheça o Ranktracker

A plataforma All-in-One para uma SEO eficaz

Por trás de cada negócio de sucesso está uma forte campanha de SEO. Mas com inúmeras ferramentas e técnicas de otimização por aí para escolher, pode ser difícil saber por onde começar. Bem, não tenha mais medo, porque eu tenho exatamente o que ajudar. Apresentando a plataforma multifuncional Ranktracker para uma SEO eficaz

Finalmente abrimos o registro para o Ranktracker absolutamente grátis!

Criar uma conta gratuita

Ou faça login usando suas credenciais

Essa ordem não é por acaso, e é toda a conclusão.

Ninguém está cometendo um erro. Todos estão tomando uma decisão

Observe os dois operadores que administram tanto um rastreador de treinamento quanto um rastreador de busca.

Bloqueia ambos Bloqueia o treinamento, permite a pesquisa Bloqueia a pesquisa, permite o treinamento
OpenAI, GPTBot / OAI-SearchBot 9% 5% 0%
Anthropic, ClaudeBot / Claude-SearchBot 10% 7% 0%

Doze domínios bloqueiam o GPTBot enquanto permitem deliberadamente o OAI-SearchBot. Quinze fazem o equivalente com o Anthropic. Essa é uma política coerente: não treinem com meu conteúdo, mas citem-me.

Ninguém faz o contrário.

Mais dois números apontam na mesma direção. Apenas quatro domínios em toda a amostra usam uma proibição geral do tipo User-agent: *, e exatamente um bloqueia um agente de IA sem nomear explicitamente nenhum agente de IA. Quem quer que edite esses arquivos sabe quais agentes existem e o que cada um faz.

Portanto, o alerta do setor aborda um problema que, nesta amostra, não existe. A questão interessante não é se você bloqueou os agentes de busca por acidente. É se você fez isso de propósito.

Porque 18% desses domínios bloqueiam pelo menos um agente de busca e 4% bloqueiam todos os quatro. Esses sites optaram por não aparecer nas respostas de IA e, com base nessas evidências, fizeram isso de propósito.

As 5 maneiras de corrigir o seu hoje mesmo

  1. Trate o treinamento e a pesquisa como duas questões distintas. São decisões diferentes, e o mercado já as separou. A maioria dos editores quer a segunda sem a primeira. Escreva o arquivo dessa forma, em vez de tratar os “rastreadores de IA” como uma única categoria.

  2. Nomeie cada agente explicitamente. Apenas quatro domínios aqui dependem do curinga, e por um bom motivo: um simples User-agent: * disallow bloqueia agentes que não existiam quando você o escreveu e bloqueará agentes que ainda não existem. Dois dos agentes mais bloqueados nesses resultados, Bytespider e meta-externalagent, são posteriores à maioria das recomendações sobre o robots.txt que ainda circulam.

  3. Verifique o OAI-SearchBot e o Claude-SearchBot pelo nome. Esses dois determinam se você pode ser citado. Nove e dez por cento da amostra os bloqueiam. Se você está nesse grupo e não tinha essa intenção, essa é a linha a ser alterada, e é o único item desta lista com um custo imediato de visibilidade.

  4. Faça uma nova auditoria trimestralmente. Novos agentes surgiram várias vezes no último ano. Um arquivo criado há dezoito meses está com entradas faltando, por mais cuidado que tenha sido tomado na hora da criação.

  5. Verifique na borda, não apenas no arquivo. As regras de gerenciamento de bots em sua CDN podem bloquear um agente que o robots.txt permite explicitamente, e o arquivo não indicará nada a respeito. Essa é a falha que sobrevive a um robots.txt perfeito.

Um ponto de partida que distingue as duas decisões:

# Cite-me. Esses agentes buscam páginas para citar em respostas em tempo real.
User-agent: OAI-SearchBot
Allow: /

User-agent: Claude-SearchBot Allow: /

User-agent: PerplexityBot Allow: /

Conheça o Ranktracker

A plataforma All-in-One para uma SEO eficaz

Por trás de cada negócio de sucesso está uma forte campanha de SEO. Mas com inúmeras ferramentas e técnicas de otimização por aí para escolher, pode ser difícil saber por onde começar. Bem, não tenha mais medo, porque eu tenho exatamente o que ajudar. Apresentando a plataforma multifuncional Ranktracker para uma SEO eficaz

Finalmente abrimos o registro para o Ranktracker absolutamente grátis!

Criar uma conta gratuita

Ou faça login usando suas credenciais

User-agent: DuckAssistBot Allow: /

Não me use para treinamento. Altere essas configurações para “Allow” se você discordar.

User-agent: GPTBot Disallow: /

User-agent: ClaudeBot Disallow: /

User-agent: Google-Extended Disallow: /

User-agent: CCBot Disallow: /

Essa configuração é semelhante à que já é utilizada por doze a quinze domínios neste exemplo. Atualmente, trata-se de uma prática comum, e não de uma estratégia inovadora.

Por que nada disso aparece em um relatório que você já executa

O Search Console relata o Googlebot. Ele não menciona nada sobre o OAI-SearchBot. O Analytics relata sessões, e um mecanismo que nunca cita seu site não envia sessões que possam estar faltando. Os rastreadores de classificação relatam posições, e suas posições não são afetadas por nada disso.

Conheça o Ranktracker

A plataforma All-in-One para uma SEO eficaz

Por trás de cada negócio de sucesso está uma forte campanha de SEO. Mas com inúmeras ferramentas e técnicas de otimização por aí para escolher, pode ser difícil saber por onde começar. Bem, não tenha mais medo, porque eu tenho exatamente o que ajudar. Apresentando a plataforma multifuncional Ranktracker para uma SEO eficaz

Finalmente abrimos o registro para o Ranktracker absolutamente grátis!

Criar uma conta gratuita

Ou faça login usando suas credenciais

Há duas maneiras de detectar isso. Ler o arquivo diretamente, que foi o que este estudo fez. Ou trabalhar de trás para frente a partir do sintoma com um verificador de visibilidade baseado em IA, fazendo perguntas específicas sobre sua categoria aos mecanismos de busca em intervalos programados e observando se a resposta indica que eles não conseguem enxergar seu site de forma alguma.

A auditoria de rastreadores por trás deste estudo é a que executamos no Honeyb, comparando cada agente nomeado no catálogo acima com as regras de robôs de um site de forma programada, em vez de pontualmente. O acesso é o primeiro dos quatro itens que ela verifica. Os outros três são: se os mecanismos de busca recomendam você, o que especificamente deve ser alterado e, por fim, a produção e publicação do conteúdo que promove essas alterações.

Duas limitações que vale a pena mencionar

Essa amostra refere-se às SERPs comerciais dos EUA, portanto, apresenta um viés em favor de grandes editoras e marcas estabelecidas, que possuem tanto o conhecimento quanto a assessoria jurídica para tomar uma decisão ponderada nesse contexto. Uma amostra de sites de pequenas empresas provavelmente seria bem diferente, e a história do bloqueio acidental poderia muito bem se confirmar nesse caso. Faremos esse teste em seguida.

Além disso, um arquivo robots.txt registra a intenção, não a aplicação. Não testamos se esses domínios realmente fornecem conteúdo a cada agente, que é onde residem as regras de CDN e onde a lacuna entre o arquivo e a realidade tende a se abrir.

A plataforma por trás deste estudo está em honeyb.ai.

Felix Rose-Collins

Felix Rose-Collins

Ranktracker's CEO/CMO & Co-founder

Felix Rose-Collins is the Co-founder and CEO/CMO of Ranktracker. With over 15 years of SEO experience, he has single-handedly scaled the Ranktracker site to over 500,000 monthly visits, with 390,000 of these stemming from organic searches each month.

Comece a usar o Ranktracker... De graça!

Descubra o que está impedindo o seu site de voltar ao ranking.

Criar uma conta gratuita

Ou faça login usando suas credenciais

Different views of Ranktracker app