소개
AI 크롤러에 관한 모든 기사는 똑같은 실수에 대해 경고합니다. 2023년 스크래핑 패닉 당시 GPTBot을 차단했다가, 실시간 답변에 인용할 페이지를 가져오는 최신 에이전트들까지 실수로 차단해 버렸다는 경고입니다. 훈련용 스크래퍼를 막으려던 의도였지만, 결과적으로 추천 대상에서 조용히 제외되어 버린 셈입니다.
우리는 실제로 그런 일이 일어나고 있는지 확인해 보았습니다.
219개 도메인을 조사한 결과, 그런 일은 단 한 번도 발생하지 않았습니다.
드문 일이 아닙니다. 소수의 사례도 아닙니다. 단 한 번도 없었습니다.
방법
SaaS, 전자상거래, 금융, 건강, 여행, 주택, 마케팅 등 7개 카테고리에 걸친 26개의 상업적 검색어에 대해 상위 20개의 자연 검색 결과를 추출했습니다. 이를 통해 254개의 고유 도메인이 확보되었습니다. 2026년 7월 28일, 각 도메인의 robots.txt 파일을 조회한 결과 219개가 정상적으로 확인되었습니다. 그중 7개는 robots.txt 파일을 전혀 제공하지 않았으며, 이는 모든 것을 허용하는 것으로 간주됩니다.
각 도메인에 대해 표준 우선순위 규칙을 적용하여 모든 AI 사용자 에이전트를 해당 파일과 대조했습니다. 가장 구체적인 사용자 에이전트 그룹이 우선하며, 따라서 정확한 에이전트 일치가 *보다 우선합니다. 도메인은 승리하는 그룹이 더 구체적인 허용 규칙 없이 사이트 루트를 허용하지 않을 경우, 해당 에이전트를 차단한 것으로 간주됩니다.
12개의 에이전트를 확인했으며, 이를 제공하는 콘텐츠 유형별로 분류했습니다.
| 에이전트 | 운영자 | 피드 |
| GPTBot | OpenAI | 훈련 |
| OAI-SearchBot | OpenAI | ChatGPT 검색 인용 |
| ClaudeBot | Anthropic | 훈련 |
| Claude-SearchBot | Anthropic | Claude 검색 인용문 |
| 퍼플렉시티봇 | 퍼플렉시티 | 답변 |
| DuckAssistBot | DuckDuckGo | 답변 |
| Amazonbot | Amazon | 답변 |
| CCBot | 커먼 크롤 | 많은 모델이 활용하는 코퍼스 |
| Google-Extended | 검색이 아닌 제미니 훈련용 | |
| 애플봇-익스텐디드 | Apple | 훈련 |
| 바이트스파이더 | 바이트댄스 | 교육 |
| 메타 외부 에이전트 | 메타 | 훈련 |
결과
이 도메인의 77%는 모든 AI 에이전트를 허용합니다. 23%는 적어도 하나를 차단합니다.
| 에이전트 | 차단됨 | 이를 명시적으로 지칭하는 도메인 |
| 바이트스파이더 | 20% | 45 |
| CCBot | 20% | 47 |
| ClaudeBot | 17% | 50 |
| Google-Extended | 16% | 46 |
| 메타-외부 에이전트 | 16% | 38 |
| PerplexityBot | 15% | 44 |
| GPTBot | 14% | 53 |
| Applebot-Extended | 14% | 39 |
| Amazonbot | 13% | 39 |
| Claude-SearchBot | 10% | 22 |
| DuckAssistBot | 10% | 24 |
| OAI-SearchBot | 9% | 34 |
가장 적게 차단된 에이전트는 ChatGPT가 인용할 페이지를 가져오는 에이전트입니다. 가장 자주 차단된 에이전트는 훈련용 코퍼스를 수집하기 위해 스크래핑하는 에이전트들입니다.
효과적인 SEO를 위한 올인원 플랫폼
모든 성공적인 비즈니스의 배후에는 강력한 SEO 캠페인이 있습니다. 하지만 선택할 수 있는 최적화 도구와 기법이 무수히 많기 때문에 어디서부터 시작해야 할지 알기 어려울 수 있습니다. 이제 걱정하지 마세요. 제가 도와드릴 수 있는 방법이 있으니까요. 효과적인 SEO를 위한 Ranktracker 올인원 플랫폼을 소개합니다.
이러한 순서는 우연이 아니며, 이것이 바로 이번 연구의 핵심 결론입니다.
누구도 실수를 하는 것이 아닙니다. 모두가 결정을 내리고 있는 것입니다.
훈련용 크롤러와 검색용 크롤러를 모두 운영하는 두 운영자를 살펴보세요.
| 둘 다 차단 | 훈련은 차단하고, 검색은 허용 | 검색은 차단하고, 훈련은 허용 | |
| OpenAI, GPTBot / OAI-SearchBot | 9% | 5% | 0% |
| Anthropic, ClaudeBot / Claude-SearchBot | 10% | 7% | 0% |
12개 도메인은 GPTBot을 차단하는 반면, OAI-SearchBot은 의도적으로 허용합니다. 15개 도메인은 Anthropic에 대해서도 이와 동일한 조치를 취합니다. 이는 일관된 정책입니다: ‘내 콘텐츠로 훈련하지는 마라, 하지만 인용은 해도 좋다.’
반대의 경우를 적용하는 곳은 어디에도 없습니다.
두 가지 추가 수치도 같은 방향을 가리킵니다. 전체 샘플 중 단 4개의 도메인만이 User-agent: *에 대한 전면적인 차단(disallow)을 사용하고 있으며, 정확히 한 곳만이 특정 AI 에이전트를 명시적으로 지칭하지 않은 채 AI 에이전트를 차단하고 있습니다. 이 파일들을 편집하는 사람은 어떤 에이전트가 존재하고 각 에이전트가 무엇을 하는지 알고 있습니다.
따라서 업계의 경고는 이 표본에서는 존재하지 않는 문제를 다루고 있는 셈이다. 흥미로운 질문은 검색 에이전트를 실수로 차단했는지 여부가 아니다. 의도적으로 차단했는지 여부다.
이 도메인 중 18%는 적어도 하나의 검색 에이전트를 차단하고, 4%는 네 개 모두를 차단하고 있기 때문입니다. 해당 사이트들은 AI 답변에 노출되지 않기로 선택했으며, 이 증거를 볼 때 의도적으로 그렇게 한 것입니다.
오늘 당장 문제를 해결할 수 있는 5가지 방법
-
훈련과 검색을 별개의 문제로 다루십시오. 이는 서로 다른 결정 사항이며, 시장에서도 이미 이를 구분하고 있습니다. 대부분의 게시자는 첫 번째(훈련) 없이 두 번째(검색)만을 원합니다. “AI 크롤러”를 하나의 범주로 묶는 대신, 파일을 그런 방식으로 작성하십시오.
-
모든 에이전트의 이름을 명시적으로 지정하십시오. 여기에서 와일드카드를 사용하는 도메인은 단 네 곳뿐이며, 그럴 만한 타당한 이유가 있습니다. 단순히 User-agent: * disallow만 설정하면 파일을 작성할 당시 존재하지 않았던 에이전트는 물론, 아직 존재하지 않는 에이전트까지 차단하게 됩니다. 이 결과에서 가장 많이 차단된 에이전트 중 두 가지인 Bytespider와 meta-externalagent는 현재까지도 유포되고 있는 대부분의 robots.txt 조언이 나온 시점보다 나중에 등장한 것입니다.
-
OAI-SearchBot과 Claude-SearchBot을 이름으로 직접 확인하십시오. 이 두 에이전트는 귀하의 콘텐츠가 인용될 수 있는지 여부를 결정합니다. 표본 중 9%와 10%가 이들을 차단하고 있습니다. 만약 귀하가 의도치 않게 이 그룹에 속해 있다면, 바로 이 줄을 수정해야 하며, 이는 이 목록에서 유일하게 가시성에 즉각적인 영향을 미치는 항목입니다.
-
분기별로 재검토하십시오. 지난 1년 동안 새로운 에이전트가 여러 차례 등장했습니다. 18개월 전에 작성된 파일은 당시 아무리 신중하게 작성했더라도 누락된 항목이 있을 수밖에 없습니다.
-
파일 내용뿐만 아니라 최전선에서도 확인하십시오. CDN의 봇 관리 규칙이 robots.txt에서 명시적으로 허용한 에이전트조차 차단할 수 있으며, 이 경우 파일만으로는 이를 알 수 없습니다. 이것이 바로 완벽한 robots.txt를 뚫고 발생하는 오류입니다.
두 가지 결정을 구분하는 출발점:
# 인용 허용. 이 에이전트들은 실시간 답변에 인용할 내용을 가져오기 위해 페이지를 요청합니다.
User-agent: OAI-SearchBot
Allow: /
User-agent: Claude-SearchBot
Allow: /
User-agent: PerplexityBot
Allow: /
랭크트래커를 만나보세요효과적인 SEO를 위한 올인원 플랫폼
모든 성공적인 비즈니스의 배후에는 강력한 SEO 캠페인이 있습니다. 하지만 선택할 수 있는 최적화 도구와 기법이 무수히 많기 때문에 어디서부터 시작해야 할지 알기 어려울 수 있습니다. 이제 걱정하지 마세요. 제가 도와드릴 수 있는 방법이 있으니까요. 효과적인 SEO를 위한 Ranktracker 올인원 플랫폼을 소개합니다.
User-agent: DuckAssistBot
Allow: /
학습에 사용하지 마세요. 동의하지 않는다면 이 설정들을 Allow로 변경하세요.
User-agent: GPTBot
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-agent: Google-Extended
Disallow: /
User-agent: CCBot
Disallow: /
이는 이 예시에서 이미 12~15개 도메인이 적용하고 있는 설정과 유사합니다. 이는 더 이상 독창적인 접근 방식이라기보다 는 현재 주류로 자리 잡은 입장입니다.
이미 실행 중인 보고서에는 왜 이런 내용이 나타나지 않는가
Search Console은 Googlebot에 대한 정보만 보고합니다. OAI-SearchBot에 대해서는 아무런 언급도 없습니다. Analytics는 세션을 보고하는데, 귀하의 사이트를 절대 인용하지 않는 검색 엔진은 세션을 보내지 않으므로 누락될 수 없습니다. 순위 추적 도구는 순위를 보고하며, 귀하의 순위는 이 모든 사항의 영향을 받지 않습니다.
효과적인 SEO를 위한 올인원 플랫폼
모든 성공적인 비즈니스의 배후에는 강력한 SEO 캠페인이 있습니다. 하지만 선택할 수 있는 최적화 도구와 기법이 무수히 많기 때문에 어디서부터 시작해야 할지 알기 어려울 수 있습니다. 이제 걱정하지 마세요. 제가 도와드릴 수 있는 방법이 있으니까요. 효과적인 SEO를 위한 Ranktracker 올인원 플랫폼을 소개합니다.
이를 파악하는 방법은 두 가지가 있습니다. 이 연구에서 수행한 것처럼 파일을 직접 확인하는 방법과, AI 가시성 검사기를 사용하여 증상에서 역추적하는 방법입니다. 후자의 경우, 일정대로 검색 엔진에 귀하의 카테고리에 대한 질문을 던지고, 귀하를 전혀 볼 수 없다는 답변이 나올 때까지 지켜보는 방식입니다.
이 연구의 기반이 된 크롤러 감사는 Honeyb에서 실행하는 것으로, 위 목록에 명시된 각 에이전트를 일회성이 아닌 정기적인 일정에 따라 사이트의 로봇 규칙과 대조하여 확인합니다. 접근 권한은 이 감사가 확인하는 네 가지 항목 중 첫 번째입니다. 나머지 세 가지는 검색 엔진이 귀하를 추천하는지 여부, 구체적으로 무엇을 변경해야 하는지, 그리고 변경된 콘텐츠를 제작하여 배포하는 것입니다.
명시할 가치가 있는 두 가지 한계
이 샘플은 미국 상업용 검색 결과 페이지(SERP)이므로, 이 문제에 대해 신중한 결정을 내릴 수 있는 인지도와 법률 자문을 모두 갖춘 대형 퍼블리셔 및 유명 브랜드 쪽으로 편향되어 있습니다. 소규모 비즈니스 사이트 샘플은 매우 다른 양상을 보일 가능성이 높으며, 그곳에서는 ‘의도치 않은 차단’ 사례가 실제로 발생할 수도 있습니다. 다음 단계로 해당 테스트를 진행할 예정입니다.
또한 robots.txt 파일은 의도를 기록할 뿐, 강제력을 갖는 것은 아닙니다. 우리는 해당 도메인이 실제로 각 에이전트에 콘텐츠를 제공하는지 여부를 테스트하지 않았는데, 이는 CDN 규칙이 적용되는 영역이며 파일과 현실 간의 차이가 발생하기 쉬운 부분입니다.
이 연구의 기반이 된 플랫폼은 honeyb.ai입니다.

