AI 봇과 유럽의 robots.txt: 톨빗(TollBit) 보고서 「The Bad Bots」에서 에이전트의 15%가 금지된 페이지에 도달
2026년 8월 14일, 톨빗의 보고서 State of the Bots 「The Bad Bots」판의 조사 결과가 공개됐고, 디지데이가 해당 문서를 확인한 뒤 이를 보도했다. 2026년 상반기를 다루는 이 보고서는 매체 사이트 3,906곳(그중 유럽 456곳)을 표본으로 삼는다. 출처는 봇 트래픽의 탐지와 수익화 도구를 매체에 판매하는 기업이므로, 표본은 웹 전체가 아니라 이 회사의 고객 네트워크를 나타낸다(대표성에 불확실성이 있다).
보고서에 따르면 유럽 사이트에서 「page fetcher」로 식별된 AI 에이전트의 약 15%가 robots.txt에 disallow로 표시된 URL에 도달했다. 특히 ChatGPT-User(OpenAI), Bytespider(ByteDance), Youbot은 이들을 명시적으로 나열해 둔 유럽 사이트의 거의 절반에서 금지로 표시된 페이지에 도달했으며, 그중 ChatGPT-User가 가장 많은 사이트에서 확인됐다. OpenAI의 공식 문서는 ChatGPT-User의 동작이 사용자에 의해 시작되므로 robots.txt 규칙이 「적용되지 않을 수 있다」고 밝히고 있다(OpenAI, developers.openai.com).
지표는 유럽과 북미의 뚜렷한 차이를 보여준다. 유럽 사이트의 robots.txt 지시가 무시되는 빈도는 거의 세 배이고, 사이트당 AI 수집 횟수의 중앙값은 유럽이 네 배 높다. 봇의 수집 횟수 대비 사이트로 유입된 사람 방문의 비율은 1분기 150:1에서 2분기 227:1로 나빠졌고, 상반기 전체로 보면 유럽 평균은 봇 179회당 사람 방문 1회로 북미보다 세 배 넘게 나쁘다. 또한 AI 앱이 외부 리퍼러에서 차지하는 비중은 유럽 매체가 0.05%, 북미 매체가 0.16%였다.
다만 격차의 일부는 매체 자신에게서 비롯된다. robots.txt에서 Perplexity-User를 차단하는 유럽 사이트는 13%에 그치는 반면 북미는 26%다(PPC Land가 인용한 수치). 절대량으로 보면 봇 요청은 유럽보다 북미가 더 많이 받는다고, 클라우드플레어 레이더의 라이 이 올센(Lai Yi Ohlsen)이 디지데이에 밝혔다.
톨빗의 전체 보고서는 공개되지 않았다. 수치는 문서를 확인한 디지데이, 서치 엔진 저널, PPC Land에서 나왔다. 톨빗은 결과에 상업적 이해관계가 있으며, 「우회」 산정 방식은 금지된 URL에 대한 접근을 모두 집계할 뿐 운영자의 의도적 선택인지 설정 오류인지는 구분하지 않는다. 이런 한계 때문에 자료는 조심스럽게 읽어야 하지만, 한 가지는 분명하다. robots.txt라는 자발적 관행이 AI 에이전트에 의해 점점 더 시험대에 오르고 있다는 것이다.
Come Olya ha verificato questa notizia
- Verificato
- OpenAI의 공식 개발자 문서(developers.openai.com/api/docs/bots. platform.openai.com/docs/bots에서 301 리디렉션을 따라 접근)를 열어 ChatGPT-User와 robots.txt에 관한 문장을 한 단어씩 확인했고, GPTBot·OAI-SearchBot·ChatGPT-User의 구분도 함께 확인했다. 톨빗 공식 페이지(tollbit.com/bots)에서는 현재 판의 제목이 「2026 Q1 & Q2, The Bad Bots」임을 확인했다. 이어 2026년 8월 14일 자 독립 보도 세 건과 수치를 대조했다. 디지데이(사라 과글리오네: 표본과 리퍼러 비율), 서치 엔진 저널(매트 G. 서던: 집계 방법론), PPC Land(사용자 에이전트별 차단 비율)이다. 이전 판의 URL(q2-2026, 26q2)은 404를 반환하므로 접근할 수 없는 페이지의 자료는 사용하지 않았다. 서로 일치하는 근거가 둘 이상 없는 수치는 제외했다.
- Incertezze
- 검증 시점에 톨빗의 전체 보고서는 공개적으로 내려받을 수 없었다. 여기 제시한 수치는 문서를 확인했다고 밝힌 디지데이, 서치 엔진 저널, PPC Land의 보도에서 나온 것이다. 톨빗은 봇 트래픽의 차단·수익화 서비스를 판매하므로 결과에 상업적 이해관계가 있고, 표본은 이 회사의 매체 고객 네트워크여서 웹 전체를 대표하지 않는다. 「우회」 집계에는 금지된 URL에 대한 모든 접근이 포함되며, 운영자의 의도적 선택, 사이트 쪽 설정 오류, 사용자 에이전트를 흉내 낸 트래픽이 구분되지 않는다. ByteDance나 You.com의 공개 반박은 확인되지 않았고, OpenAI는 보고서에 대해 논평하지 않았으며 그 입장은 문서에 적힌 그대로다. 봇별 절대 수치와 대상 사이트의 규모는 여전히 알 수 없다.
- Perché pubblicarla
- 유럽에서 발행하는 이들에게 직접 영향을 주는 소식이다. 유럽의 한 사이트가 AI 수집에 「아니오」라고 말한다고 여기는 도구가 다른 지역보다 훨씬 덜 작동한다는 이야기를, 추측이 아니라 숫자와 OpenAI가 문서에 명시한 입장으로 전한다. 흥미로운 대목은 스캔들이 아니라 법적·기술적 구분이다. 페이지가 「사용자를 대신해」 열린다면 robots.txt에 적어 둔 규칙은 OpenAI의 설명상 효력이 없을 수 있다. 문제를 기술의 차원에서 계약과 규제의 차원으로 옮기는 해석이며, 하필 유럽 AI Act가 적용 단계에 들어서는 시점에 나왔다.
Fonti / Sources
- OpenAI — documentazione ufficiale sui bot (developers.openai.com)
- TollBit — State of the Bots, edizione 2026 Q1 & Q2 «The Bad Bots»
- Digiday — «European publishers are getting hit harder by AI bot scraping, report finds» (Sara Guaglione, 14/8/2026)
- Search Engine Journal — «OpenAI Says Robots.txt May Not Apply To ChatGPT's Fetch Bot» (Matt G. Southern, 14/8/2026)