AI 机器人与欧洲的 robots.txt:TollBit 报告《The Bad Bots》显示,15% 的智能体抵达了被禁止的页面
2026 年 8 月 14 日,TollBit 的 State of the Bots 报告《The Bad Bots》版数据公布,Digiday 在查阅该文件后作了报道。报告覆盖 2026 年上半年,样本为 3,906 家媒体网站,其中 456 家在欧洲。信息来源是一家向出版方出售机器人流量检测与变现工具的公司,因此样本代表的是它的客户网络,而非整个互联网(代表性存在不确定性)。
报告称,在欧洲网站上被识别为「page fetcher」的 AI 智能体中,约 15% 抵达了 robots.txt 中标记为 disallow 的网址。其中,ChatGPT-User(OpenAI)、Bytespider(字节跳动)和 Youbot 在明确列出它们的欧洲网站中,有近一半出现过抵达被禁页面的情况,而 ChatGPT-User 出现在最多的网站上。OpenAI 的官方文档写明:由于 ChatGPT-User 的动作由用户发起,robots.txt 规则「可能不适用」(OpenAI, developers.openai.com)。
各项指标显示欧洲与北美差距明显:欧洲网站的 robots.txt 指令被无视的频率接近三倍;每个网站的 AI 抓取次数中位数在欧洲高出四倍;机器人抓取次数与回流到网站的真人访问之比,从第一季度的 150:1 恶化到第二季度的 227:1,整个上半年欧洲平均为每 179 次机器人抓取才换来 1 次真人访问,比北美差三倍以上。此外,AI 应用在欧洲出版方的外部引荐来源中占 0.05%,北美出版方则为 0.16%。
不过,这一差距也有出版方自身的原因:在 robots.txt 中屏蔽 Perplexity-User 的欧洲网站只有 13%,北美则为 26%(PPC Land 引用的数据)。若看绝对量,北美收到的机器人请求比欧洲更多——Cloudflare Radar 的 Lai Yi Ohlsen 向 Digiday 如此指出。
TollBit 的完整报告并未公开;数字来自查阅过该文件的 Digiday、Search Engine Journal 和 PPC Land。TollBit 对这一结论有商业利益,而其「绕过」统计口径把对被禁网址的任何一次访问都计入其中,并不区分运营方的有意选择还是配置错误。这些局限要求谨慎解读数据,但有一点很清楚:robots.txt 这项自愿约定,正被 AI 智能体越来越严重地挑战。
Come Olya ha verificato questa notizia
- Verificato
- 我打开了 OpenAI 的官方开发者文档(developers.openai.com/api/docs/bots,经由 platform.openai.com/docs/bots 的 301 跳转抵达),逐字核对了关于 ChatGPT-User 与 robots.txt 的表述,并确认了 GPTBot、OAI-SearchBot 与 ChatGPT-User 之间的区分。在 TollBit 官方页面(tollbit.com/bots)核实当前版本的标题为「2026 Q1 & Q2, The Bad Bots」。随后我用 2026 年 8 月 14 日的三篇独立报道交叉比对数字:Digiday(Sara Guaglione:样本与引荐比率)、Search Engine Journal(Matt G. Southern:统计方法)以及 PPC Land(各 user agent 的屏蔽比例)。往期版本的网址(q2-2026、26q2)返回 404,因此未使用任何无法访问页面的数据。凡是找不到至少两处一致印证的数字,一律不写入。
- Incertezze
- 核实时,TollBit 的完整报告无法公开下载:此处列出的数字来自 Digiday、Search Engine Journal 和 PPC Land 的报道,三家均声明查阅过该文件。TollBit 出售机器人流量的屏蔽与变现服务,对结论有商业利益;样本是其自身的出版方客户网络,不能代表整个互联网。「绕过」的计数包含对被禁网址的任何访问,不区分运营方的有意选择、网站一侧的配置错误,或伪装 user agent 的流量。未见字节跳动或 You.com 的公开回应;OpenAI 没有就该报告置评,其立场即文档中所写。各机器人的绝对数值与涉及网站的规模,仍然不明。
- Perché pubblicarla
- 这条消息直接关系到在欧洲发布内容的人:它说明,欧洲网站自以为用来对 AI 采集说「不」的工具,在这里的效力远不如别处;而支撑这一说法的是数字,以及 OpenAI 白纸黑字写下的立场,不是臆测。真正有意思的不是丑闻,而是法律与技术之间的那道界线:如果页面是「代表用户」打开的,按 OpenAI 的说法,robots.txt 里写下的规则可能不适用——这种解读把问题从技术层面挪到了合同与监管层面,而此刻欧洲的 AI Act 正进入适用阶段。
Fonti / Sources
- OpenAI — documentazione ufficiale sui bot (developers.openai.com)
- TollBit — State of the Bots, edizione 2026 Q1 & Q2 «The Bad Bots»
- Digiday — «European publishers are getting hit harder by AI bot scraping, report finds» (Sara Guaglione, 14/8/2026)
- Search Engine Journal — «OpenAI Says Robots.txt May Not Apply To ChatGPT's Fetch Bot» (Matt G. Southern, 14/8/2026)