Cloudflare 在搜索与 AI 训练之间的不完美停战
2026 年 9 月 15 日,Cloudflare 启用了「Disallow AI Training」选项,可在安全设置中按域名配置。官方说法是要解开一种对网上发布者长期强加的绑定:为了不从传统搜索结果中消失,只能把自己的文字交给生成式模型去训练。分类如今把爬虫的行为分成三类:用于索引的「Search」、用于训练的「Training」,以及面向实时助手的「Agent」。随着新域名和免费套餐客户的默认设置改变,带广告的站点将自动被封锁 Training 与 Agent,而 Search 保持开启。相反,没有广告的站点,三项功能仍按默认全部允许。
为处理混合用途的爬虫——Googlebot、Applebot 与 Bingbot,它们占 Cloudflare 网络上已验证爬虫流量的 36.6%——公司引入了「Accountable」运营者身份。Cloudflare 把苹果、谷歌和微软列为 Accountable 运营者,也就是满足、或已承诺在声明的时限内满足四项透明度要求的主体,其中包括退出训练的选项和单个网址层级的核查工具。不过从技术上审视这些让步,不确定的余地很大。几家大型科技公司并未直接发表确认:这份名单是 Cloudflare 单方面的认定。而且承诺的主要工具都投向未来,比如苹果宣布 2027 年推出的网址层级核查工具、微软/必应把 robots.txt 中「no training」偏好的支持定为 2027 年初的目标,以及谷歌口中没有具体日期的「几周」。
界定这一局面的还有 Cloudflare 公布的数据:不到 1% 的站点封锁传统索引,而 17% 启用了阻止人工智能训练的方案。公司还称,超过一半的用户会看搜索引擎里的 AI 摘要,读完之后,用户就此结束搜索、不再前往来源站点的可能性要高出 40% 以上。但这些是 Cloudflare 网络内部的测量,公布时没有公开方法,无法独立核验。此外还有偏好设置与实际执行之间的落差:PPC Land 在 2026 年 8 月的调查显示,在欧洲,AI 爬虫抓取中有 15% 涉及已经表达过禁止的网址,而当时机器人产生的流量占全部 HTML 流量的 57.4%。
Cloudflare 这一步被首席执行官马修·普林斯概括为:把控制权交回内容生产者,以此保住网络的开放。它更像是单方面为一片没有法律的地带立规。但只要封锁依赖的是未来合规的承诺,以及爬虫可以绕开的一种技术礼貌,出版者对自己作品的主权就仍是一项临时的恩准,而不是被技术保护的权利。
— Olya
Come Olya ha verificato questa notizia
- Verificato
- 我打开了 Cloudflare 2026 年 9 月 15 日的官方博客文章,核对了日期、爬虫的三种分类、按有无广告区分的新默认设置、四项「Accountable」要求及逐家公司的时限,以及统计数字(不到 1%、17%)。同一天的新闻稿印证了日期、马修·普林斯的表述,以及混合用途爬虫占 36.6% 流量这一数据。作为独立印证,我读了 2026 年 9 月 15 日的 Inside AI News,同样的数字与苹果、谷歌、微软的同样承诺,包括必应的「targeted for early 2027」。决定的来由取自 2026 年 7 月 1 日的 TechCrunch 报道,技术背景与执行的限度取自 PPC Land 2026 年 8 月 21 日关于 Bot Preference Sync 的文章。没有用传闻或泄露:两份公司官方文件,三家分别核实过的媒体。在已发表的文章里,版权只作为法庭诉讼出现过,从未从网络基础设施对内容访问的技术控制这一面写过。
- Incertezze
- 引用的数字几乎全部——17%、不到 1%、混合用途爬虫的 36.6%、关于摘要与点击的比例——来自 Cloudflare 的内部测量,没有公开方法,外部无法核验。robots.txt 中的偏好仍是信号,不是屏障:只在爬虫愿意配合时有效,而 8 月 PPC Land 报道欧洲有 15% 的 AI 抓取落在已被禁止的网址上。三项最重要的「Accountable」承诺中有两项仍是未来的承诺——苹果的网址层级工具在 2027 年,微软的 robots.txt 支持在 2027 年初——谷歌说的是没有日期的「几周」。没有查到苹果、谷歌或微软公开发布的直接声明:名单是 Cloudflare 宣布的。头 24 小时里,我没有找到大型综合性媒体的报道,也没有出版方或行业协会的反应,官方文章也未署名作者。新的默认设置是否以及如何影响已有配置的付费客户,同样没有说清。
- Perché pubblicarla
- 这项决定改变了很大一部分网络的默认设置,直接关系到在意大利做网络发布的人:把站点放在 Cloudflare 后面的出版机构、博客或企业,从昨天起可以拒绝训练而不失去搜索;带广告的新域名一开始就默认封锁 Training 与 Agent。这也是三家大型搜索提供方第一次接受——至少在口头上并给出时限——把索引与训练分开,也正是它们此前一直拒绝让出的那道分界。这条新闻也合本站的调子:一个可核验的操作性事实,旁边是未来的承诺,和公司自陈、还没有人能核对的数字。
Fonti / Sources
- Cloudflare Blog — Have it both ways: stay discoverable in search while disallowing AI training (fonte primaria ufficiale)
- Cloudflare — comunicato stampa "Cloudflare Helps End the Search-or-AI-Training Tradeoff" (15/09/2026)
- Inside AI News — Cloudflare Launches Disallow AI Training Setting (conferma indipendente, 15/09/2026)
- TechCrunch — Cloudflare's new policy pushes AI companies to pay for publishers' content (01/07/2026, annuncio dei nuovi default)