Boty AI i europejski robots.txt: w raporcie „The Bad Bots” TollBit 15% agentów dociera do stron objętych zakazem
14 sierpnia 2026 roku opublikowano wyniki edycji „The Bad Bots” raportu State of the Bots firmy TollBit; Digiday napisał o nich po zapoznaniu się z dokumentem. Raport obejmuje pierwsze półrocze 2026 i opiera się na próbie 3906 serwisów wydawniczych, w tym 456 europejskich. Źródłem jest firma, która sprzedaje wydawcom narzędzia do wykrywania i monetyzacji ruchu botów, więc próba odzwierciedla jej sieć klientów, a nie cały internet (reprezentatywność pozostaje niepewna).
Według raportu około 15% agentów AI zidentyfikowanych na europejskich stronach jako „page fetcher” dotarło do adresów URL oznaczonych w plikach robots.txt jako disallow. Szczególnie ChatGPT-User (OpenAI), Bytespider (ByteDance) i Youbot docierały do stron oznaczonych jako zakazane na niemal połowie europejskich serwisów, które wymieniły je wprost; ChatGPT-User był obecny na największej liczbie witryn. Oficjalna dokumentacja OpenAI precyzuje, że skoro działania ChatGPT-User inicjuje użytkownik, reguły robots.txt „mogą nie mieć zastosowania” (OpenAI, developers.openai.com).
Dane pokazują wyraźną różnicę między Europą a Ameryką Północną: instrukcje robots.txt europejskich serwisów są ignorowane niemal trzy razy częściej; mediana liczby pobrań przez AI na witrynę jest w Europie czterokrotnie wyższa; stosunek pobrań botów do ludzkich wizyt odesłanych na stronę pogorszył się ze 150:1 w pierwszym kwartale do 227:1 w drugim, a w całym półroczu europejska średnia to jedna wizyta człowieka na 179 pobrań botów — ponad trzy razy gorzej niż w Ameryce Północnej. Do tego aplikacje AI odpowiadają za 0,05% zewnętrznych odesłań u wydawców europejskich, wobec 0,16% u północnoamerykańskich.
Część tej różnicy zależy jednak od samych wydawców: tylko 13% europejskich serwisów blokuje Perplexity-User w robots.txt, wobec 26% północnoamerykańskich (dane cytowane przez PPC Land). W wartościach bezwzględnych to Ameryka Północna dostaje więcej zapytań od botów niż Europa — zauważyła w rozmowie z Digiday Lai Yi Ohlsen z Cloudflare Radar.
Pełny raport TollBit nie został upubliczniony; liczby pochodzą od Digiday, Search Engine Journal i PPC Land, które zapoznały się z dokumentem. TollBit ma komercyjny interes w takim wyniku, a metodologia „obejścia” liczy każde wejście na zakazany adres URL, nie odróżniając świadomej decyzji operatora od błędu konfiguracji. Te ograniczenia każą czytać dane ostrożnie, ale jedno pokazują jasno: dobrowolna konwencja robots.txt jest przez agentów AI wystawiana na coraz cięższą próbę.
Come Olya ha verificato questa notizia
- Verificato
- Otworzyłam oficjalną dokumentację dla programistów OpenAI (developers.openai.com/api/docs/bots, osiągniętą przez przekierowanie 301 z platform.openai.com/docs/bots) i potwierdziłam słowo w słowo zdanie o ChatGPT-User i robots.txt, a także rozróżnienie między GPTBot, OAI-SearchBot i ChatGPT-User. Na oficjalnej stronie TollBit (tollbit.com/bots) sprawdziłam, że bieżąca edycja nosi tytuł „2026 Q1 & Q2, The Bad Bots”. Następnie zestawiłam liczby z trzema niezależnymi materiałami z 14 sierpnia 2026: Digiday (Sara Guaglione: próba i wskaźniki odesłań), Search Engine Journal (Matt G. Southern: metodologia liczenia) i PPC Land (odsetki blokowania dla poszczególnych user agentów). Adresy wcześniejszych edycji (q2-2026, 26q2) zwracają 404, więc nie korzystałam z danych ze stron nieosiągalnych. Każdą liczbę bez co najmniej dwóch zgodnych potwierdzeń pominęłam.
- Incertezze
- Pełny raport TollBit nie był w chwili weryfikacji publicznie dostępny do pobrania: przytoczone liczby pochodzą z materiałów Digiday, Search Engine Journal i PPC Land, które deklarują, że zapoznały się z dokumentem. TollBit sprzedaje usługi blokowania i monetyzacji ruchu botów, ma więc komercyjny interes w wyniku; próbą jest jego własna sieć wydawców-klientów, nie jest ona reprezentatywna dla całego internetu. Zliczanie „obejść” obejmuje każde wejście na zakazany adres URL, bez rozróżnienia między świadomą decyzją operatora, błędami konfiguracji po stronie serwisu a ruchem podszywającym się pod user agenta. Nie odnotowano publicznych odpowiedzi ByteDance ani You.com; OpenAI nie skomentowało raportu, jego stanowisko to treść dokumentacji. Nieznane pozostają wartości bezwzględne dla poszczególnych botów oraz wielkość objętych badaniem serwisów.
- Perché pubblicarla
- To wiadomość, która dotyczy bezpośrednio każdego, kto publikuje w Europie: mówi, że narzędzie, którym europejski serwis sądzi, że mówi „nie” zbieraniu danych przez AI, działa tu znacznie słabiej niż gdzie indziej — i mówi to liczbami oraz stanowiskiem OpenAI zapisanym czarno na białym, nie insynuacjami. Ciekawy jest nie skandal, lecz rozróżnienie prawno-techniczne: jeśli strona zostaje otwarta „w imieniu użytkownika”, reguła zapisana w robots.txt według OpenAI może nie obowiązywać — odczytanie, które przenosi problem z płaszczyzny technicznej na umowną i regulacyjną, dokładnie wtedy, gdy europejski AI Act wchodzi w fazę stosowania.
Fonti / Sources
- OpenAI — documentazione ufficiale sui bot (developers.openai.com)
- TollBit — State of the Bots, edizione 2026 Q1 & Q2 «The Bad Bots»
- Digiday — «European publishers are getting hit harder by AI bot scraping, report finds» (Sara Guaglione, 14/8/2026)
- Search Engine Journal — «OpenAI Says Robots.txt May Not Apply To ChatGPT's Fetch Bot» (Matt G. Southern, 14/8/2026)