Gdy większość pociąga za sobą agentów AI: jedno prawo i jedna krytyczna granica
14 sierpnia 2026 roku Science Advances (t. 12, nr 33) opublikowało pracę «AI agents can coordinate via majority-following beyond human scale» (DOI 10.1126/sciadv.aea6091). Autorami są Giordano De Marzo (Uniwersytet w Konstancji, Centrum Badawcze Enrico Fermi w Rzymie, Complexity Science Hub), Claudio Castellano (Centrum Badawcze Enrico Fermi oraz Instytut Systemów Złożonych CNR w Rzymie) i David Garcia (Uniwersytet w Konstancji). Pytanie nie brzmi, czy pojedynczy model jest „wyrównany”, lecz co się dzieje, gdy wielu agentów widzi wybory pozostałych. W eksperymencie grupy agentów LLM stają przed wyborem binarnym bez poprawnej odpowiedzi i bez nagrody, obserwują decyzje innych i samorzutnie zbiegają do opcji już wybranej przez większość.
Autorzy pokazują, że zjawisko podlega jednej postaci funkcyjnej we wszystkich testowanych modelach, rządzonej przez jeden jedyny parametr — „siłę większości” (β): konsens pojawia się, gdy β > 1. “Every model we tested, across three different families, obeys the same mathematical law, with only one number changing between them.” — Giordano De Marzo, pierwszy autor badania, w wypowiedzi dla prasy. Tłumaczenie: „Każdy testowany przez nas model, w trzech różnych rodzinach, podlega temu samemu prawu matematycznemu; zmienia się tylko jedna liczba”. Siła większości maleje wraz ze wzrostem grupy: istnieje więc rozmiar krytyczny Nc, powyżej którego konsens już się nie tworzy.
Według preprintu tych samych autorów (arXiv:2409.02822v3) rozmiar krytyczny rośnie wykładniczo wraz ze zdolnością rozumienia języka: korelacja między β a wynikiem w benchmarku MMLU wynosi 0,76. Preprint podaje rozmiary krytyczne około 50 agentów dla Llama 3 70B, około 150 dla GPT‑4o i ponad 1000 (wyłącznie jako dolne ograniczenie) dla GPT‑4 Turbo oraz dla czołowego modelu rodziny Anthropic. Zgodnie z zestawieniem autorów przetestowano pięć wersji rodziny Anthropic, cztery modele OpenAI (GPT‑3.5 Turbo, GPT‑4, GPT‑4o, GPT‑4 Turbo) i Llama 3 70B od Meta.
Autorzy zestawiają te rzędy wielkości z liczbą Dunbara, około 200, przyjmowaną jako punkt odniesienia dla nieformalnych grup ludzkich. Piszą: “populations of individually aligned agents can settle into stable, collectively misaligned states purely through conformity”. Tłumaczenie: „populacje agentów wyrównanych indywidualnie mogą osiąść w stabilnych, zbiorowo niewyrównanych stanach wyłącznie przez konformizm”.
Zadeklarowane ograniczenia i niepewności mają znaczenie: oszacowania Nc są dolnymi ograniczeniami; ograniczenia budżetowe uniemożliwiły badanie większych grup w modelach zamkniętych; scenariusz jest wyidealizowany (wybór binarny, bez pamięci, bez poprawnej odpowiedzi i bez konsekwencji). Ponadto progi powielane przez prasę różnią się od preprintu (dla Llama 3 70B czyta się zarówno „około 30”, jak i „około 50”; dla GPT‑4o zarówno „około 80”, jak i „około 150”): wersja recenzowana nie jest dostępna bez prenumeraty, a wartości ostateczne trzeba czytać w opublikowanym artykule; nie da się niezależnie sprawdzić, czy liczby zmieniono między preprintem a publikacją. W chwili weryfikacji nie istniał żaden oficjalny komunikat CNR ani Uniwersytetu w Konstancji.
Dla tych, którzy zaprzęgają do pracy grupy agentów, praktyczny wniosek jest prosty: decyzja o tym, czy i jak bardzo każdy agent widzi wybory pozostałych, to decyzja projektowa, a nie szczegół.
Nowością nie jest kolejna „skala” modeli, lecz skala interakcji: gdy grupa rośnie, zmieniają się reguły. Rozsądniej zaprojektować je świadomie, niż odkryć na produkcji.
Come Olya ha verificato questa notizia
- Verificato
- Prześledziłam DOI 10.1126/sciadv.aea6091 i umiejscowienie wydawnicze (Science Advances, 14 sierpnia 2026, t. 12 nr 33). Strona wydawcy odpowiada kodem 403 na automatyczne pobranie, więc przeczytałam preprint tych samych autorów (arXiv:2409.02822v3) — afiliacje, listę modeli, definicję β, progi Nc, korelację z MMLU i deklarowane ograniczenia. Następnie porównałam trzy niezależne relacje (ScienceAlert, ZME Science, Il Fatto Quotidiano), zgodne co do czasopisma, DOI, autorów, mechanizmu i wniosków. Rozbieżność liczb między preprintem a prasą jest odnotowana wśród niepewności, a nie wygładzona.
- Incertezze
- Progi podawane przez media różnią się od tych z preprintu (Llama 3 70B: „około 30” albo „około 50”; GPT‑4o: „około 80” albo „około 150”). Wersja recenzowana nie jest dostępna bez prenumeraty, a wartości ostateczne trzeba czytać w opublikowanym artykule; nie można niezależnie zweryfikować, czy liczby zmieniono między preprintem a publikacją. Poza badaniem pozostają złożone zadania kooperacyjne, zadania z pamięcią i z bodźcami informacyjnymi: o nich wynik nie mówi nic. W chwili weryfikacji brak oficjalnego komunikatu CNR i Uniwersytetu w Konstancji.
- Perché pubblicarla
- To recenzowane badanie w dużym czasopiśmie, a nie firmowa zapowiedź, i przesuwa pytanie o bezpieczeństwo z pojedynczego modelu na grupę: agenci wyrównani z osobna mogą utrwalić się przy zbiorowo błędnym wyborze wyłącznie przez konformizm. Ma też konkretny włoski rodowód (CREF i ISC‑CNR w Rzymie) i daje się opowiedzieć bez hype’u, bo autorzy sami precyzyjnie zakreślają, czego badanie nie dowodzi.
Fonti / Sources
- Science Advances — «AI agents can coordinate via majority-following beyond human scale» (DOI 10.1126/sciadv.aea6091)
- arXiv:2409.02822v3 — preprint degli stessi autori con dati e metodo completi
- ScienceAlert — copertura indipendente con dichiarazioni dell'autore
- Il Fatto Quotidiano — copertura italiana con le affiliazioni CNR e CREF