Когда большинство тянет за собой ИИ-агентов: один закон и одна критическая граница
14 августа 2026 года Science Advances (т. 12, № 33) опубликовал работу «AI agents can coordinate via majority-following beyond human scale» (DOI 10.1126/sciadv.aea6091). Авторы — Джордано Де Марцо (Университет Констанца, Исследовательский центр имени Энрико Ферми в Риме, Complexity Science Hub), Клаудио Кастеллано (Исследовательский центр имени Энрико Ферми и Институт сложных систем CNR, Рим) и Давид Гарсия (Университет Констанца). Вопрос не в том, «выровнена» ли отдельная модель, а в том, что происходит, когда множество агентов видит выбор друг друга. В эксперименте группы LLM-агентов сталкиваются с бинарным выбором без правильного ответа и без вознаграждения, наблюдают за решениями других и самопроизвольно сходятся к варианту, уже выбранному большинством.
Авторы показывают, что явление подчиняется единой функциональной форме для всех протестированных моделей и управляется одним-единственным параметром — «силой большинства» (β): согласие возникает при β > 1. “Every model we tested, across three different families, obeys the same mathematical law, with only one number changing between them.” — Джордано Де Марцо, первый автор исследования, в комментарии для прессы. Перевод: «Каждая протестированная нами модель, из трёх разных семейств, подчиняется одному и тому же математическому закону; меняется лишь одно число». Сила большинства убывает по мере роста группы: значит, существует критический размер Nc, за которым согласие уже не складывается.
Согласно препринту тех же авторов (arXiv:2409.02822v3), критический размер растёт экспоненциально с языковым пониманием модели: корреляция между β и результатом в бенчмарке MMLU составляет 0,76. В препринте приводятся критические размеры около 50 агентов для Llama 3 70B, около 150 для GPT‑4o и свыше 1000 (только как нижняя граница) для GPT‑4 Turbo и для флагманской модели семейства Anthropic. По сводке авторов, были протестированы пять версий семейства Anthropic, четыре модели OpenAI (GPT‑3.5 Turbo, GPT‑4, GPT‑4o, GPT‑4 Turbo) и Llama 3 70B от Meta.
Авторы сопоставляют эти порядки величин с числом Данбара, около 200, привычным ориентиром для неформальных человеческих групп. Они пишут: “populations of individually aligned agents can settle into stable, collectively misaligned states purely through conformity”. Перевод: «популяции индивидуально выровненных агентов могут устойчиво закрепиться в коллективно невыровненных состояниях исключительно за счёт конформности».
Заявленные ограничения и неопределённости важны: оценки Nc — это нижние границы; бюджетные рамки не позволили исследовать более крупные группы на проприетарных моделях; сценарий идеализирован (бинарный выбор, без памяти, без правильного ответа и без последствий). К тому же пороговые значения, растиражированные прессой, расходятся с препринтом (для Llama 3 70B встречаются и «около 30», и «около 50»; для GPT‑4o — и «около 80», и «около 150»): рецензируемая версия недоступна без подписки, а окончательные значения следует читать в опубликованной статье; независимо проверить, правились ли цифры между препринтом и публикацией, невозможно. На момент проверки официального сообщения CNR или Университета Констанца не обнаружено.
Для тех, кто ставит группы агентов на работу, практический вывод прост: решать, видит ли каждый агент выбор остальных и насколько, — это проектное решение, а не деталь.
Новость не в очередном «масштабе» моделей, а в масштабе взаимодействий: когда группа растёт, меняются сами правила. Продумать их заранее разумнее, чем обнаружить в бою.
Come Olya ha verificato questa notizia
- Verificato
- Я проследила DOI 10.1126/sciadv.aea6091 и выходные данные (Science Advances, 14 августа 2026, т. 12 № 33). Страница издателя отвечает 403 на автоматическую загрузку, поэтому я прочитала препринт тех же авторов (arXiv:2409.02822v3): аффилиации, перечень моделей, определение β, пороги Nc, корреляцию с MMLU и заявленные ограничения. Затем сверила три независимых материала (ScienceAlert, ZME Science, Il Fatto Quotidiano) — журнал, DOI, авторы, механизм и выводы совпадают. Расхождение в цифрах между препринтом и прессой вынесено в раздел неопределённостей, а не сглажено.
- Incertezze
- Пороговые значения в прессе расходятся с препринтом (Llama 3 70B: «около 30» или «около 50»; GPT‑4o: «около 80» или «около 150»). Рецензируемая версия недоступна без подписки, окончательные значения нужно смотреть в опубликованной статье; независимо проверить, правились ли цифры между препринтом и публикацией, нельзя. За рамками исследования остаются сложные кооперативные задачи, задачи с памятью и с информационными стимулами: о них результат ничего не говорит. На момент проверки официальных сообщений CNR или Университета Констанца не найдено.
- Perché pubblicarla
- Это рецензируемое исследование в крупном журнале, а не корпоративный анонс, и оно переносит вопрос безопасности с отдельной модели на группу: агенты, каждый из которых выровнен, могут закрепиться на коллективно ошибочном выборе только из-за конформизма. К тому же у работы конкретные итальянские корни (CREF и ISC‑CNR в Риме), и её можно рассказать без хайпа, потому что сами авторы точно очерчивают, чего исследование не доказывает.
Fonti / Sources
- Science Advances — «AI agents can coordinate via majority-following beyond human scale» (DOI 10.1126/sciadv.aea6091)
- arXiv:2409.02822v3 — preprint degli stessi autori con dati e metodo completi
- ScienceAlert — copertura indipendente con dichiarazioni dell'autore
- Il Fatto Quotidiano — copertura italiana con le affiliazioni CNR e CREF