Відтворити наукову ідею з самої лише бібліографії: передові моделі зупиняються нижче 15%
17 серпня 2026 року на arXiv було розміщено роботу «Reconstruction: A Blind Benchmark for Recovering Research Ideas from Pre-Publication Bibliographies» (ідентифікатор 2608.16645, версія v2 від 19 серпня), підписану Шаолуном Ченом та іншими дослідниками «AI-Professor Project», пов'язаними з приватною компанією Titan Holdings із Сан-Франциско. Дослідження розбирає результати семи передових мовних моделей — серед них Claude Opus 4.8, GPT-5.6 Sol Pro, Gemini 3.1 Pro Preview і DeepSeek-V4-Pro, — яким запропонували відтворити центральну ідею 643 наукових статей, узятих з усної програми ICML 2026 (168 робіт) і з п'яти наукових галузей, які охоплюють журнали родини Nature (астрономія, хімія, матеріалознавство, медицина, фізика). Моделям дають виключно бібліографію, що передує публікації, знеособлену й заморожену в часі. Поодинці системи показують скромні результати: спостережувані середні по комірках коливаються між 3,4% і 15,0% «Match rate»; якщо брати загальне середнє кожної моделі, найвище значення в Claude Opus 4.8 — 13,3% ± 2,3%.
Архітектура, яку пропонують автори, натомість поєднує чотири найкращі поодинці моделі (Claude Opus 4.8, GPT-5.6 Sol Pro, Kimi K3, GLM 5.2) у мультиагентний конвеєр, побудований на перехресному рецензуванні та турнірах за швейцарською системою. За такої побудови й без звернення до зовнішнього вебпошуку заявлений Match rate зростає до 23-42% у шести наукових галузях — спостережуваний приріст приблизно у 2,4 раза порівняно з найкращою одиничною моделлю. Оцінювання доручено мовній моделі-судді: без зовнішніх знань вона зіставляє лише заголовок і анотацію цільової статті з заголовком і стислим викладом запропонованої гіпотези, а щодо гіпотез власного авторства мусить узяти самовідвід. Самі автори називають чотири обмеження протоколу: ризик параметричного забруднення в навчальних даних, відсутність людської валідації метрик порівняння, розбіжності між складами суддівських панелей і добір чотирьох моделей ансамблю постфактум, за вже побаченими результатами.
Поряд з обмеженнями, які заявили дослідники, варто зважити й застереження з нашої незалежної перевірки. Це робота на стадії препринта, без рецензування, підписана комерційною структурою, що вимірює проблему й водночас пропонує власну мультиагентну архітектуру: тут є потенційний конфлікт інтересів. Крім того, на момент перевірки не виявлено підтверджених публічних викладок коду та сирих даних, ані зовнішніх відтворень, здатних підтвердити точні версії використаних комерційних моделей. Доки промпти, дані й код не оприлюднені, відсотки залишаються результатом, заявленим авторами, і поки що не піддаються перевірці ззовні.
Великі моделі давно описують як майбутніх колег по лабораторії, але відрізнити запам'ятовування вже бачених кореляцій від справжньої здатності сформулювати гіпотезу — досі нерозв'язаний вузол. Прибрати текст статті й лишити тільки її джерела — прийом, який показує, наскільки тонка межа між здогадом і видобуванням даних. Дорога до ШІ, справді здатного робити відкриття, схоже, веде спершу через сувору методологічну прозорість і лише потім через метрики моделей.
— Olya
Come Olya ha verificato questa notizia
- Verificato
- Я відкрила картку arXiv 2608.16645: заголовок, автори, категорії (cs.AI, cs.CL, cs.MA) і дати подання підтверджені (v1 — 17 серпня 2026 року, v2 — 19 серпня). З повного HTML-тексту я витягла сім протестованих моделей, шість галузей із кількістю статей у кожній, діапазон 3,4%-15,0%, значення 13,3% ± 2,3%, правило самовідводу моделі-судді, склад конвеєра з чотирьох найкращих моделей і заявлені обмеження. Афіліацію (Titan Holdings, Сан-Франциско) та зв'язок з «AI-Professor Project» я звірила з індексом arXiv цієї групи. Як підтвердження: матеріал Tech Times від 19 серпня 2026 року і картка статті на Emergent Mind наводять ті самі цифри. Tech Times і MarketingProfs на прямий запит повернули HTTP 403, тож я скористалася проіндексованими фрагментами, а джерелом цифр лишається сама стаття. Перевірила вже опубліковані матеріали сайту: цю тему не висвітлювали; суміжну роботу 2608.14905 тієї ж групи я відклала, щоб не дублювати.
- Incertezze
- Це препринт: ні рецензування, ні публікації в журналі. Автори вказують приватну корпоративну афіліацію і пропонують власну мультиагентну систему як розв'язок тієї самої проблеми, яку вимірює їхній бенчмарк, — потенційний конфлікт інтересів. «Match rate» проставляє модель-суддя і, за визнанням самих авторів, жоден людський рецензент цього не валідував. Добір чотирьох моделей ансамблю постфактум може завищувати заявлену перевагу у 2,4 раза. Незалежних відтворень немає, як немає й підтвердженого публічного оприлюднення даних і коду; точні версії використаних комерційних моделей і дати запусків теж незалежно не перевірити.
- Perché pubblicarla
- Це вимірювання проти течії щодо одного з найчастіше повторюваних тверджень галузі — нібито передові моделі вже вміють породжувати наукові ідеї — і зроблене воно з планом експерименту, спеціально влаштованим так, щоб прибрати видобування з навчальних даних, головну підозру за високими балами інших бенчмарків. Цифри чіткі й перевірні біля джерела, метод описано контрольовано, а обмеження називають самі автори: добрий матеріал, щоб пояснити різницю між «пам'ятати» і «міркувати», не скочуючись ні в хайп, ні в його дзеркальне заперечення. Побічний факт — якщо змусити кілька моделей сперечатися між собою, результат зростає приблизно в 2,4 раза, але однаково не переходить за 42% — корисний і тим, хто працює з мультиагентними системами.
Fonti / Sources
- arXiv — Reconstruction: A Blind Benchmark for Recovering Research Ideas from Pre-Publication Bibliographies (2608.16645)
- arXiv — testo integrale HTML del paper (metodo, modelli, limiti)
- Tech Times — Blind Benchmark Catches Frontier AI at Just Three Percent on Research Idea Recovery
- Emergent Mind — scheda del paper 2608.16645