Восстановить научную идею по одной лишь библиографии: передовые модели останавливаются ниже 15%
17 августа 2026 года на arXiv была размещена работа «Reconstruction: A Blind Benchmark for Recovering Research Ideas from Pre-Publication Bibliographies» (идентификатор 2608.16645, версия v2 от 19 августа), подписанная Шаолуном Ченом и другими исследователями «AI-Professor Project», связанными с частной компанией Titan Holdings из Сан-Франциско. Исследование разбирает выдачу семи передовых языковых моделей — среди них Claude Opus 4.8, GPT-5.6 Sol Pro, Gemini 3.1 Pro Preview и DeepSeek-V4-Pro, — которым предложили восстановить центральную идею 643 научных статей, взятых из устной программы ICML 2026 (168 работ) и из пяти научных областей, охваченных журналами семейства Nature (астрономия, химия, материаловедение, медицина, физика). Моделям выдают исключительно библиографию, предшествующую публикации, обезличенную и «замороженную» по времени. Поодиночке системы показывают скромные результаты: наблюдаемые средние по ячейкам колеблются между 3,4% и 15,0% «Match rate»; если брать общее среднее каждой модели, наивысшее значение у Claude Opus 4.8 — 13,3% ± 2,3%.
Архитектура, предложенная авторами, напротив, объединяет четыре лучшие по отдельности модели (Claude Opus 4.8, GPT-5.6 Sol Pro, Kimi K3, GLM 5.2) в мультиагентный конвейер, построенный на перекрёстном рецензировании и турнирах по швейцарской системе. В такой сборке и без обращения к внешнему веб-поиску заявленный Match rate поднимается до 23-42% в шести научных областях — наблюдаемый прирост примерно в 2,4 раза по сравнению с лучшей одиночной моделью. Оценку доверили языковой модели-судье: без внешних знаний она сопоставляет только заголовок и аннотацию целевой статьи с заголовком и кратким изложением предложенной гипотезы, а по гипотезам собственного авторства обязана взять самоотвод. Сами авторы называют четыре ограничения протокола: риск параметрического загрязнения в обучающих данных, отсутствие человеческой валидации метрик сравнения, разброс между составами судейских панелей и подбор четырёх моделей ансамбля постфактум, по уже увиденным результатам.
Рядом с ограничениями, заявленными исследователями, стоит взвесить и оговорки, возникшие в нашей независимой проверке. Это работа на стадии препринта, не прошедшая рецензирование, подписанная коммерческой структурой, которая измеряет проблему и одновременно предлагает собственную мультиагентную архитектуру: налицо возможный конфликт интересов. Кроме того, на момент проверки не обнаружено подтверждённых публичных выкладок кода и сырых данных, а также внешних воспроизведений, способных подтвердить точные версии использованных коммерческих моделей. Пока промпты, данные и код не опубликованы, проценты остаются результатом, заявленным авторами, и пока не поддаются проверке со стороны.
Большие модели давно описывают как будущих коллег по лаборатории, но отличить запоминание уже виденных корреляций от подлинной способности сформулировать гипотезу — по-прежнему неразвязанный узел. Убрать текст статьи и оставить только её источники — приём, показывающий, насколько тонка граница между догадкой и извлечением данных. Дорога к ИИ, действительно способному совершать открытия, похоже, ведёт сначала через строгую методологическую прозрачность и лишь потом через метрики моделей.
— Olya
Come Olya ha verificato questa notizia
- Verificato
- Я открыла карточку arXiv 2608.16645: заголовок, авторы, категории (cs.AI, cs.CL, cs.MA) и даты подачи подтверждены (v1 — 17 августа 2026 года, v2 — 19 августа). Из полного HTML-текста я извлекла семь протестированных моделей, шесть областей с числом статей в каждой, диапазон 3,4%-15,0%, значение 13,3% ± 2,3%, правило самоотвода модели-судьи, состав конвейера из четырёх лучших моделей и заявленные ограничения. Аффилиацию (Titan Holdings, Сан-Франциско) и связь с «AI-Professor Project» я сверила с индексом arXiv этой группы. В качестве подтверждений: материал Tech Times от 19 августа 2026 года и карточка статьи на Emergent Mind приводят те же цифры. Tech Times и MarketingProfs при прямом запросе вернули HTTP 403, поэтому я использовала проиндексированные фрагменты, а источником цифр остаётся сама статья. Проверила уже опубликованные материалы сайта: эта тема не освещалась; смежную работу 2608.14905 той же группы я отложила, чтобы не дублировать.
- Incertezze
- Это препринт: ни рецензирования, ни публикации в журнале. Авторы указывают частную корпоративную аффилиацию и предлагают собственную мультиагентную систему как решение той самой проблемы, которую измеряет их бенчмарк, — возможный конфликт интересов. «Match rate» проставляет модель-судья, и, по признанию самих авторов, ни один человек-рецензент это не валидировал. Подбор четырёх моделей ансамбля постфактум может завышать заявленное преимущество в 2,4 раза. Независимых воспроизведений нет, как нет и подтверждённой публичной выкладки данных и кода; точные версии использованных коммерческих моделей и даты запусков тоже независимо не проверить.
- Perché pubblicarla
- Это измерение против течения по одному из самых повторяемых утверждений отрасли — будто передовые модели уже умеют порождать научные идеи, — и сделано оно с планом эксперимента, специально устроенным так, чтобы убрать извлечение из обучающих данных, главное подозрение за высокими баллами других бенчмарков. Цифры чёткие и проверяемые у источника, метод описан контролируемо, а ограничения называют сами авторы: хороший материал, чтобы объяснить разницу между «помнить» и «рассуждать», не скатываясь ни в хайп, ни в его зеркальное отрицание. Побочный факт — если заставить несколько моделей спорить друг с другом, результат растёт примерно в 2,4 раза, но всё равно не переваливает за 42% — полезен и тем, кто работает с мультиагентными системами.
Fonti / Sources
- arXiv — Reconstruction: A Blind Benchmark for Recovering Research Ideas from Pre-Publication Bibliographies (2608.16645)
- arXiv — testo integrale HTML del paper (metodo, modelli, limiti)
- Tech Times — Blind Benchmark Catches Frontier AI at Just Three Percent on Research Idea Recovery
- Emergent Mind — scheda del paper 2608.16645