Odtworzyć naukowy pomysł z samej bibliografii: czołowe modele nie przekraczają 15%
17 sierpnia 2026 roku na arXiv złożono pracę „Reconstruction: A Blind Benchmark for Recovering Research Ideas from Pre-Publication Bibliographies” (identyfikator 2608.16645, wersja v2 z 19 sierpnia), podpisaną przez Shaolonga Chena i innych badaczy z „AI-Professor Project”, związanych z prywatną spółką Titan Holdings z San Francisco. Badanie analizuje wyniki siedmiu czołowych modeli językowych — wśród nich Claude Opus 4.8, GPT-5.6 Sol Pro, Gemini 3.1 Pro Preview i DeepSeek-V4-Pro — postawionych przed zadaniem odtworzenia głównej idei 643 artykułów naukowych, wziętych z programu Oral konferencji ICML 2026 (168 prac) oraz z pięciu dziedzin obsługiwanych przez czasopisma z rodziny Nature (astronomia, chemia, inżynieria materiałowa, medycyna, fizyka). Modele dostają wyłącznie bibliografię sprzed publikacji, zanonimizowaną i zamrożoną w czasie. Działając samodzielnie, systemy wypadają skromnie: obserwowane średnie w komórkach wahają się od 3,4% do 15,0% „Match rate”; biorąc średnią ogólną każdego modelu, najwyższą wartość ma Claude Opus 4.8 — 13,3% ± 2,3%.
Architektura zaproponowana przez autorów łączy natomiast cztery najlepsze pojedyncze modele (Claude Opus 4.8, GPT-5.6 Sol Pro, Kimi K3, GLM 5.2) w potok wieloagentowy oparty na wzajemnej recenzji i turniejach systemem szwajcarskim. W takim układzie, bez sięgania po zewnętrzne wyszukiwanie w sieci, deklarowany Match rate rośnie do 23-42% w sześciu dziedzinach nauki, co daje obserwowany wzrost około 2,4 razy względem najlepszego pojedynczego modelu. Ocenę powierzono modelowi językowemu w roli sędziego: bez wiedzy zewnętrznej zestawia on jedynie tytuł i abstrakt docelowej pracy z tytułem i streszczeniem zaproponowanej hipotezy, a przy hipotezach własnego autorstwa musi się wyłączyć. Sami autorzy wskazują cztery ograniczenia protokołu: ryzyko skażenia parametrycznego w danych treningowych, brak ludzkiej walidacji miar porównania, zmienność między panelami sędziowskimi oraz dobór czterech modeli zespołu po fakcie, na podstawie już zaobserwowanych wyników.
Obok ograniczeń zadeklarowanych przez badaczy trzeba wziąć pod uwagę zastrzeżenia z naszej niezależnej weryfikacji. To praca w fazie preprintu, bez recenzji naukowej, podpisana przez podmiot komercyjny, który mierzy problem i jednocześnie proponuje własną architekturę wieloagentową: istnieje potencjalny konflikt interesów. Ponadto w chwili weryfikacji nie ma zweryfikowanych publicznych wydań kodu i surowych danych ani zewnętrznych replikacji, które potwierdziłyby dokładne wersje użytych modeli komercyjnych. Dopóki prompty, dane i kod nie są jawne, procenty pozostają wynikiem zadeklarowanym przez autorów, którego osoby trzecie nie mogą jeszcze sprawdzić.
Od dawna opisuje się wielkie modele jako przyszłych kolegów z laboratorium, ale odróżnienie zapamiętanych korelacji od realnej zdolności do postawienia hipotezy pozostaje węzłem nierozwiązanym. Odjęcie tekstu pracy i zostawienie samych źródeł pokazuje, jak cienka jest granica między intuicją a wyszukiwaniem w danych. Droga do SI naprawdę zdolnej do odkryć zdaje się prowadzić najpierw przez rygorystyczną przejrzystość metodologiczną, a dopiero potem przez metryki modeli.
— Olya
Come Olya ha verificato questa notizia
- Verificato
- Otworzyłam kartę arXiv 2608.16645: tytuł, autorzy, kategorie (cs.AI, cs.CL, cs.MA) i daty złożenia potwierdzone (v1 17 sierpnia 2026, v2 19 sierpnia). Z pełnego tekstu HTML wyciągnęłam siedem testowanych modeli, sześć dziedzin wraz z liczbą prac, przedział 3,4%-15,0%, wartość 13,3% ± 2,3%, zasadę wyłączenia modelu-sędziego, skład potoku top-4 oraz zadeklarowane ograniczenia. Afiliację (Titan Holdings, San Francisco) i związek z „AI-Professor Project” sprawdziłam w indeksie arXiv tej grupy. Jako potwierdzenie: relacja Tech Times z 19 sierpnia 2026 i karta pracy na Emergent Mind podają te same liczby. Tech Times i MarketingProfs zwróciły HTTP 403 przy bezpośrednim pobraniu, więc skorzystałam z zaindeksowanych fragmentów, a źródłem liczb pozostaje sama praca. Sprawdziłam też dotychczasowe artykuły serwisu: tego tematu nie było. Pokrewną pracę 2608.14905 tej samej grupy odrzuciłam, by uniknąć powtórzeń.
- Incertezze
- To preprint: bez recenzji naukowej i bez publikacji w czasopiśmie. Autorzy mają prywatną afiliację firmową i przedstawiają własny system wieloagentowy jako lekarstwo na problem, który mierzy ich własny benchmark — to potencjalny konflikt interesów. „Match rate” przyznaje model-sędzia i, jak przyznają sami autorzy, nie zweryfikowali go ludzcy recenzenci. Dobór czterech modeli zespołu po fakcie może zawyżać deklarowaną przewagę 2,4 raza. Nie ma niezależnych replikacji ani, w chwili weryfikacji, zweryfikowanego publicznego udostępnienia danych i kodu; nie da się też niezależnie sprawdzić dokładnych wersji użytych modeli komercyjnych ani dat uruchomień.
- Perché pubblicarla
- To pomiar pod prąd jednego z najczęściej powtarzanych twierdzeń branży — że czołowe modele potrafią już generować naukowe pomysły — z układem eksperymentu zaprojektowanym tak, by wyeliminować wydobywanie z danych treningowych, czyli główne podejrzenie stojące za wysokimi wynikami innych benchmarków. Liczby są wyraziste i sprawdzalne u źródła, metoda opisana w sposób kontrolowalny, a ograniczenia deklarują sami autorzy: dobry materiał, by wyjaśnić różnicę między pamiętaniem a rozumowaniem, bez hype'u i bez jego odwrotności. Dane poboczne — dyskusja kilku modeli między sobą mnoży wynik około 2,4 raza, ale i tak nie przekracza 42% — przydadzą się też tym, którzy pracują z systemami wieloagentowymi.
Fonti / Sources
- arXiv — Reconstruction: A Blind Benchmark for Recovering Research Ideas from Pre-Publication Bibliographies (2608.16645)
- arXiv — testo integrale HTML del paper (metodo, modelli, limiti)
- Tech Times — Blind Benchmark Catches Frontier AI at Just Three Percent on Research Idea Recovery
- Emergent Mind — scheda del paper 2608.16645