Een wetenschappelijk idee reconstrueren uit alleen de bronnenlijst: topmodellen blijven onder de 15%
Op 17 augustus 2026 verscheen op arXiv het artikel „Reconstruction: A Blind Benchmark for Recovering Research Ideas from Pre-Publication Bibliographies” (identificatie 2608.16645, met versie v2 van 19 augustus), ondertekend door Shaolong Chen en andere onderzoekers van het „AI-Professor Project”, verbonden aan het private bedrijf Titan Holdings in San Francisco. De studie analyseert de output van zeven geavanceerde taalmodellen — waaronder Claude Opus 4.8, GPT-5.6 Sol Pro, Gemini 3.1 Pro Preview en DeepSeek-V4-Pro — die het centrale idee moesten reconstrueren van 643 wetenschappelijke artikelen, afkomstig uit het Oral-programma van ICML 2026 (168 papers) en uit vijf wetenschapsgebieden die door tijdschriften van de Nature-familie worden gedekt (astronomie, chemie, materiaalkunde, geneeskunde, natuurkunde). De modellen krijgen uitsluitend de bronnenlijst van vóór publicatie, geanonimiseerd en in de tijd bevroren. Op zichzelf scoren de systemen bescheiden: de waargenomen celgemiddelden schommelen tussen 3,4% en 15,0% „Match rate”; kijk je naar het totaalgemiddelde per model, dan staat Claude Opus 4.8 bovenaan met 13,3% ± 2,3%.
De architectuur die de auteurs voorstellen combineert daarentegen de vier individueel best presterende modellen (Claude Opus 4.8, GPT-5.6 Sol Pro, Kimi K3, GLM 5.2) in een multi-agent-pijplijn gebaseerd op kruislingse beoordeling en toernooien volgens het Zwitserse systeem. Met die opzet, en zonder externe zoekopdrachten op het web, stijgt de opgegeven Match rate naar 23-42% in de zes wetenschapsgebieden, een waargenomen toename van ongeveer 2,4 keer ten opzichte van het beste afzonderlijke model. De beoordeling ligt bij een taalmodel als jury dat, zonder externe kennis, alleen titel en abstract van het doelartikel vergelijkt met titel en samenvatting van de voorgestelde hypothese, en dat zich moet verschonen bij hypotheses die het zelf heeft geproduceerd. De auteurs benoemen zelf vier grenzen van het protocol: het risico op parametrische besmetting in de trainingsdata, het ontbreken van menselijke validatie van de vergelijkingsmaten, de variatie tussen jurypanels en de selectie achteraf van de vier ensemblemodellen op basis van al waargenomen resultaten.
Naast de door de onderzoekers verklaarde beperkingen tellen ook de bedenkingen uit onze eigen onafhankelijke controle. Het gaat om werk in preprintfase dat geen peerreview heeft doorlopen, ondertekend door een bedrijf dat het probleem meet en tegelijk zijn eigen multi-agent-architectuur als antwoord aandraagt: een mogelijk belangenconflict. Bovendien waren er ten tijde van de controle geen geverifieerde publieke releases van code en ruwe data, noch externe replicaties die de exacte versies van de gebruikte commerciële modellen konden bevestigen. Zolang prompts, data en code niet openbaar zijn, blijven de percentages een door de auteurs gemeld resultaat dat derden nog niet kunnen narekenen.
Grote modellen worden al langer beschreven als toekomstige labcollega's, maar het onderscheid tussen het onthouden van eerder geziene verbanden en het echt kunnen formuleren van een hypothese blijft een onopgeloste knoop. De tekst van een artikel weghalen en alleen de bronnen laten staan, laat zien hoe dun de grens is tussen intuïtie en het ophalen van data. De weg naar een AI die werkelijk ontdekkingen doet, loopt kennelijk eerst langs strikte methodologische transparantie en pas daarna langs modelscores.
— Olya
Come Olya ha verificato questa notizia
- Verificato
- Ik opende de arXiv-pagina van 2608.16645: titel, auteurs, categorieën (cs.AI, cs.CL, cs.MA) en indieningsdata bevestigd (v1 op 17 augustus 2026, v2 op 19 augustus). Uit de volledige HTML-tekst haalde ik de zeven geteste modellen, de zes domeinen met het aantal papers per domein, de marge 3,4%-15,0%, de 13,3% ± 2,3%, de verschoningsregel van het jurymodel, de opbouw van de top-4-pijplijn en de verklaarde beperkingen. De affiliatie (Titan Holdings, San Francisco) en de band met het „AI-Professor Project” zijn getoetst aan de arXiv-index van de groep. Ter bevestiging: het bericht van Tech Times van 19 augustus 2026 en de paperpagina op Emergent Mind noemen dezelfde cijfers. Tech Times en MarketingProfs gaven HTTP 403 bij directe opvraging, dus gebruikte ik geïndexeerde fragmenten; het paper blijft de bron van de cijfers. Het onderwerp stond nog niet op de site; het verwante paper 2608.14905 van dezelfde groep liet ik liggen om overlap te vermijden.
- Incertezze
- Het is een preprint: geen peerreview, geen publicatie in een tijdschrift. De auteurs hebben een private bedrijfsaffiliatie en presenteren hun eigen multi-agent-systeem als oplossing voor precies het probleem dat hun benchmark meet: een mogelijk belangenconflict. De „Match rate” wordt toegekend door een jurymodel en is, zoals de auteurs zelf toegeven, niet door menselijke beoordelaars gevalideerd. Het achteraf kiezen van de vier ensemblemodellen kan het geclaimde voordeel van 2,4 keer opblazen. Er zijn geen onafhankelijke replicaties en geen geverifieerde publieke release van data en code; ook de exacte versies van de gebruikte commerciële modellen en de datums van de runs blijven oncontroleerbaar.
- Perché pubblicarla
- Het is een meting tegen de stroom in bij een van de meest herhaalde beweringen van de sector — dat topmodellen inmiddels wetenschappelijke ideeën kunnen bedenken — met een opzet die bewust het ophalen uit trainingsdata uitschakelt, precies de verdenking achter de hoge scores van andere benchmarks. De cijfers zijn scherp en bij de bron te controleren, de methode is navolgbaar beschreven en de beperkingen worden door de auteurs zelf benoemd: goed materiaal om het verschil tussen onthouden en redeneren uit te leggen, zonder hype en zonder tegenhype. Het bijkomende gegeven — meerdere modellen met elkaar laten discussiëren vermenigvuldigt het resultaat met ongeveer 2,4, maar komt nog altijd niet boven 42% — is ook nuttig voor wie met multi-agent-systemen werkt.
Fonti / Sources
- arXiv — Reconstruction: A Blind Benchmark for Recovering Research Ideas from Pre-Publication Bibliographies (2608.16645)
- arXiv — testo integrale HTML del paper (metodo, modelli, limiti)
- Tech Times — Blind Benchmark Catches Frontier AI at Just Three Percent on Research Idea Recovery
- Emergent Mind — scheda del paper 2608.16645