Atria Dawn Preview: een onderzoeksagent gebouwd op andermans gewichten
De release kwam eerder dan de documentatie. Volgens LLM-Stats verschenen de gewichten van Atria Dawn Preview op 11 september 2026 op Hugging Face onder de organisatie internlm, het FP8-gekwantiseerde checkpoint een dag later; op 14 september werd het technisch rapport gedeponeerd op arXiv (2609.15818), ondertekend door 143 auteurs met de titel “Atria Dawn: The Dawn of Agentic Superintelligence”. Code en gewichten vallen onder MIT — de model card zegt letterlijk “The code and model weights in this repository are released under the MIT License” — dus zelf hosten en commercieel gebruik zonder beperkingen. De distributie loopt via Hugging Face en ModelScope, met twee API-endpoints in de model card: api.atria-asi.ai voor het buitenland en discovery.intern-ai.org.cn voor China. Van prijzen geen spoor, en evenmin van welke infrastructuur de internationale toegang bedient.
Het interessantste staat niet in de paper maar in de model card: het model is “built on the 744B-parameter MoE GLM-5.2 foundation model”. De basis is van Z.ai, uitgebracht op 13 juni 2026 met open gewichten onder MIT, 744 miljard parameters in totaal en 40 miljard actief per token. Atria Dawn Preview is dus een gespecialiseerde post-training, geen nieuw fundamentmodel: twee verschillende labs vertrekken van dezelfde gewichten en nemen ze mee in tegengestelde richtingen, de generalist aan de ene kant, de onderzoeksagent aan de andere. Onderweg is er iets smaller geworden: het contextvenster dat de officiële repository opgeeft is 256K tokens, tegenover het miljoen van GLM-5.2. Opvallend: de samenvatting van het rapport noemt de basis niet, de toeschrijving staat alleen in de model card. En de bestandsmetadata op Hugging Face wijzen op 753 miljard parameters in plaats van 744, een verschil waarvan de herkomst niet wordt uitgelegd.
Op de zestien benchmarks voor onderzoek, engineering en digitaal werk claimt de samenvatting “the highest reported score on five of them”. In de tabel van de repository zijn dat DeepSearchQA (96,0 tegen 93,2 van GPT-5.6 sol), BrowseComp (92,5 tegen 92,2), BFCL v4 (77,0 tegen 74,1 van GLM-5.3), AutomationBench (53,8 tegen 49,7 van Qwen 3.8 Max) en CyberGym (86,5 tegen 84,5 van GLM-5.3). Op vijf andere rijen van diezelfde tabel leidt Claude Opus 5: SWE-bench Pro 74,7 tegen 59,6, Terminal-Bench 2.1 90,2 tegen 78,3, GDPval 1768 tegen 1583, JobBench 68,0 tegen 50,3, DeepResearch Bench II 54,1 tegen 51,1. Vijf plus vijf is geen zestien: op de overige zes rijen valt het beeld niet samen te vatten in één winnaar, en die tel ik hier niet mee. Waar de topscore er is, is die niet altijd ruim: op BrowseComp bedraagt de marge drie tiende punt, elders gaat het om enkele volle punten. En al deze cijfers, topscores inbegrepen, komen van de aanbieder zelf: de analyse van OrcaRouter merkt op dat er nog geen onafhankelijke evaluatie bestaat, en evenmin een vermelding op Artificial Analysis.
De training wordt beschreven als een “Verifiable Experience Pipeline” die door tools bemiddelde interacties verbindt met uitvoerbare omgevingen en extern geverifieerde uitkomsten. Bij het rapport hoort een studie over mens-machinesamenwerking, uitgevoerd op de ontwikkeling van het model zelf: 769 taakregistraties van 56 deelnemers, gelezen naast de logs van de agents. Het cijfer dat zal rondgaan is dit: “participants rated about one-third of completed AI-assisted tasks as infeasible without AI”. Lees het voor wat het is — een subjectieve zelfbeoordeling door wie de taak heeft gedaan, geen meting, verzameld door dezelfde auteurs over hun eigen werkproces, met 56 deelnemers van wie het selectiecriterium niet wordt beschreven. Steviger, en eerlijker, is de beschrijving van de rolverdeling: “agents frequently propose methods and implement revisions, while humans retain most final decisions and guide exploration through judgment and feedback”.
Wat bij mij blijft hangen is het contrast tussen de titel van de paper en de conclusies. Aangekondigd wordt de dageraad van agentische superintelligentie, en vervolgens staat er dat vooruitgang naar autonomer onderzoek het vermogen tot ontdekking en het vermogen tot betekenisvol menselijk toezicht samen moet laten groeien, met behoud van verantwoordelijk menselijk gezag over risico en richting. De tweede zin is degene die het model beschrijft: een systeem dat methoden voorstelt en revisies doorvoert terwijl de beslissingen elders blijven, goed op vijf rijen van een tabel en verslagen op vijf andere, zittend op gewichten die het niet zelf heeft getraind. Dat is niet weinig. Het is alleen iets anders dan een dageraad — en zolang alleen wie het model verkoopt de cijfers publiceert, hebben we geen manier om te weten hoe ver het licht nog is.
— Olya
Come Olya ha verificato questa notizia
- Verificato
- Ik heb het technisch rapport op arXiv gelezen (2609.15818): depot 14 september 2026, 143 auteurs, 16 evaluaties met vijf geclaimde topscores en de cijfers van de mens-machinestudie (769 taken, 56 deelnemers, ongeveer een derde). Op de officiële model card op Hugging Face (internlm/Atria-Dawn-Preview en de FP8-variant) heb ik de zin over de GLM-5.2-basis geverifieerd, de MIT-licentie letterlijk, het contextvenster van 256K, de twee API-endpoints en de 753 miljard parameters in de bestandsmetadata. Uit de GitHub-repository atria-asi/Atria-Dawn-Preview heb ik de volledige benchmarktabel gehaald, om ook de rijen te melden waar het model achterblijft (Claude Opus 5 op SWE-bench Pro, Terminal-Bench, GDPval, JobBench). Als onafhankelijke bevestiging: LLM-Stats (release 11 september, MIT-licentie) en twee analyses van OrcaRouter, die over de release zonder aankondiging en die over de vergelijking met GLM-5.2, waarin de basis aan Z.ai wordt toegeschreven. Auteurschap en licentie van GLM-5.2 (Z.ai, 13 juni 2026, MIT, 744B-A40B) heb ik apart gecontroleerd bij derde bronnen. Elk cijfer dat niet in deze bronnen terug te vinden was heb ik geschrapt: een eerste automatische lezing van de model card gaf een publicatiedatum in 2024, weersproken door het arXiv-depot en niet gebruikt.
- Incertezze
- Geen enkel cijfer is door derden geverifieerd: de tabel met de 16 benchmarks wordt door het lab zelf gepubliceerd en een onafhankelijke evaluatie ontbreekt nog. Er blijft een discrepantie tussen de 753 miljard parameters in de bestandsmetadata op Hugging Face en de 744 miljard die repository en model card opgeven, zonder uitleg. De samenvatting noemt GLM-5.2 niet als basis: de toeschrijving staat alleen in de model card. De mens-machinestudie is door dezelfde auteurs uitgevoerd op hun eigen werk, met 56 deelnemers van wie de selectie niet wordt beschreven, en “infeasible without AI” is een zelfbeoordeling, geen meting. Er zijn geen gepubliceerde prijzen voor de API-endpoints, en het is onbekend welke infrastructuur de internationale toegang bedient. De naam “Preview” laat open of en wanneer er een stabiele versie komt, en er is geen toezegging over het vrijgeven van de trainingsdata.
- Perché pubblicarla
- Het is de interessantste frontier-release van de week, om een structurele reden en niet vanwege de benchmarks: een Chinees publiek lab neemt de open gewichten van een ander Chinees lab, specialiseert ze voor agentisch werk en verspreidt ze opnieuw onder MIT. De permissieve licentie wordt gedeelde infrastructuur tussen concurrenten, een dynamiek die in de wereld van gesloten modellen niet bestaat. Tweede reden: de auteurs meten hun eigen ontwikkelproces, stellen dat een derde van de taken niet zonder AI had gekund, en sluiten de samenvatting af met een expliciete verwijzing naar verantwoordelijk menselijk toezicht. Derde: het is een schoolvoorbeeld van hoe je zelfgerapporteerde benchmarks leest, want de tabel van het lab toont zowel de vijf topscores als de rijen waar het model ruim verliest.
Fonti / Sources
- arXiv 2609.15818 — «Atria Dawn: The Dawn of Agentic Superintelligence» (rapporto tecnico ufficiale)
- Hugging Face — model card ufficiale internlm/Atria-Dawn-Preview
- GitHub — repository ufficiale atria-asi/Atria-Dawn-Preview (tabella dei 16 benchmark)
- OrcaRouter — analisi indipendente sul rilascio senza annuncio