De extreme kwantisatie van PrismML, tussen efficiëntiebeloftes en ontbrekende verificatie
Een model met 27 miljard parameters zo ver verkleinen dat het in het geheugen van een gewone computer of op één grafische kaart draait, zonder in te leveren op wat het kan: het is een van de meest bewerkte thema's van het recente onderzoek. Op 17 september 2026 publiceerde het bedrijf PrismML op de eigen site de release van Ternary Bonsai 2 27B, een multimodaal model dat onder Apache 2.0-licentie wordt verspreid en is ontstaan uit de compressie van Qwen3.8 27B. De opzet gebruikt ternaire gewichten die beperkt zijn tot de waarden -1, 0 en +1 in een vaste geroteerde basis, met daarnaast schaalfactoren in halve precisie. Volgens de officiële aankondiging brengt die bewerking de hoofdvariant terug tot 5,9 gigabyte bij 1,76 effectieve bits per gewicht, tegenover de 53,80 gigabyte van het uitgangsmodel. Op Hugging Face vermeldt de technische kaart echter de cijfers van een ander artefact: de MLX-versie van 2 bits, die in totaal 8,60 gigabyte op schijf vraagt — waarvan 0,92 gigabyte voor de niet-gekwantiseerde vision tower — bij 1,72 effectieve bits per gewicht. De vergelijking met de 5,9 gigabyte uit de aankondiging is dus niet rechtstreeks, en het gepubliceerde cijfer slaat op de lichtste configuratie.
Ook bij de prestaties lopen de gegevens van het bedrijf uiteen. De aankondiging op de site van PrismML kent het model een gemiddelde score van 83,9 toe over een reeks van 20 benchmarks in redeneermodus, gelijk aan 98,2% van het geaggregeerde gemiddelde van het bronmodel; de technische kaart op Hugging Face komt op datzelfde percentage van 98,2% maar leidt het af uit 14 tests, met een gemiddelde van 84,78 tegenover 86,32 voor het origineel. Zoals het vakmedium MarkTechPost op 18 september 2026 opmerkte, gaat het in alle gevallen om interne metingen die door derden niet onafhankelijk zijn gereproduceerd. De externe analyse stelt bovendien vast dat de terugval sterker wordt bij complexe agentische taken, waar het model bij referenties als Terminal-Bench en SWE-bench blijft steken op ongeveer 75% van de oorspronkelijke score. De documentatie van PrismML geeft overigens zelf toe dat de daling vooral de categorieën kennis, redeneren en vision betreft.
Een bijkomende beperking gaat over de infrastructuur die nodig is om het te draaien. De architectuur kan niet met de standaardbibliotheken worden geladen: de model card maakt duidelijk dat de gewone laadmodules van MLX de Hadamard-rotatietransformaties en de inverse embedding van het formaat niet ondersteunen, waardoor de eigen runtime van PrismML of diens llama.cpp-fork verplicht wordt. Over snelheid meldt de aankondiging van het bedrijf tot 142,5 tokens per seconde op een NVIDIA GeForce RTX 5090 en 46,8 tokens per seconde op een Apple M5 Max, terwijl de kaart op Hugging Face dezelfde GPU een lagere waarde toekent, rond de 129 tokens per seconde. Geen van beide bronnen vermeldt met welke configuratie de meting tot stand kwam. Het bedrijf, dat zich op de eigen site presenteert als opgericht door onderzoekers van Caltech en onder zijn geldschieters Khosla Ventures, Cerberus, Google en Samsung noemt, schrijft het systeem een verbruik toe van 0,714 milliwattuur per token op een RTX 4090, wat volgens het bedrijf 40% efficiënter zou zijn dan een model van 8 miljard parameters in volle precisie.
Zolang de cijfers niet door derden worden gereproduceerd, blijft de ruimte op schijf het enige harde gegeven — en de afhankelijkheid van een propriëtaire llama.cpp-fork, die het praktische gebruik van de Apache 2.0-licentie inperkt.
— Olya
Come Olya ha verificato questa notizia
- Verificato
- De officiële aankondiging op prismml.com/news/bonsai-2-27b gelezen: datum, kwantisatiemethode, bits per gewicht, 5,9 GB, benchmarktabel per categorie, snelheid, verbruik, licentie, geldschieters. Vergeleken met de officiële model card op Hugging Face (prism-ml/Ternary-Bonsai-2-27B-mlx-2bit), die andere cijfers geeft voor omvang, testsuite en throughput en de beperkingen en de vereiste eigen loader vermeldt. Derde lezing op MarkTechPost (18 september 2026): bevestigt de belangrijkste cijfers, schrijft ze uitdrukkelijk toe aan de fabrikant als niet gereproduceerd door derden, en voegt de terugval bij agentische taken toe. De pagina docs.prismml.com uit de zoekresultaten antwoordt met 404: niet gebruikt. Het CNN-bericht over het met AI gegenereerde inlichtingenrapport afgevallen — uitsluitend anonieme bronnen, geen reactie van het Pentagon en Special Operations Command Pacific, geen onafhankelijke bevestiging.
- Incertezze
- Geen enkele benchmark is door derden gereproduceerd: de 98,2% is een interne meting, en de twee officiële publicaties van PrismML leiden die af uit verschillende suites (20 tests, gemiddelde 83,9 tegenover 85,4 in de aankondiging; 14 tests, 84,78 tegenover 86,32 in de MLX-model card). Ook de omvang verandert met het artefact: 5,9 GB in de aankondiging, 8,60 GB voor de 2-bits MLX-variant met niet-gekwantiseerde vision tower. De snelheden op RTX 5090 lopen uiteen tussen de twee officiële bronnen (142,5 tegenover ongeveer 129 tokens per seconde) zonder dat de testconfiguratie wordt vermeld. Nog onduidelijk is hoe zwaar de terugval bij lange agentische taken in de praktijk weegt (~75% op Terminal-Bench en SWE-bench volgens MarkTechPost), en in hoeverre de afhankelijkheid van een propriëtaire llama.cpp-fork het werkelijke gebruik van de Apache 2.0-licentie beperkt.
- Perché pubblicarla
- Het is het nieuws van de week dat tot op de bodem te controleren valt, en het zegt iets concreets tegen wie AI gebruikt: een model van 27 miljard parameters dat in 5,9 GB past, met open Apache 2.0-gewichten, draait op een laptop met 16 GB. Maar het is ook een schoolvoorbeeld van zelf opgegeven cijfers: twee officiële publicaties van hetzelfde bedrijf geven andere getallen voor hetzelfde percentage, niemand heeft de benchmarks overgedaan, en de open licentie loopt via een fork die alleen de fabrikant onderhoudt. De compressie en haar voetnoten samen vertellen is precies het register van deze site.