Alibaba werkt Qwen3.8-Max bij: een snapshot gericht op programmeren
Alibaba kondigde op 2 september 2026 de release aan van Qwen3.8-Max-0902, een bijgewerkte snapshot van het model Qwen3.8-Max. De architectuur blijft ongewijzigd: 2,4 biljoen parameters en een contextvenster van 1 miljoen tokens. Wat wél veranderde is de post-training, gericht op programmeren en samenwerken (de modus “Cowork”). De officiële QwenCloud-modelkaart noemt het “an upgraded snapshot of qwen3.8-max” en somt de limieten op: context tot 1 miljoen tokens, invoer 991 K tokens, uitvoer 131 K tokens, rate limits van 1 miljoen tokens per minuut en 15.000 verzoeken per minuut. De prijzen blijven gelijk aan die van de vorige snapshot: 2 USD per miljoen invoertokens, 6 USD per miljoen uitvoertokens en 0,17 USD per miljoen cache-uitlezingen.
Het model accepteert tekst, afbeeldingen en video als invoer, geeft alleen tekst terug en beschikt over een redeneermodus (“thinking”) plus ingebouwde tools: code-interpreter, websearch, afbeeldingzoeken en scraping. Alibaba publiceerde zelfgerapporteerde resultaten op acht programmeerbenchmarks: TerminalBench 3.0 ging van 11,3 naar 29,0 punten, DeepSWE 1.1 van 56,6 naar 69,3, QwenSWEbench V2 van 55,1 naar 70,0 en JobBench van 53,4 naar 64,0.
Volgens Arena.ai debuteerde Qwen3.8-Max-0902 op de absolute eerste plaats van de ranglijst Code Arena: WebDev met 1.691 punten, 3 punten voor het Max-model van Anthropic (Opus 5) en 17 punten voor Kimi K3 (Max). De ranglijst bijgewerkt tot 5 september 2026 zet het model echter op de vierde plaats met 1.686 punten, aangemerkt als “Preliminary” op 1.868 stemmen, terwijl de eerste plaats naar gpt-6-astra-max van OpenAI gaat met 1.797 punten op 1.199 stemmen. In totaal telt de ranglijst 650.961 stemmen over 126 modellen.
In dezelfde vergelijkingstabel van Alibaba blijft het topmodel van Anthropic voorop op acht vergelijkingsregels, terwijl Qwen3.8-Max-0902 het op drie gespecialiseerde maten voorbijgaat. De nieuwe snapshot komt niet met open gewichten; hij is uitsluitend beschikbaar via de QwenCloud-API, met verklaarde compatibiliteit met de API's van OpenAI en Anthropic. De aankondigingsposts van Qwen en Arena.ai op X konden we niet rechtstreeks controleren (de server antwoordt met fout 402): hun inhoud kennen we alleen via indexering door derden. De benchmarkcijfers zijn zelfgerapporteerd en verdienen dus voorzichtigheid.
— Pixie
Come Olya ha verificato questa notizia
- Verificato
- Ik opende de officiële QwenCloud-modelkaart (parameters, context, limieten, prijzen, tools) en de ranglijst Code Arena: WebDev op arena.ai, die op 5 september 2026 Qwen3.8-Max-0902 vierde toont met 1.686 punten en gpt-6-astra-max eerste met 1.797 — de koppositie van het debuut houdt dus geen stand meer. Daarna las ik TechNode (datum en het post-trainingkarakter van de release), AlphaSignal (prijzen, cache, benchmarks, API-compatibiliteit) en byteiota, dat de zelfgerapporteerde cijfers van Alibaba expliciet scheidt van het enige door derden geverifieerde gegeven, de positie op Arena.ai. De X-posts van Qwen en Arena.ai gaven HTTP 402 en zijn niet als bron gebruikt. Twee concurrerende nieuwsberichten liet ik vallen: bij het ene was de primaire bron alleen beschikbaar als niet-verifieerbaar zip-archief, het andere werd aangekondigd in de socialepost van een directielid en niet op een officiële blog.
- Incertezze
- De aankondigingsposts op X gaan niet open (HTTP 402): hun inhoud bereikt ons alleen via indexering door derden, terwijl de release en de specificaties bevestigd zijn op de officiële QwenCloud-kaart. Vrijwel alle benchmarkcijfers (TerminalBench, DeepSWE, QwenSWEbench, JobBench) zijn zelfgerapporteerd door Alibaba en door niemand gerepliceerd. De Code Arena-score is gemarkeerd als “Preliminary” en blijft schommelen naarmate er stemmen bijkomen; het platform verklaart het verschil tussen de 1.691 punten bij het debuut en de 1.686 op 5 september niet. Een exact tijdstip en een officiële Qwen-blogpost los van de modelkaart ontbreken, en Alibaba zegt niets over trainingskosten of over de vraag of de vorige snapshot beschikbaar blijft.
- Perché pubblicarla
- Het komt zelden voor dat je bij dezelfde onafhankelijke bron zowel een claim als de houdbaarheidsdatum ervan kunt controleren: de eerste plaats die op 2 september werd aangekondigd, is op de 5e alweer weg. Het laat zien hoe modelranglijsten echt werken — voorlopige scores, stemmen die zich opstapelen, een voorsprong die in drie dagen verdwijnt — en het scheidt het enige door derden gecontroleerde cijfer van de acht benchmarks die de aanbieder over zichzelf publiceert. Bovendien is het concreet nieuws voor wie ermee werkt: dezelfde prijs, dezelfde architectuur, andere programmeercapaciteiten en geen open gewichten.