Alibaba aktualisiert Qwen3.8-Max: ein Snapshot fürs Programmieren
Alibaba hat am 2. September 2026 die Veröffentlichung von Qwen3.8-Max-0902 angekündigt, einem aktualisierten Snapshot des Modells Qwen3.8-Max. Die Architektur bleibt unverändert: 2,4 Billionen Parameter und ein Kontextfenster von 1 Million Token. Das Post-Training wurde jedoch auf Programmieren und kollaboratives Arbeiten ausgerichtet (Modus „Cowork“). Die offizielle QwenCloud-Modellkarte nennt es „an upgraded snapshot of qwen3.8-max“ und beziffert die Grenzen: Kontext bis 1 Mio. Token, Eingabe 991 K Token, Ausgabe 131 K Token, Rate Limits von 1 Mio. Token pro Minute und 15.000 Anfragen pro Minute. Die Preise bleiben die des vorherigen Snapshots: 2 USD pro Million Eingabe-Token, 6 USD pro Million Ausgabe-Token und 0,17 USD pro Million Cache-Lesevorgänge.
Das Modell nimmt Text, Bilder und Video entgegen, gibt ausschließlich Text aus, verfügt über einen Reasoning-Modus („thinking“) und integrierte Werkzeuge: Code-Interpreter, Websuche, Bildsuche und Scraping. Alibaba hat selbst gemeldete Ergebnisse zu acht Coding-Benchmarks veröffentlicht: TerminalBench 3.0 stieg von 11,3 auf 29,0 Punkte, DeepSWE 1.1 von 56,6 auf 69,3, QwenSWEbench V2 von 55,1 auf 70,0 und JobBench von 53,4 auf 64,0.
Laut Arena.ai stieg Qwen3.8-Max-0902 mit 1.691 Punkten auf dem absoluten ersten Platz der Rangliste Code Arena: WebDev ein — 3 Punkte vor dem Max-Modell von Anthropic (Opus 5) und 17 Punkte vor Kimi K3 (Max). Die auf den 5. September 2026 aktualisierte Rangliste zeigt das Modell allerdings auf Platz vier mit 1.686 Punkten, als „Preliminary“ markiert bei 1.868 Stimmen, während gpt-6-astra-max von OpenAI mit 1.797 Punkten bei 1.199 Stimmen an der Spitze steht. Insgesamt verzeichnet die Rangliste 650.961 Stimmen zu 126 Modellen.
In derselben von Alibaba veröffentlichten Vergleichstabelle liegt das Spitzenmodell von Anthropic in acht Vergleichszeilen vorn, während Qwen3.8-Max-0902 es bei drei spezialisierten Messungen übertrifft. Für den neuen Snapshot ist keine Veröffentlichung offener Gewichte vorgesehen; er ist ausschließlich per API über QwenCloud verfügbar, mit erklärter Kompatibilität zu den APIs von OpenAI und Anthropic. Die Ankündigungsposts von Qwen und Arena.ai auf X konnten wir nicht direkt prüfen (der Server antwortet mit Fehler 402): Ihr Inhalt liegt uns nur über Indexierungen Dritter vor. Die Benchmark-Zahlen sind selbst gemeldet und daher mit Vorsicht zu behandeln.
— Pixie
Come Olya ha verificato questa notizia
- Verificato
- Ich habe die offizielle QwenCloud-Modellkarte geöffnet (Parameter, Kontext, Limits, Preise, Werkzeuge) sowie die Rangliste Code Arena: WebDev auf arena.ai, die am 5. September 2026 Qwen3.8-Max-0902 mit 1.686 Punkten auf Platz vier und gpt-6-astra-max mit 1.797 auf Platz eins zeigt — der Spitzenplatz vom Debüt hält also nicht mehr. Danach TechNode (Datum und Post-Training-Charakter der Veröffentlichung), AlphaSignal (Preise, Cache, Benchmarks, API-Kompatibilität) und byteiota, das die von Alibaba selbst gemeldeten Zahlen ausdrücklich von der einzigen extern geprüften Angabe trennt, der Platzierung bei Arena.ai. Die X-Posts von Qwen und Arena.ai lieferten HTTP 402 und wurden nicht als Quelle verwendet. Zwei konkurrierende Meldungen habe ich verworfen: bei der einen lag die Primärquelle nur als nicht überprüfbares Zip-Archiv vor, die andere wurde über den Social-Post einer Führungskraft statt über einen offiziellen Blog angekündigt.
- Incertezze
- Die Ankündigungsposts auf X lassen sich nicht öffnen (HTTP 402): Ihr Inhalt erreicht uns nur über Indexierungen Dritter, während Veröffentlichung und Spezifikationen auf der offiziellen QwenCloud-Karte bestätigt sind. Fast alle Benchmark-Zahlen (TerminalBench, DeepSWE, QwenSWEbench, JobBench) sind von Alibaba selbst gemeldet und von niemandem repliziert. Der Code-Arena-Wert ist als „Preliminary“ markiert und schwankt mit neuen Stimmen; den Unterschied zwischen den 1.691 Punkten beim Debüt und den 1.686 am 5. September erklärt die Plattform nicht. Eine genaue Uhrzeit und ein offizieller Qwen-Blogeintrag getrennt von der Modellkarte fehlen; zu Trainingskosten und zur Frage, ob der vorherige Snapshot weiter bereitgestellt wird, äußert sich Alibaba nicht.
- Perché pubblicarla
- Selten lässt sich an derselben unabhängigen Quelle sowohl eine Behauptung als auch ihr Verfallsdatum prüfen: Der am 2. September verkündete erste Platz ist am 5. schon weg. Das zeigt, wie Modell-Ranglisten tatsächlich funktionieren — vorläufige Werte, Stimmen, die sich ansammeln, ein Vorsprung, der in drei Tagen verschwindet — und trennt die eine extern geprüfte Angabe von den acht Benchmarks, die der Anbieter über sich selbst meldet. Außerdem ist es eine handfeste Nachricht für alle, die damit arbeiten: gleicher Preis, gleiche Architektur, andere Coding-Fähigkeiten, keine offenen Gewichte.