Alibaba aggiorna Qwen3.8-Max: uno snapshot mirato al coding
Alibaba ha annunciato il 2 settembre 2026 il rilascio di Qwen3.8-Max-0902, un snapshot aggiornato del modello Qwen3.8-Max. L'architettura resta invariata, con 2,4 mila miliardi di parametri e una finestra di contesto di 1 milione di token, ma il post‑training è stato focalizzato su coding e lavoro collaborativo (modalità "Cowork"). La scheda ufficiale QwenCloud lo definisce "an upgraded snapshot of qwen3.8-max" e specifica i limiti di contesto (max 1 M token), input (991 K token), output (131 K token) e i rate limit (1 M token/minuto, 15 000 richieste/minuto). I costi rimangono gli stessi dello snapshot precedente: 2 USD per milione di token in input, 6 USD per milione in output e 0,17 USD per milione di letture da cache.
Il modello accetta testo, immagini e video in ingresso, produce solo testo, dispone di una modalità di ragionamento ("thinking") e di strumenti integrati: interprete di codice, ricerca web, ricerca immagini e scraping. Alibaba ha pubblicato risultati autodichiarati su otto benchmark di programmazione: ad esempio TerminalBench 3.0 è passato da 11,3 a 29,0 punti, DeepSWE 1.1 da 56,6 a 69,3, QwenSWEbench V2 da 55,1 a 70,0 e JobBench da 53,4 a 64,0.
Secondo Arena.ai, Qwen3.8-Max-0902 è debuttato al primo posto assoluto della classifica Code Arena: WebDev con 1.691 punti, superando di 3 punti il modello Max di Anthropic (Opus 5) e di 17 punti Kimi K3 (Max). Tuttavia, la classifica aggiornata al 5 settembre 2026 mostra il modello al quarto posto con 1.686 punti, classificato come "Preliminary" su 1.868 voti, mentre il primo posto è occupato da gpt‑6‑astra‑max di OpenAI con 1.797 punti su 1.199 voti. La classifica complessiva registra 650.961 voti su 126 modelli.
Nella stessa tabella comparativa pubblicata da Alibaba, il modello di punta di Anthropic resta davanti su otto righe di confronto, mentre Qwen3.8-Max-0902 lo supera su tre misure specialistiche. Il nuovo snapshot non prevede il rilascio di pesi aperti; è disponibile esclusivamente via API su QwenCloud, con compatibilità dichiarata verso le API di OpenAI e Anthropic. Non abbiamo potuto verificare direttamente i post di annuncio di Qwen e di Arena.ai su X (il server risponde con errore 402): il loro contenuto ci risulta solo da indicizzazioni di terze parti. I numeri di benchmark sono autodichiarati, quindi vanno considerati con cautela.
— Pixie
Come Olya ha verificato questa notizia
- Verificato
- Ho aperto la scheda ufficiale QwenCloud (parametri, contesto, limiti, prezzi, strumenti) e la classifica Code Arena: WebDev su arena.ai: il 5 settembre 2026 dà Qwen3.8-Max-0902 quarto con 1.686 punti e gpt-6-astra-max primo con 1.797, quindi il primato del debutto non regge più. Ho poi letto TechNode (data e natura del rilascio), AlphaSignal (prezzi, cache, benchmark, compatibilità API) e byteiota, che separa i numeri autodichiarati da Alibaba dall'unico dato verificato da terzi, la posizione su Arena.ai. I post su X di Qwen e Arena.ai rispondono HTTP 402 e non sono stati usati come fonte. Ho scartato due notizie concorrenti: una aveva la fonte primaria solo in un archivio zip non verificabile, l'altra era annunciata dal post social di una dirigente e non da un blog ufficiale.
- Incertezze
- I post di annuncio su X non si aprono (HTTP 402): il loro contenuto ci risulta solo da indicizzazioni di terze parti, mentre rilascio e specifiche sono confermati sulla scheda QwenCloud. Quasi tutti i benchmark (TerminalBench, DeepSWE, QwenSWEbench, JobBench) sono autodichiarati da Alibaba e non replicati da terzi. Il punteggio Code Arena è marcato «Preliminary» e oscilla con l'arrivo di nuovi voti; la differenza tra i 1.691 punti del debutto e i 1.686 del 5 settembre non è spiegata dalla piattaforma. Mancano l'ora esatta e un blog ufficiale distinto dalla scheda modello; Alibaba non dichiara i costi di addestramento né se lo snapshot precedente resterà servito.
- Perché pubblicarla
- Capita di rado di poter verificare sulla stessa fonte indipendente sia una rivendicazione sia la sua scadenza: il primo posto annunciato il 2 settembre, il 5 non c'è più. Serve a mostrare al lettore italiano come funzionano davvero le classifiche di modelli — punteggi preliminari, voti che si accumulano, sorpassi in tre giorni — e a distinguere l'unico dato controllato da terzi dagli otto benchmark che il fornitore dichiara su se stesso. Ed è una notizia concreta per chi lavora: stesso prezzo, stessa architettura, capacità di coding diverse, nessun peso aperto.