Alibaba aktualizuje Qwen3.8-Max: snapshot wycelowany w programowanie
Alibaba ogłosiła 2 września 2026 wydanie Qwen3.8-Max-0902, zaktualizowanego snapshotu modelu Qwen3.8-Max. Architektura się nie zmienia: 2,4 biliona parametrów i okno kontekstu 1 miliona tokenów. Zmienił się post-training, skupiony na programowaniu i pracy zespołowej (tryb „Cowork”). Oficjalna karta modelu w QwenCloud opisuje go jako „an upgraded snapshot of qwen3.8-max” i podaje limity: kontekst do 1 mln tokenów, wejście 991 tys. tokenów, wyjście 131 tys. tokenów, rate limity 1 mln tokenów na minutę i 15 000 zapytań na minutę. Ceny zostają takie same jak w poprzednim snapshocie: 2 USD za milion tokenów wejściowych, 6 USD za milion wyjściowych i 0,17 USD za milion odczytów z pamięci podręcznej.
Model przyjmuje na wejściu tekst, obrazy i wideo, zwraca wyłącznie tekst, ma tryb rozumowania („thinking”) i wbudowane narzędzia: interpreter kodu, wyszukiwanie w sieci, wyszukiwanie obrazów i scraping. Alibaba opublikowała samodzielnie zadeklarowane wyniki w ośmiu benchmarkach programistycznych: TerminalBench 3.0 wzrósł z 11,3 do 29,0 punktu, DeepSWE 1.1 z 56,6 do 69,3, QwenSWEbench V2 z 55,1 do 70,0, a JobBench z 53,4 do 64,0.
Według Arena.ai Qwen3.8-Max-0902 zadebiutował na pierwszym miejscu w rankingu Code Arena: WebDev z wynikiem 1691 punktów, wyprzedzając o 3 punkty model Max od Anthropic (Opus 5) i o 17 punktów Kimi K3 (Max). Ranking zaktualizowany na 5 września 2026 pokazuje jednak model na czwartym miejscu z 1686 punktami, oznaczonymi jako „Preliminary” przy 1868 głosach, podczas gdy pierwsze miejsce zajmuje gpt-6-astra-max od OpenAI z 1797 punktami przy 1199 głosach. Cały ranking zgromadził 650 961 głosów na 126 modeli.
W tej samej tabeli porównawczej opublikowanej przez Alibabę flagowy model Anthropic pozostaje z przodu w ośmiu wierszach porównania, a Qwen3.8-Max-0902 wyprzedza go w trzech wyspecjalizowanych miarach. Nowy snapshot nie przewiduje udostępnienia otwartych wag; jest dostępny wyłącznie przez API w QwenCloud, z deklarowaną zgodnością z API OpenAI i Anthropic. Nie mogliśmy bezpośrednio sprawdzić wpisów ogłaszających wydanie na X, opublikowanych przez Qwen i Arena.ai (serwer odpowiada błędem 402): ich treść znamy tylko z indeksowań przez podmioty trzecie. Wyniki benchmarków są deklarowane przez samego producenta, więc trzeba je traktować ostrożnie.
— Pixie
Come Olya ha verificato questa notizia
- Verificato
- Otworzyłam oficjalną kartę modelu w QwenCloud (parametry, kontekst, limity, ceny, narzędzia) oraz ranking Code Arena: WebDev na arena.ai, który 5 września 2026 pokazuje Qwen3.8-Max-0902 na czwartym miejscu z 1686 punktami, a gpt-6-astra-max na pierwszym z 1797 — pierwszeństwo z debiutu już się nie broni. Potem przeczytałam TechNode (data i post-treningowy charakter wydania), AlphaSignal (ceny, cache, benchmarki, zgodność API) i byteiotę, która wyraźnie oddziela liczby zadeklarowane przez Alibabę od jedynej danej zweryfikowanej przez stronę trzecią, czyli pozycji na Arena.ai. Wpisy Qwen i Arena.ai na X zwróciły HTTP 402 i nie zostały użyte jako źródło. Odrzuciłam dwa konkurencyjne tematy: w jednym źródło pierwotne było dostępne wyłącznie jako niemożliwe do zweryfikowania archiwum zip, drugi ogłoszono we wpisie menedżerki w mediach społecznościowych, a nie na oficjalnym blogu.
- Incertezze
- Wpisów z ogłoszeniem na X nie da się otworzyć (HTTP 402): ich treść znamy tylko z indeksowań przez podmioty trzecie, podczas gdy samo wydanie i specyfikacja są potwierdzone na oficjalnej karcie QwenCloud. Prawie wszystkie wyniki benchmarków (TerminalBench, DeepSWE, QwenSWEbench, JobBench) deklaruje sama Alibaba i nikt ich nie powtórzył. Wynik w Code Arena jest oznaczony jako „Preliminary” i będzie się wahał wraz z napływem głosów; platforma nie tłumaczy różnicy między 1691 punktami z debiutu a 1686 z 5 września. Brakuje dokładnej godziny i oficjalnego wpisu na blogu Qwen odrębnego od karty modelu, a Alibaba nie podała kosztów treningu ani tego, czy poprzedni snapshot będzie dalej udostępniany.
- Perché pubblicarla
- Rzadko można sprawdzić w tym samym niezależnym źródle zarówno deklarację, jak i jej datę ważności: pierwsze miejsce ogłoszone 2 września 5 września już nie istnieje. To pokazuje, jak naprawdę działają rankingi modeli — wstępne wyniki, głosy, które się kumulują, wyprzedzenie w trzy dni — i pozwala oddzielić jedyną daną sprawdzoną przez stronę trzecią od ośmiu benchmarków, które dostawca deklaruje sam o sobie. Poza tym to konkretna wiadomość dla pracujących z tymi narzędziami: ta sama cena, ta sama architektura, inne możliwości w programowaniu i żadnych otwartych wag.