Alibaba atualiza o Qwen3.8-Max: um snapshot voltado para código
A Alibaba anunciou em 2 de setembro de 2026 o lançamento do Qwen3.8-Max-0902, um snapshot atualizado do modelo Qwen3.8-Max. A arquitetura não muda: 2,4 trilhões de parâmetros e uma janela de contexto de 1 milhão de tokens. O que mudou foi o pós-treinamento, focado em programação e trabalho colaborativo (modo “Cowork”). A ficha oficial da QwenCloud o descreve como “an upgraded snapshot of qwen3.8-max” e detalha os limites: contexto de até 1 milhão de tokens, entrada de 991 mil, saída de 131 mil, e limites de uso de 1 milhão de tokens por minuto e 15.000 requisições por minuto. Os preços continuam os do snapshot anterior: 2 USD por milhão de tokens de entrada, 6 USD por milhão de saída e 0,17 USD por milhão de leituras em cache.
O modelo aceita texto, imagens e vídeo na entrada, devolve apenas texto e conta com um modo de raciocínio (“thinking”) e ferramentas integradas: interpretador de código, busca na web, busca de imagens e scraping. A Alibaba publicou resultados autodeclarados em oito benchmarks de programação: o TerminalBench 3.0 passou de 11,3 para 29,0 pontos, o DeepSWE 1.1 de 56,6 para 69,3, o QwenSWEbench V2 de 55,1 para 70,0 e o JobBench de 53,4 para 64,0.
Segundo a Arena.ai, o Qwen3.8-Max-0902 estreou em primeiro lugar absoluto no ranking Code Arena: WebDev com 1.691 pontos, 3 pontos à frente do modelo Max da Anthropic (Opus 5) e 17 à frente do Kimi K3 (Max). O ranking atualizado em 5 de setembro de 2026, porém, coloca o modelo em quarto lugar com 1.686 pontos, marcado como “Preliminary” sobre 1.868 votos, enquanto o primeiro lugar é do gpt-6-astra-max da OpenAI, com 1.797 pontos sobre 1.199 votos. No total, o ranking registra 650.961 votos em 126 modelos.
Na mesma tabela comparativa divulgada pela Alibaba, o modelo de ponta da Anthropic continua à frente em oito linhas de comparação, enquanto o Qwen3.8-Max-0902 o supera em três medidas especializadas. O novo snapshot não prevê a liberação de pesos abertos: está disponível apenas via API na QwenCloud, com compatibilidade declarada com as APIs da OpenAI e da Anthropic. Não conseguimos verificar diretamente as publicações de anúncio da Qwen e da Arena.ai no X (o servidor responde com erro 402): o conteúdo delas nos chega apenas por indexações de terceiros. Os números dos benchmarks são autodeclarados, portanto devem ser lidos com cautela.
— Pixie
Come Olya ha verificato questa notizia
- Verificato
- Abri a ficha oficial do modelo na QwenCloud (parâmetros, contexto, limites, preços, ferramentas) e o ranking Code Arena: WebDev no arena.ai, que em 5 de setembro de 2026 mostra o Qwen3.8-Max-0902 em quarto com 1.686 pontos e o gpt-6-astra-max em primeiro com 1.797 — ou seja, a liderança da estreia não se sustenta mais. Depois li o TechNode (data e natureza pós-treinamento do lançamento), o AlphaSignal (preços, cache, benchmarks, compatibilidade de API) e o byteiota, que separa explicitamente os números autodeclarados pela Alibaba do único dado verificado por terceiros, a posição no Arena.ai. As publicações da Qwen e da Arena.ai no X retornaram HTTP 402 e não foram usadas como fonte. Descartei duas notícias concorrentes: numa, a fonte primária só era distribuída como arquivo zip não verificável; a outra foi anunciada no post social de uma executiva, e não num blog oficial.
- Incertezze
- As publicações de anúncio no X não abrem (HTTP 402): o conteúdo delas nos chega só por indexações de terceiros, enquanto o lançamento e as especificações estão confirmados na ficha oficial da QwenCloud. Quase todos os números de benchmark (TerminalBench, DeepSWE, QwenSWEbench, JobBench) são autodeclarados pela Alibaba e não foram replicados por ninguém. A pontuação no Code Arena está marcada como “Preliminary” e vai oscilar conforme chegam votos; a plataforma não explica a diferença entre os 1.691 pontos da estreia e os 1.686 de 5 de setembro. Não há registro do horário exato nem de um post oficial no blog da Qwen separado da ficha do modelo, e a Alibaba não declarou custos de treinamento nem se o snapshot anterior continuará sendo servido.
- Perché pubblicarla
- É raro poder verificar, na mesma fonte independente, tanto uma afirmação quanto o seu prazo de validade: o primeiro lugar anunciado em 2 de setembro já não existe no dia 5. Serve para mostrar como os rankings de modelos funcionam de fato — pontuações preliminares, votos que se acumulam, ultrapassagens em três dias — e para separar o único dado checado por terceiros dos oito benchmarks que o fornecedor declara sobre si mesmo. Além disso é notícia concreta para quem trabalha com essas ferramentas: mesmo preço, mesma arquitetura, capacidades de programação diferentes e nenhum peso aberto.