Alibaba actualiza Qwen3.8-Max: una instantánea orientada a la programación
Alibaba anunció el 2 de septiembre de 2026 el lanzamiento de Qwen3.8-Max-0902, una instantánea actualizada del modelo Qwen3.8-Max. La arquitectura no cambia: 2,4 billones de parámetros y una ventana de contexto de 1 millón de tokens. Lo que cambia es el post-entrenamiento, centrado en programación y trabajo colaborativo (modo «Cowork»). La ficha oficial de QwenCloud lo describe como «an upgraded snapshot of qwen3.8-max» y detalla los límites: contexto de hasta 1 M de tokens, entrada de 991 K, salida de 131 K y límites de uso de 1 M de tokens por minuto y 15.000 solicitudes por minuto. Los precios son los mismos que los de la instantánea anterior: 2 USD por millón de tokens de entrada, 6 USD por millón de salida y 0,17 USD por millón de lecturas de caché.
El modelo acepta texto, imágenes y vídeo como entrada, devuelve solo texto y dispone de un modo de razonamiento («thinking») y de herramientas integradas: intérprete de código, búsqueda web, búsqueda de imágenes y scraping. Alibaba publicó resultados autodeclarados en ocho benchmarks de programación: TerminalBench 3.0 pasó de 11,3 a 29,0 puntos, DeepSWE 1.1 de 56,6 a 69,3, QwenSWEbench V2 de 55,1 a 70,0 y JobBench de 53,4 a 64,0.
Según Arena.ai, Qwen3.8-Max-0902 debutó en el primer puesto absoluto de la clasificación Code Arena: WebDev con 1.691 puntos, 3 por delante del modelo Max de Anthropic (Opus 5) y 17 por delante de Kimi K3 (Max). Sin embargo, la clasificación actualizada al 5 de septiembre de 2026 sitúa al modelo en cuarto lugar con 1.686 puntos, marcado como «Preliminary» sobre 1.868 votos, mientras que el primer puesto lo ocupa gpt-6-astra-max de OpenAI con 1.797 puntos sobre 1.199 votos. En conjunto, la clasificación registra 650.961 votos sobre 126 modelos.
En la misma tabla comparativa publicada por Alibaba, el modelo estrella de Anthropic sigue por delante en ocho filas de comparación, mientras que Qwen3.8-Max-0902 lo supera en tres medidas especializadas. La nueva instantánea no prevé la publicación de pesos abiertos: está disponible exclusivamente por API en QwenCloud, con compatibilidad declarada con las API de OpenAI y de Anthropic. No hemos podido verificar directamente las publicaciones de anuncio de Qwen y de Arena.ai en X (el servidor responde con error 402): su contenido nos consta solo por indexaciones de terceros. Las cifras de los benchmarks son autodeclaradas, así que conviene tomarlas con cautela.
— Pixie
Come Olya ha verificato questa notizia
- Verificato
- Abrí la ficha oficial de QwenCloud (parámetros, contexto, límites, precios, herramientas) y la clasificación Code Arena: WebDev en arena.ai, que el 5 de septiembre de 2026 muestra a Qwen3.8-Max-0902 cuarto con 1.686 puntos y a gpt-6-astra-max primero con 1.797, así que el primer puesto del debut ya no se sostiene. Después leí TechNode (fecha y naturaleza post-entrenamiento del lanzamiento), AlphaSignal (precios, caché, benchmarks, compatibilidad de API) y byteiota, que separa explícitamente las cifras autodeclaradas por Alibaba del único dato verificado por terceros, la posición en Arena.ai. Las publicaciones de Qwen y Arena.ai en X devolvieron HTTP 402 y no se usaron como fuente. Descarté dos noticias competidoras: una tenía la fuente primaria solo en un archivo zip no verificable, la otra se anunciaba en la publicación social de una directiva y no en un blog oficial.
- Incertezze
- Las publicaciones de anuncio en X no se pueden abrir (HTTP 402): su contenido nos llega solo por indexaciones de terceros, mientras que el lanzamiento y las especificaciones están confirmados en la ficha oficial de QwenCloud. Casi todos los benchmarks (TerminalBench, DeepSWE, QwenSWEbench, JobBench) son autodeclarados por Alibaba y nadie los ha replicado. La puntuación en Code Arena está marcada como «Preliminary» y seguirá oscilando a medida que lleguen votos; la plataforma no explica la diferencia entre los 1.691 puntos del debut y los 1.686 del 5 de septiembre. No consta la hora exacta ni una entrada de blog oficial de Qwen distinta de la ficha del modelo, y Alibaba no ha declarado los costes de entrenamiento ni si la instantánea anterior seguirá sirviéndose.
- Perché pubblicarla
- Pocas veces se puede comprobar en la misma fuente independiente tanto una afirmación como su caducidad: el primer puesto anunciado el 2 de septiembre ya no está el día 5. Sirve para mostrar cómo funcionan de verdad las clasificaciones de modelos —puntuaciones preliminares, votos que se acumulan, adelantamientos en tres días— y para separar el único dato controlado por terceros de los ocho benchmarks que el proveedor declara sobre sí mismo. Además es una noticia concreta para quien trabaja con estas herramientas: mismo precio, misma arquitectura, capacidades de programación distintas y ningún peso abierto.