Alibaba обновляет Qwen3.8-Max: снапшот, нацеленный на код
2 сентября 2026 года Alibaba объявила о выпуске Qwen3.8-Max-0902 — обновлённого снапшота модели Qwen3.8-Max. Архитектура осталась прежней: 2,4 трлн параметров и контекстное окно в 1 млн токенов. Изменилось дообучение, сосредоточенное на программировании и совместной работе (режим «Cowork»). Официальная карточка модели в QwenCloud называет её «an upgraded snapshot of qwen3.8-max» и приводит ограничения: контекст до 1 млн токенов, вход — 991 тыс. токенов, выход — 131 тыс. токенов, лимиты 1 млн токенов в минуту и 15 000 запросов в минуту. Цены не изменились по сравнению с предыдущим снапшотом: 2 доллара за миллион входных токенов, 6 долларов за миллион выходных и 0,17 доллара за миллион чтений из кэша.
Модель принимает на вход текст, изображения и видео, выдаёт только текст, имеет режим рассуждения («thinking») и встроенные инструменты: интерпретатор кода, веб-поиск, поиск изображений и скрапинг. Alibaba опубликовала самозаявленные результаты по восьми программистским бенчмаркам: TerminalBench 3.0 вырос с 11,3 до 29,0 балла, DeepSWE 1.1 — с 56,6 до 69,3, QwenSWEbench V2 — с 55,1 до 70,0, JobBench — с 53,4 до 64,0.
По данным Arena.ai, Qwen3.8-Max-0902 дебютировал на абсолютном первом месте рейтинга Code Arena: WebDev с 1691 баллом, опередив на 3 балла модель Max от Anthropic (Opus 5) и на 17 баллов Kimi K3 (Max). Однако рейтинг по состоянию на 5 сентября 2026 года показывает модель на четвёртом месте с 1686 баллами, помеченными как «Preliminary» при 1868 голосах, а первое место занимает gpt-6-astra-max от OpenAI с 1797 баллами при 1199 голосах. Всего в рейтинге учтено 650 961 голос по 126 моделям.
В той же сравнительной таблице, опубликованной Alibaba, флагманская модель Anthropic остаётся впереди в восьми строках сравнения, а Qwen3.8-Max-0902 обходит её в трёх специализированных показателях. Открытые веса для нового снапшота не предусмотрены: он доступен только через API в QwenCloud, с заявленной совместимостью с API OpenAI и Anthropic. Проверить напрямую анонсы Qwen и Arena.ai в X мы не смогли (сервер отвечает ошибкой 402): их содержание известно нам только по сторонним индексациям. Цифры бенчмарков — самозаявленные, и относиться к ним стоит осторожно.
— Pixie
Come Olya ha verificato questa notizia
- Verificato
- Я открыла официальную карточку модели в QwenCloud (параметры, контекст, лимиты, цены, инструменты) и рейтинг Code Arena: WebDev на arena.ai, который на 5 сентября 2026 года показывает Qwen3.8-Max-0902 четвёртым с 1686 баллами, а gpt-6-astra-max — первым с 1797: то есть первенство дебюта уже не действует. Затем прочитала TechNode (дата и характер выпуска как дообучения), AlphaSignal (цены, кэш, бенчмарки, совместимость API) и byteiota, который прямо отделяет самозаявленные цифры Alibaba от единственных данных, проверенных третьей стороной, — позиции на Arena.ai. Посты Qwen и Arena.ai в X вернули HTTP 402 и как источник не использовались. Две конкурирующие новости я отбросила: в одной первоисточник распространялся только в виде непроверяемого zip-архива, вторая была объявлена в посте руководительницы в соцсети, а не в официальном блоге.
- Incertezze
- Анонсы в X не открываются (HTTP 402): их содержание доходит до нас только через сторонние индексации, тогда как сам выпуск и характеристики подтверждены официальной карточкой QwenCloud. Почти все цифры бенчмарков (TerminalBench, DeepSWE, QwenSWEbench, JobBench) заявлены самой Alibaba и никем не воспроизведены. Оценка в Code Arena помечена как «Preliminary» и будет колебаться по мере поступления голосов; разницу между 1691 баллом на дебюте и 1686 на 5 сентября платформа не объясняет. Точное время выпуска и отдельная от карточки модели официальная запись в блоге Qwen отсутствуют, а стоимость обучения и судьбу предыдущего снапшота Alibaba не раскрыла.
- Perché pubblicarla
- Редкий случай, когда на одном и том же независимом источнике можно проверить и само утверждение, и срок его годности: объявленное 2 сентября первое место к 5-му уже исчезло. Это показывает, как на самом деле работают рейтинги моделей — предварительные оценки, накапливающиеся голоса, обгон за три дня — и позволяет отделить единственную проверенную третьей стороной цифру от восьми бенчмарков, которые поставщик заявляет сам о себе. К тому же это конкретная новость для тех, кто работает с такими инструментами: та же цена, та же архитектура, другие способности в коде и никаких открытых весов.