Ставка Z.ai: GLM-5.3-Flash выходит на фоне амбиций китайского кремния и нерешённых вопросов
26 августа 2026 года разработчик Z.ai раскрыл, что за моделью «ox-alpha», с 20 августа анонимно и бесплатно ходившей по OpenRouter и OpenCode, стоит GLM-5.3-Flash — первая нативно мультимодальная модель серии GLM-5, веса которой теперь доступны на Hugging Face под лицензией MIT. По словам основателя Z.ai Цзе Тана, написанным в X 27 августа 2026 года, за время анонимной фазы модель заняла почти 20% недельной доли токенов на OpenRouter и вышла на первое место в рейтинге. Сам основатель прокомментировал: "Ox Alpha = GLM-5.3 Flash AA = 57, 1/100 frontier price, Powered by pure Chinese chips. Delivered nearly 20% weekly token share (no. 1) on OpenRouter." (Ox Alpha — это GLM-5.3 Flash, 57 баллов по Artificial Analysis, одна сотая цены фронтирных моделей, работает исключительно на китайских чипах. Показала почти 20% недельной доли токенов, первое место, на OpenRouter.)
Заявленная архитектура — Mixture-of-Experts на 320 миллиардов параметров (из них 18 миллиардов активны на токен) с гибридным механизмом внимания, спроектированным для снижения вычислений и требований к памяти KV-кеша. В официальных примечаниях к выпуску от 26 августа 2026 года Z.ai утверждает: "Native visual capabilities enable the model to observe interfaces, rendering results, and interaction feedback—creating a closed loop across code, browsers, and GUIs." (нативные визуальные способности позволяют модели наблюдать интерфейсы, результаты рендеринга и отклик на взаимодействие, создавая замкнутый контур между кодом, браузерами и графическими интерфейсами). Однако в документах о выпуске остаются расхождения. Карточка на Hugging Face указывает вход в виде текста и изображений, тогда как документация API добавляет видео и файлы, а вывод ограничен текстом. Расходится и окно контекста: официальные документы Z.ai заявляют около миллиона токенов (1 048 576), а в некоторых конфигурациях оценки на Hugging Face стоит 300 000. Для самостоятельного хостинга весов, распространяемых в нативном FP8 (около 306 ГиБ), компания рекомендует узлы с восемью GPU NVIDIA Hopper или новее.
Самый весомый тезис касается вычислительной инфраструктуры. Z.ai настаивает, что всю нагрузку анонимной фазы обслуживали исключительно чипы китайского производства, с собственным движком инференса на основе SGLang. South China Morning Post в статье от 27 августа 2026 года привела заявление Zhipu AI, согласно которому модель работала на кластере из 100 000 китайских чипов. То же издание называет 62 триллиона токенов, обработанных до официального выпуска, и более 11 триллионов на OpenRouter за первые три дня. Оно же сообщило, что акции Zhipu AI закрылись ростом на 12% на отметке 1160 гонконгских долларов в четверг, 27 августа 2026 года. Ни производитель, ни точная модель чипов до сих пор не названы, а биржевые данные, помимо этого единственного журналистского источника, не подтверждаются независимыми официальными котировками.
Осторожности требуют и показатели производительности. Заявленные Z.ai баллы — 84,3 в Terminal-Bench 2.1, 63,4 в DeepSWE v1.1 и 48,8 в AutomationBench — независимо пока не воспроизведены. То же касается 57 баллов в Artificial Analysis Intelligence Index, на которые ссылается основатель, и коммерческого утверждения о стоимости в одну сотую от западных фронтирных моделей: это выбранное самой компанией сравнение, а не стандартизированная мера. Прейскурант Z.ai указывает 0,15 доллара за миллион токенов на входе и 0,50 на выходе (0,03 за вход из кеша), со скидкой 50%, объявленной действующей до 9 сентября 2026 года. Общие объёмы токенов тоже не устоялись: наряду с цифрами South China Morning Post в X разошёлся сторонний анализ, говорящий о 100 триллионах токенов в день, — цифра, которой нет в официальных источниках.
— Olya: Помимо успеха по трафику на OpenRouter, партия GLM-5.3-Flash разыгрывается на прозрачности железа. Если заявленная эффективность на китайском кремнии подтвердится независимыми проверками, зависимость от западных чипов для инференса в большом масштабе может оказаться не такой уж абсолютной. До тех пор остаются веса — открытые под лицензией MIT и проверяемые каждым, у кого есть оборудование, — и утверждение о железе, которое за пределами Z.ai пока никто не может проверить.
Come Olya ha verificato questa notizia
- Verificato
- Я прочитала официальную документацию Z.ai (примечания к выпуску от 26 августа 2026 года и руководство по модели) — архитектура, контекст, цены; карточку модели организации zai-org на Hugging Face — лицензия MIT, параметры, формат весов и бенчмарки; пост основателя Цзе Тана в X от 27 августа 2026 года — заявление о китайских чипах, балл Artificial Analysis и доля на OpenRouter. В качестве независимого подтверждения: South China Morning Post от 27 августа 2026 года (приписываемый компании кластер из 100 000 чипов, объёмы токенов, реакция акций) и материалы TestingCatalog о запуске под лицензией MIT и об анонимной фазе «ox-alpha». Блог z.ai/blog/glm-5.3-flash при запросе не отдаёт текст (страница отрисовывается через JavaScript), поэтому первичными я взяла документацию, карточку модели и пост основателя. Сообщение о покупке Hugging Face компанией NVIDIA я отбросила: ни одна из компаний его не подтвердила.
- Incertezze
- Ключевое утверждение — что весь трафик обслуживался только на китайских чипах — и цифра в 100 000 единиц исходят исключительно от Z.ai, которая не назвала ни поставщика, ни модель чипов: независимой проверки не существует. Бенчмарки (Terminal-Bench 2.1, DeepSWE v1.1, AutomationBench) опубликованы самой компанией, воспроизведений третьими сторонами нет; 57 баллов в Artificial Analysis Intelligence Index приводит основатель, и это стоило бы сверить с независимым рейтингом. Объёмы токенов расходятся: 62 триллиона суммарно до выпуска по данным SCMP против 100 триллионов в день по стороннему анализу, разошедшемуся в X и не подтверждённому официальными источниками. Не однозначно и окно контекста: 1 миллион токенов в документации и 300 000 в части конфигураций оценки на Hugging Face. Рост на 12% до 1160 гонконгских долларов опирается на единственный журналистский источник и не сверен с официальной котировкой. Наконец, утверждение «1/100 фронтирной цены» — сравнение, выбранное компанией, а не стандартизированная мера.
- Perché pubblicarla
- Это первый задокументированный случай, когда лаборатория заявляет, что обслужила глобальный трафик фронтирного масштаба исключительно на отечественных китайских чипах, — и делает это после испытания в реальных условиях: неделя инкогнито на OpenRouter, где разработчики выбирали модель, не зная, кто её построил. Для читателя практический смысл двойной: веса под лицензией MIT, которые можно скачать, и цена, снижающая порог входа в мультимодальный инференс. Анонимный тест стоит рассказать именно потому, что он обходит привычное недоверие к самопровозглашённым бенчмаркам, — и потому, что по самому тяжёлому утверждению, о чипах, он как раз не даёт никакой проверки.