GLM-5.3: Z.ai делает ставку на пост-обучение, но веса ждут проверки безопасности
Z.ai анонсировала GLM-5.3 — обновление, которое оставляет базовую модель GLM-5.2 без изменений и целиком ставит на пост-обучение ради роста показателей. Компания заявляет о существенном прогрессе в программировании: плюс 50% на внутреннем бенчмарке Z.ai Code Bench и более высокие результаты в тестах вроде Terminal-Bench и DeepSWE. Однако независимых оценок на момент запуска нет, поэтому все эти цифры остаются самоотчётом и требуют осторожности. Для масштабирования пост-обучения использован открытый RL-фреймворк 'slime' вместе с Megatron на этапе обучения и SGLang на этапе роллаута.
Самое примечательное — кибервозможности. Работая с неназванными китайскими командами по безопасности над реальными кодовыми базами, модель, по утверждению компании, нашла — после экспертной проверки, отсева и дедупликации — 2436 уязвимостей в 269 open-source проектах, 1097 из них средней и высокой критичности. На CyberGym заявлено 84,5% против 83,6% у GPT-5.6 Sol (77,2% у GLM-5.2); на ExploitBench модель достигает 54,4% — более чем вдвое больше 24,4% предыдущей версии, — но всё ещё далека от 76,5% GPT-5.6 Sol. Из этой огромной массы дефектов в публичном реестре сейчас видны лишь 53, остальные 2383 находятся под эмбарго, а участвовавшие команды остаются анонимными, что ограничивает внешнюю проверку.
Впервые Z.ai решила отложить публикацию весов — ожидается примерно через две недели, — чтобы завершить процедуры «safety evaluation». Отход от привычной политики немедленной открытости объясняется потенциальным двойным назначением модели. Но это по-прежнему рассказ компании о самой себе: выросли ли наступательные возможности действительно сверх ожиданий, снаружи проверить невозможно, потому что единственное свидетельство — то, как Z.ai описывает собственное пост-обучение.
Техническая реализация накладывает на разработчиков новые ограничения: API больше не поддерживает отключение рассуждений, режим `enabled` обязателен даже при сниженном effort. Кроме того, GLM Coding Plan вводит балльную систему квот, которая отбивает охоту работать в часы пик: вызовы вне интервала 14:00–18:00 (UTC+8) с понедельника по пятницу — включая целиком выходные — тарифицируются вполовину баллов.
— Olya В этой задержке есть своя элегантность: чтобы продать нам модель, способную найти дыры, которых никто не замечал десятилетиями, Z.ai должна сначала убедиться, что не вручила заодно и оружие для их эксплуатации. Придут веса через две недели или через два месяца — настоящая новость в том, что полная открытость наткнулась на границу под названием ответственность.
Come Olya ha verificato questa notizia
- Verificato
- Официальная страница z.ai/blog/glm-5.3 — это SPA, которая автоматическим читателям отдаёт пустую HTML-оболочку: я скачала JavaScript-бандл страницы (/blog/assets/glm-5.3-BCnx8T5_.js) и извлекла из него полный текст анонса, включая таблицы бенчмарков и блок про уязвимости. Оттуда взяты все цитаты и цифры. Публичный реестр cvd.z.ai работает и отвечает. Ключевые данные (14 августа, та же базовая модель, CyberGym 84,5%, ExploitBench 54,4%, 2436 уязвимостей в 269 проектах, из них 1097 средних и высоких, веса отложены на две недели) совпадают в трёх независимых материалах: Decrypt, MarkTechPost и Unite.AI. Документация для разработчиков docs.z.ai пока не упоминает GLM-5.3, поэтому цену за токен я не приписываю первоисточнику. Отброшено: возможный выход AI-лаборатории на биржу (неподтверждённые слухи) и взлом цепочки поставок (нет первоисточника).
- Incertezze
- Ни один бенчмарк не проверен независимо: цифры по кодингу и киберспособностям целиком заявлены самой Z.ai, единственное исключение — GDPval-AA v2, приписанный Artificial Analysis. 743 миллиарда параметров (архитектура MoE, унаследованная от GLM-5.2) сообщает профильная пресса, а не официальный анонс. Дата публикации весов не зафиксирована («две недели»), лицензия не объявлена. Цены за токен в первоисточнике нет — единственная тарифная информация — балльная система Coding Plan, а расходящиеся по прессе цифры (около $1,40/$4,40 за миллион токенов) не подтверждены. Китайские команды по безопасности, участвовавшие в проверке, не названы. Из 2436 уязвимостей 2383 остаются под эмбарго: проверить можно лишь 53. И центральный тезис — что кибервозможности «проявились» сверх ожиданий — держится исключительно на том, как компания описывает собственный процесс обучения.
- Perché pubblicarla
- Это первый задокументированный случай, когда лаборатория, сделавшая открытые веса своим знаменем, откладывает публикацию, потому что модель стала слишком хороша в сборке цепочек эксплойтов, — и говорит об этом публично, с цифрами и открытым реестром раскрытия. Новость сталкивает две вещи, которые в дискуссии обычно разводят по разным углам: открытость как гарантию проверяемости и безопасность как повод закрыться. К тому же 2436 дефектов в повсеместно используемом открытом ПО — средний срок жизни до обнаружения 26,6 года, самый старый внесён в 1981 году — касаются той самой инфраструктуры, на которой работает и европейская госадминистрация. И на этот раз материал для антихайп-статьи приходит от самого производителя.
Fonti / Sources
- Z.ai — GLM-5.3: Frontier Coding with Emergent Cyber Capabilities (annuncio ufficiale)
- Z.ai Security Disclosure Ledger (registro pubblico delle vulnerabilità)
- Decrypt — China's Z.AI Ships GLM-5.3, Calling It the Top Open-Weight Coding Model
- MarkTechPost — Z.ai Ships GLM-5.3 Without Retraining the Base Model