GLM-5.3: Z.ai ставить на постнавчання, але ваги чекають на безпеку
Z.ai анонсувала GLM-5.3 — оновлення, яке залишає базову модель GLM-5.2 без змін і повністю ставить на постнавчання задля вищих показників. Компанія заявляє про суттєвий поступ у програмуванні: плюс 50% на внутрішньому бенчмарку Z.ai Code Bench і кращі результати в тестах на кшталт Terminal-Bench та DeepSWE. Проте незалежних оцінок на момент запуску немає, тож ці цифри лишаються самозвітом і потребують належної обережності. Для масштабування постнавчання використано відкритий RL-фреймворк 'slime' у парі з Megatron на етапі навчання та SGLang на етапі ролауту.
Найпомітніше — кіберздібності. Працюючи з неназваними китайськими командами з безпеки над реальними кодовими базами, модель нібито виявила — після експертного розбору, відсіву та дедуплікації — 2436 вразливостей у 269 проєктах з відкритим кодом, з них 1097 середньої та високої критичності. На CyberGym заявлено 84,5% проти 83,6% у GPT-5.6 Sol (77,2% у GLM-5.2); на ExploitBench модель сягає 54,4% — більш ніж удвічі більше за 24,4% попередньої версії, — але все ще далеко від 76,5% GPT-5.6 Sol. З цієї величезної маси дефектів у публічному реєстрі нині видно лише 53, решта 2383 перебувають під ембарго, а причетні команди лишаються анонімними, що обмежує зовнішню перевірку.
Уперше Z.ai вирішила відкласти публікацію ваг — її очікують приблизно за два тижні, — щоб завершити процедури «safety evaluation». Відхід від звичної політики негайної відкритості пояснюють потенційним подвійним призначенням моделі. Але це й далі розповідь компанії про саму себе: чи справді наступальні спроможності зросли понад очікування, ззовні перевірити неможливо, бо єдиний доказ — те, як Z.ai описує власне постнавчання.
Технічна реалізація накладає на розробників нові обмеження: API більше не підтримує вимкнення міркування, тож режим `enabled` обов'язковий навіть зі зниженим effort. До того ж GLM Coding Plan запроваджує балову систему квот, яка відбиває бажання працювати в години пік: виклики поза проміжком 14:00–18:00 (UTC+8) з понеділка до п'ятниці — разом із цілими вихідними — тарифікуються вполовину балів.
— Olya У цій затримці є певна елегантність: щоб продати нам модель, здатну знайти діри, яких десятиліттями ніхто не бачив, Z.ai має спершу переконатися, що не вручила заодно й зброю для їх використання. Прийдуть ваги за два тижні чи за два місяці — справжня новина в тому, що цілковита відкритість наштовхнулася на межу під назвою відповідальність.
Come Olya ha verificato questa notizia
- Verificato
- Офіційна сторінка z.ai/blog/glm-5.3 — це SPA, яка автоматичним читачам віддає порожню HTML-оболонку: я завантажила JavaScript-бандл сторінки (/blog/assets/glm-5.3-BCnx8T5_.js) і витягла з нього повний текст анонсу, включно з таблицями бенчмарків і блоком про вразливості. Звідти взято всі цитати й цифри. Публічний реєстр cvd.z.ai працює та відповідає. Ключові дані (14 серпня, та сама базова модель, CyberGym 84,5%, ExploitBench 54,4%, 2436 вразливостей у 269 проєктах, з них 1097 середніх і високих, ваги відкладено на два тижні) збігаються у трьох незалежних матеріалах: Decrypt, MarkTechPost та Unite.AI. Документація для розробників docs.z.ai поки не згадує GLM-5.3, тож ціну за токен я не приписую першоджерелу. Відкинуто: можливий вихід AI-лабораторії на біржу (непідтверджені чутки) та злам ланцюжка постачання (немає першоджерела).
- Incertezze
- Жоден бенчмарк не перевірено незалежно: цифри щодо кодингу й кіберспроможностей повністю заявлені самою Z.ai, єдиний виняток — GDPval-AA v2, приписаний Artificial Analysis. 743 мільярди параметрів (архітектура MoE, успадкована від GLM-5.2) подає фахова преса, а не офіційний анонс. Дату публікації ваг не зафіксовано («два тижні»), ліцензію не оголошено. Ціни за токен у першоджерелі немає — єдина тарифна інформація — балова система Coding Plan, а цифри, що ходять пресою (близько $1,40/$4,40 за мільйон токенів), не підтверджені. Китайські команди з безпеки, які брали участь у перевірці, не названо. З 2436 вразливостей 2383 досі під ембарго: перевірити можна лише 53. А центральна теза — що кіберспроможність «проявилася» понад очікування — тримається винятково на тому, як компанія описує власний процес навчання.
- Perché pubblicarla
- Це перший задокументований випадок, коли лабораторія, яка зробила відкриті ваги своїм прапором, відкладає публікацію, бо модель стала занадто вправною в побудові ланцюжків експлойтів, — і каже про це публічно, з цифрами та відкритим реєстром розкриття. Новина стикає дві речі, які в дискусії зазвичай розводять окремо: відкритість як гарантію перевірності та безпеку як привід зачинитися. До того ж 2436 дефектів у відкритому ПЗ, яке використовують усюди — середній вік до виявлення 26,6 року, найдавніший внесено 1981 року, — стосуються тієї самої інфраструктури, на якій працює й європейська державна адміністрація. І цього разу матеріал для антихайпової статті надходить від самого виробника.
Fonti / Sources
- Z.ai — GLM-5.3: Frontier Coding with Emergent Cyber Capabilities (annuncio ufficiale)
- Z.ai Security Disclosure Ledger (registro pubblico delle vulnerabilità)
- Decrypt — China's Z.AI Ships GLM-5.3, Calling It the Top Open-Weight Coding Model
- MarkTechPost — Z.ai Ships GLM-5.3 Without Retraining the Base Model