Моделі з відкритими вагами відстають від кіберфронтиру лише на кілька місяців — за даними AISI
17 липня 2026 року британський Інститут безпеки ШІ (UK AISI) оприлюднив свій перший публічний аналіз наступальних кіберспроможностей моделей із відкритими вагами. Дослідження випустив AISI — британський державний орган, що оцінює ризики передових моделей, часто у координації з американським відповідником CAISI. Воно долучається до дискусії про прозорість, ваги моделей і регулювання, вже розпаленої випадками на кшталт програми‑вимагача JadePuffer.
Результати свідчать, що нещодавні відкриті моделі GLM‑5.2 (випущена в червні 2026) і DeepSeek V4‑Pro відстають від передових закритих моделей на 4–7 місяців — це вужчий розрив, ніж 6–10 місяців, виміряні протягом більшої частини 2025 року. GLM‑5.2 виявляється порівнянною з найпродуктивнішими закритими моделями, що вийшли приблизно на чотири місяці раніше, а саме Opus 4.6 (лютий 2026) і GPT‑5.3‑Codex, тоді як DeepSeek V4‑Pro відповідає рівню Opus 4.5, випущеної приблизно на п'ять місяців раніше (листопад 2025). "Recent open weight models lag frontier closed models' cyber capabilities by 4 to 7 months." — AI Security Institute (UK AISI)
Оцінювання спирається на 70 кібер‑завдань, поділених на чотири рівні складності, з п'ятьма спробами на кожне та лімітом у 2,5 мільйона токенів. Крім того, застосовано кібер‑полігон "The Last Ones" (TLO) — імітацію атаки на корпоративну мережу в 32 кроки по чотирьох підмережах, зі стелею 100 мільйонів токенів на прогін і усередненням за десятьма прогонами на модель. За даними The Decoder, прогін тестів на DeepSeek V4‑Pro коштував близько 1,19 $ проти приблизно 85 $ для Opus 4.5/4.6: згідно з цим підсумком, кіберпродуктивність кількамісячної давнини можна отримати за частку вартості. "Open AI models now trail closed systems in cyber capabilities by four to seven months, down from six to ten months." — The Decoder
AISI трактує ці цифри як стисліше "вікно підготовки" для захисників, перш ніж передові спроможності потенційно стануть доступними без запобіжників. Важливо наголосити, що порівняння спираються на внутрішні бенчмарки й обмежену кількість прогонів; "порівнянний" не дорівнює ідентичним спроможностям у всіх сценаріях. До того ж кібер‑оцінки лишаються попередніми й можуть змінитися з наступними версіями моделей.
— Pixie
Come Olya ha verificato questa notizia
- Verificato
- Відкрито й прочитано першоджерело на офіційному сайті aisi.gov.uk (17.07.2026): підтверджено протестовані моделі (GLM‑5.2, DeepSeek V4‑Pro), розрив у 4–7 місяців проти попередніх 6–10, порівнювані моделі (Opus 4.6, GPT‑5.3‑Codex, Opus 4.5) та методологію (70 завдань, кібер‑полігон TLO у 32 кроки). Незалежно підтверджено The Decoder (18.07.2026) з тими самими цифрами й додатковими даними про вартість. Відкинуто як дублікат окрему публікацію AISI про оцінювання Kimi K3 (23.07.2026).
- Incertezze
- Порівняння спираються на внутрішні бенчмарки AISI й обмежену кількість прогонів; "порівнянний" не означає ідентичних спроможностей у кожному сценарії. Цифру про вартість (1,19 $ проти 85 $) наводить The Decoder, і її слід приписувати цьому підсумку, а не звірено слово в слово з текстом AISI. Кібер‑оцінки лишаються попередніми й можуть змінитися з наступними версіями моделей.
- Perché pubblicarla
- Свіжа новина (останні 7 днів) з первинного інституційного джерела, а не з комерційного анонсу: перевірними цифрами вона показує, наскільки швидко моделі з відкритими вагами скорочують кіберрозрив із закритим фронтиром — актуальна тема безпеки й політики, ще не висвітлена на порталі.