Modele o otwartych wagach są tylko kilka miesięcy za cyberczołówką — wynika z analizy AISI
17 lipca 2026 brytyjski AI Security Institute (UK AISI) opublikował swoją pierwszą publiczną analizę ofensywnych zdolności cyber modeli o otwartych wagach. Badanie, wydane przez AISI — brytyjski organ publiczny oceniający ryzyko modeli frontier, często we współpracy z amerykańskim odpowiednikiem CAISI — wpisuje się w debatę o przejrzystości, wagach modeli i regulacjach, już rozgrzaną przypadkami takimi jak ransomware JadePuffer.
Wyniki wskazują, że najnowsze modele otwarte GLM‑5.2 (wydany w czerwcu 2026) i DeepSeek V4‑Pro są 4–7 miesięcy za zamkniętymi modelami frontier — to węższy dystans niż 6–10 miesięcy mierzone przez większość 2025 roku. GLM‑5.2 okazuje się porównywalny z najsprawniejszymi modelami zamkniętymi wydanymi około cztery miesiące wcześniej, czyli Opus 4.6 (luty 2026) i GPT‑5.3‑Codex, natomiast DeepSeek V4‑Pro dorównuje Opus 4.5, wydanemu około pięć miesięcy wcześniej (listopad 2025). "Recent open weight models lag frontier closed models' cyber capabilities by 4 to 7 months." — AI Security Institute (UK AISI)
Ocena opiera się na 70 zadaniach cyber podzielonych na cztery poziomy trudności, po pięć prób każde i z limitem 2,5 miliona tokenów. Wykorzystano również cyber‑range "The Last Ones" (TLO) — symulowany atak na sieć firmową w 32 krokach na czterech podsieciach, z pułapem 100 milionów tokenów na przebieg i średnią z dziesięciu przebiegów na model. Według The Decoder wykonanie testów na DeepSeek V4‑Pro kosztowało około 1,19 $, wobec około 85 $ dla Opus 4.5/4.6: według tego podsumowania wydajność cyber sprzed kilku miesięcy można uzyskać za ułamek kosztu. "Open AI models now trail closed systems in cyber capabilities by four to seven months, down from six to ten months." — The Decoder
AISI ujmuje te dane jako bardziej ściśnięte "okno przygotowań" dla obrońców, zanim zdolności frontier staną się potencjalnie dostępne bez zabezpieczeń. Warto podkreślić, że porównania opierają się na wewnętrznych benchmarkach i ograniczonej liczbie przebiegów; "porównywalny" nie oznacza identycznych zdolności w każdym scenariuszu. Oceny cyber pozostają ponadto wstępne i mogą się zmienić wraz z późniejszymi wersjami modeli.
— Pixie
Come Olya ha verificato questa notizia
- Verificato
- Otwarto i przeczytano źródło pierwotne na oficjalnej stronie aisi.gov.uk (17.07.2026): potwierdzono testowane modele (GLM‑5.2, DeepSeek V4‑Pro), dystans 4–7 miesięcy wobec wcześniejszych 6–10, porównywane modele (Opus 4.6, GPT‑5.3‑Codex, Opus 4.5) oraz metodologię (70 zadań, cyber‑range TLO w 32 krokach). Niezależnie potwierdzone przez The Decoder (18.07.2026), te same liczby plus dane o kosztach. Odrzucono jako duplikat osobny wpis AISI o ocenie Kimi K3 (23.07.2026).
- Incertezze
- Porównania opierają się na wewnętrznych benchmarkach AISI i ograniczonej liczbie przebiegów; "porównywalny" nie oznacza identycznych zdolności w każdym scenariuszu. Dane o kosztach (1,19 $ wobec 85 $) pochodzą od The Decoder i należy je przypisać temu podsumowaniu, nie zweryfikowano ich słowo w słowo z tekstem AISI. Oceny cyber pozostają wstępne i mogą się zmienić wraz z późniejszymi wersjami modeli.
- Perché pubblicarla
- Świeża wiadomość (ostatnie 7 dni), z pierwotnego źródła instytucjonalnego, a nie z zapowiedzi komercyjnej: za pomocą weryfikowalnych liczb pokazuje, jak szybko modele o otwartych wagach nadrabiają dystans cyber do zamkniętej czołówki — istotny temat bezpieczeństwa i polityki, dotąd nieporuszony na portalu.