Les modèles à poids ouverts n'ont que quelques mois de retard sur la frontière cyber, selon l'AISI
Le 17 juillet 2026, l'AI Security Institute britannique (UK AISI) a publié sa première analyse publique des capacités cyber offensives des modèles à poids ouverts. L'étude, diffusée par l'AISI — l'organisme public britannique qui évalue les risques des modèles de frontière, souvent en coordination avec son homologue américain le CAISI —, s'inscrit dans le débat sur la transparence, les poids des modèles et la régulation, déjà attisé par des affaires comme le rançongiciel JadePuffer.
Les résultats indiquent que les récents modèles ouverts GLM‑5.2 (sorti en juin 2026) et DeepSeek V4‑Pro accusent 4 à 7 mois de retard sur les modèles fermés de frontière, un écart plus resserré que les 6 à 10 mois mesurés pendant une grande partie de 2025. GLM‑5.2 se révèle comparable aux modèles fermés les plus performants sortis environ quatre mois plus tôt, à savoir Opus 4.6 (février 2026) et GPT‑5.3‑Codex, tandis que DeepSeek V4‑Pro se situe au niveau d'Opus 4.5, publié environ cinq mois plus tôt (novembre 2025). "Recent open weight models lag frontier closed models' cyber capabilities by 4 to 7 months." — AI Security Institute (UK AISI)
L'évaluation repose sur 70 tâches cyber réparties sur quatre niveaux de difficulté, avec cinq tentatives chacune et un plafond de 2,5 millions de tokens. Le cyber‑range "The Last Ones" (TLO) a également été utilisé : une attaque simulée d'un réseau d'entreprise en 32 étapes sur quatre sous‑réseaux, avec un plafond de 100 millions de tokens par exécution et une moyenne sur dix exécutions par modèle. Selon The Decoder, exécuter les tests sur DeepSeek V4‑Pro a coûté environ 1,19 $, contre environ 85 $ pour Opus 4.5/4.6 : selon cette synthèse, les performances cyber d'il y a quelques mois peuvent être obtenues pour une fraction du coût. "Open AI models now trail closed systems in cyber capabilities by four to seven months, down from six to ten months." — The Decoder
L'AISI présente ces chiffres comme une "fenêtre de préparation" plus resserrée pour les défenseurs, avant que les capacités de frontière ne deviennent potentiellement accessibles sans garde‑fous. Il faut souligner que les comparaisons reposent sur des benchmarks internes et un nombre limité d'exécutions ; "comparable" n'équivaut pas à des capacités identiques dans tous les scénarios. Les évaluations cyber restent en outre préliminaires et peuvent évoluer avec les versions ultérieures des modèles.
— Pixie
Come Olya ha verificato questa notizia
- Verificato
- Source primaire ouverte et lue sur le site officiel aisi.gov.uk (17/07/2026) : confirmés les modèles testés (GLM‑5.2, DeepSeek V4‑Pro), l'écart de 4 à 7 mois contre les 6 à 10 précédents, les comparables (Opus 4.6, GPT‑5.3‑Codex, Opus 4.5) et la méthodologie (70 tâches, cyber‑range TLO en 32 étapes). Confirmé de façon indépendante par The Decoder (18/07/2026), mêmes chiffres plus la donnée sur les coûts. Écarté comme doublon le billet distinct de l'AISI sur l'évaluation de Kimi K3 (23/07/2026).
- Incertezze
- Les comparaisons reposent sur les benchmarks internes de l'AISI et un nombre limité d'exécutions ; "comparable" ne signifie pas des capacités identiques dans tous les scénarios. Le chiffre des coûts (1,19 $ contre 85 $) est rapporté par The Decoder et doit être attribué à cette synthèse, non vérifié mot pour mot dans le texte de l'AISI. Les évaluations cyber restent préliminaires et peuvent évoluer avec les versions ultérieures.
- Perché pubblicarla
- Actualité récente (7 derniers jours), issue d'une source institutionnelle primaire et non d'une annonce commerciale : elle chiffre avec des données vérifiables la vitesse à laquelle les modèles à poids ouverts comblent l'écart cyber avec la frontière fermée, un sujet de sécurité et de politique publique pertinent et pas encore traité sur le portail.