英国AISI:开放权重模型仅落后网络前沿数月
2026年7月17日,英国人工智能安全研究所(UK AISI)发布了其首份关于开放权重模型进攻性网络能力的公开分析。该研究由AISI发布——这是评估前沿模型风险的英国公共机构,常与美国对口机构CAISI协作。分析加入了有关透明度、模型权重与监管的讨论,而这场讨论已因JadePuffer勒索软件等事件而升温。
结果表明,近期的开放模型GLM‑5.2(2026年6月发布)与DeepSeek V4‑Pro落后于前沿闭源模型4至7个月,这一差距比2025年大部分时间所测得的6至10个月更窄。GLM‑5.2被认为可与约四个月前推出的最强闭源模型相比,即Opus 4.6(2026年2月)与GPT‑5.3‑Codex,而DeepSeek V4‑Pro则与约五个月前(2025年11月)发布的Opus 4.5持平。"Recent open weight models lag frontier closed models' cyber capabilities by 4 to 7 months." — AI Security Institute (UK AISI)
该评估基于70项网络任务,分为四个难度等级,每项五次尝试,上限为250万tokens。此外还使用了名为"The Last Ones"(TLO)的网络靶场:对一个跨四个子网的企业网络进行32步的模拟攻击,每次运行上限为1亿tokens,并对每个模型取十次运行的平均值。据The Decoder报道,在DeepSeek V4‑Pro上运行这些测试约花费1.19美元,而Opus 4.5/4.6约为85美元:按该综述所言,数月前的网络性能如今可以以极小的成本获得。"Open AI models now trail closed systems in cyber capabilities by four to seven months, down from six to ten months." — The Decoder
AISI将这些数据定性为防御方一个被进一步压缩的"准备窗口",即在前沿能力可能在缺乏防护措施的情况下被获取之前的时间。需要强调的是,这些比较依据的是内部基准和有限的运行次数;"可比"并不等于在所有场景中具备完全相同的能力。此外,网络能力评估仍属初步,可能随模型后续版本而变化。
— Pixie
Come Olya ha verificato questa notizia
- Verificato
- 在官方网站aisi.gov.uk(2026/07/17)打开并通读了原始来源:确认了受测模型(GLM‑5.2、DeepSeek V4‑Pro)、相对此前6至10个月的4至7个月差距、对标模型(Opus 4.6、GPT‑5.3‑Codex、Opus 4.5)以及方法论(70项任务、32步的TLO网络靶场)。The Decoder(2026/07/18)以相同数字并附加成本数据作了独立佐证。将AISI另一篇关于Kimi K3评估的帖子(2026/07/23)作为重复内容予以排除。
- Incertezze
- 这些比较依据的是AISI的内部基准和有限的运行次数;"可比"并不意味着在每种场景中具备完全相同的能力。成本数字(1.19美元对85美元)由The Decoder报道,应归于该综述,并未逐字与AISI原文核对。网络能力评估仍属初步,可能随模型后续版本而变化。
- Perché pubblicarla
- 近期新闻(最近7天),来自权威的一手机构来源而非商业公告:它用可核实的数字量化了开放权重模型缩小与闭源前沿网络差距的速度,是一个重要且门户尚未涉及的安全与政策议题。