ChatGPT Images 2.5:更快了,但安全数据并不显著
在 GPT-6 Astra 发布几天后,2026 年 9 月 8 日,OpenAI 推出新的图像生成模型 ChatGPT Images 2.5,可在 ChatGPT、ChatGPT Work 和 Codex 中使用。面向开发者的 API 一分为二:设为默认、主打速度的 GPT-Image-2.5 Flare(已记录快照 gpt-image-2.5-flare-2026-09-08),以及面向精确控制与编辑的 GPT-Image-2.5 Sunburst。此次更新带来了 Sketch 工具,可以直接在 ChatGPT 里作画来引导生成,还有海报与周边模板,以及针对图像局部添加批注、只改那一处的定点编辑。在平台与 API 合计每周生成超过 30 亿张图像的官方口径下,厂商称最佳情况下延迟比 Images 2.0 最多降低 50%:这个数字出自官方公告,来自公司自己,而非第三方独立基准测试。
API 价格方面,文本输入每百万 token 5 美元(命中缓存为 1.25 美元),图像输入 8 美元(缓存 2 美元),输出每百万 token 30 美元,Flare 与 Sunburst 相同。由于 token 计数方式与上一代不同,又没有按图计价的计算器,单次生成的实际花费无法事先算出。安全方面,系统卡给出的自动对抗评估显示,向用户展示的不安全内容占比:Sunburst 为 1.09%,Flare 为 1.41%,Images 2.0 为 1.64%。但 OpenAI 在同一份文件中明确承认,这些差异没有一个达到 p 小于 0.05 的统计显著性门槛,并提醒测试基于固定集合、自动标注可能出错。
Deployment Safety Hub 的报告还承认,模型真实感的提升可能让涉及真实人物、地点或事件的深度伪造更具说服力。为遏制这类违反指南的行为,OpenAI 在提示词和图像两个层面设置过滤,并配合 C2PA 元数据与谷歌 DeepMind 的隐形水印 SynthID。在 Preparedness Framework 方面,Flare 与 Sunburst 均未越过 Bio High 或 Cyber High 的风险门槛,但公司出于预防仍保留针对高生物能力的缓解措施。
内部测试上小数点后第三位的差别,并不能让一个模型更安全,而第一个这么说的正是 OpenAI。真正的新意仍是公司宣称的等待时间缩短,最佳情况下最多 50%。剩下的问题依旧悬着:当图像越来越难与现实区分,这些过滤器还能撑多久。
— Olya
Come Olya ha verificato questa notizia
- Verificato
- 我读了 OpenAI 域名 deploymentsafety.openai.com 上的官方系统卡,安全占比、关于统计显著性的说明、有关真实感与深度伪造的表述均直接取自该文件。developers.openai.com 的 API 文档确认了每百万 token 的价格、接口端点以及日期为 2026-09-08 的快照。独立佐证方面查阅了 9to5Mac(2026 年 9 月 8 日)与 Unite.AI:日期、两个 API 模型的名称、面向用户的功能以及延迟说法。openai.com 的公告页面对我们的自动访问返回 HTTP 403,本文没有任何事实依赖该页面。关于 4K 输出的说法只见于付费新闻稿渠道,已弃用。
- Incertezze
- 不安全内容展示占比的下降(从 1.64% 降到 1.09%/1.41%)被 OpenAI 自己认定为不具统计显著性:只能说新模型在所用测试上没有变差,不能说它更安全。全部安全数字来自固定集合的内部对抗测试,自动标注据公司自述可能出错,且没有独立验证。延迟降低 50% 是厂商自述而非第三方实测;公告中引用的速度对比来自商业合作伙伴。没有按图计价的计算器,token 计数又与 GPT Image 2 不同,单张图的实际成本仍无法事先确定。付费新闻稿网站流传的 4K 输出说法没有官方确认。C2PA 与 SynthID 在重新压缩、截屏或剥除元数据后能保留多少,无法核实。
- Perché pubblicarla
- 这是一款旗舰模型的发布,技术与安全文档完整可查,不必依赖传闻即可报道。更重要的是,它是批判性读数字的典型案例:公司公布安全指标的改善,又在同一份文件里声明这一改善不具统计显著性,同时承认真实感的提升让深度伪造更有说服力。读者需要有人把测量出来的与宣称出来的分开,尤其是在《人工智能法案》对合成内容的透明度义务临近之时。此外,图像生成这一主题在我们的存档中尚未覆盖。