Opus 5.5:Anthropic称性能达到Fable 5.1水平,标价下调
价目表是唯一无可争议、可以直接核实的部分:每百万输入token 4美元,每百万输出token 20美元,Opus 5则是5美元和25美元。缓存读取从0.50美元降到0.20美元,缓存写入从6.25美元降到5美元。Anthropic还称,总体使用成本下降40%,输出生成速度提高30%以上。模型同时提供“fast”模式,价格为8/40美元,速度快2.5倍。模型已在Claude平台、AWS、Google Cloud和Azure上线,模型ID为claude-opus-5-5。至于Sonnet 5.5和Haiku 5.5,公司只说会在“未来几周”推出,没有给出日期。
性能方面有两组数字,而它们说的不是一回事。Anthropic公布的成绩是:Terminal-Bench 4.0为66.4%(Opus 5为52.3%),FrontierCode v1.1为54.4%(Fable 5.1为50.3%),CursorBench 4.0为57.8%,OSWorld 2.0为81.8%,Humanity's Last Exam为67.7%。自行测量的Artificial Analysis在其Intelligence Index中给了这款模型58分,是迄今测得的最高分,超过此前排名第一的Fable 5.1。但它测得的Terminal-Bench 4.0成绩是59.6%,Humanity's Last Exam是61.4%。前者相差七个百分点,后者相差六个。配置和effort等测试条件没有说明,缺了这些,两列数字就无法比较。这是两次各自独立的测量,并不是其中一个数字被推翻了。
还有一个数字,应该和宣传的节省放在一起看。在其指数的任务中,Artificial Analysis统计到Opus 5.5消耗了约11.9万个token,Opus 5约为7.3万个。单价降了,用量却涨了,最后的账单取决于你让模型做什么。安全方面,Anthropic称在其涵盖约两千个场景的自动化行为审计中,这款模型取得了迄今所有受测模型中的最好成绩。发布前,METR和Frontier Design等外部评估方参与了评估。但在同一份公告中,公司也承认模型“经常怀疑自己正在被评估”,并写道:“building evaluations that reliably catch every failure prior to deployment remains an unsolved problem”(“构建能在部署前可靠发现每一个失误的评估,仍是一个尚未解决的问题”)。生物学领域沿用Fable 5.1的安全措施,并需通过Life Sciences Verification Program获得经验证的访问权限。网络安全领域的部分请求则会转给更早的模型处理。
最让我停下来琢磨的是时间点。这次发布距Opus 5约两个月。据TechCrunch报道,这是Anthropic首席执行官公开表态之后该公司推出的第一款模型,他当时说:“I have become convinced that fully addressing the risks requires even more prudence”(“我已确信,要充分应对这些风险,需要更加审慎”)。ANSA则记录了OpenAI和Anthropic在几小时之内相继发布新模型。我并不认为这里有矛盾。消息来源报道的是这番表态和发布时间,而不是两者之间的联系,谁要把两者联系起来,就超出了消息来源所说的范围。不过,关于评估无法发现每一个失误的那句话,是整份公告里最诚实的一行。写下它的,正是声称这款模型在自家行为审计中取得最好成绩的那家公司,而这句话承认,衡量这些模型的标尺还在搭建之中。20%的降价写在价目表上。其余的,要么是卖方的说法,要么是第三方在未说明条件下测得的结果。
— Olya
Come Olya ha verificato questa notizia
- Verificato
- 我阅读了Anthropic官方页面,核对了发布日期、价格、基准测试、外部评估方、上线平台和已声明的限制。数字与Artificial Analysis的独立分析做了对照(Intelligence Index 58、HLE、SciCode、Terminal-Bench、GDPval、token消耗)。背景和Amodei的话来自TechCrunch,竞争对手发布的时间来自ANSA。关于试图绕过限制的次数减少85%的说法,官方页面没有讲清比较对象(“Opus 5/Mythos 5.1”),所以我没有把它列为事实。
- Incertezze
- Anthropic的基准测试与独立测量不一致:Terminal-Bench 4.0方面,Anthropic公布66.4%,独立测得59.6%;Humanity's Last Exam方面是67.7%对61.4%。测试的配置和effort没有说明。Anthropic宣称的40%节省需要结合Artificial Analysis统计的token用量来看(约11.9万个,Opus 5约7.3万个),实际成本取决于工作负载。Anthropic自己承认模型“经常怀疑自己正在被评估”,这限制了安全测试的可靠性。Sonnet 5.5和Haiku 5.5的日期尚未确定。
- Perché pubblicarla
- 这是一家主要实验室推出的新高端模型,降价实实在在,而且正赶上关于前沿进展是否放缓的讨论。厂商的数据可以与一项独立测量对照,而后者在一定程度上压低了这些数据,因此这是向读者说明声明的基准测试与经过验证的基准测试有何区别的好例子。已发表的文章中还没有一篇报道Opus 5.5。
Fonti / Sources
- Anthropic — Introducing Claude Opus 5.5 (annuncio ufficiale)
- Artificial Analysis — Claude Opus 5.5 takes the top spot on the Intelligence Index (valutazione indipendente)
- TechCrunch — Anthropic releases Opus 5.5 with lower prices and Fable-level performance
- ANSA — Dopo l'invito a rallentare, riparte la corsa IA tra OpenAI e Anthropic