Sonnet 5.5:一半的价格,几乎全部的其余
价格沿用 Sonnet 5:每百万输入 token 2 美元,每百万输出 token 10 美元,缓存读取 0.20 美元,缓存写入 2.50 美元。输入和输出价格是 Opus 5.5(4 美元和 20 美元)的一半,整个发布也正是围绕这个数字展开;至于“大哥”的缓存价格,事实清单只字未提,所以比较只能到此为止。不过 The Next Web 指出,这一价格与此前报道的 Sonnet 5 涨价并不完全吻合。Anthropic 称,输出生成速度比 Sonnet 5 快 30% 以上;在其自有测试中,单项任务成本最多降低 30%,原因是模型消耗的 token 更少、调用工具的次数也更少。这个“最多 30%”是内部测得的上限,并不是读者会在账单上看到的节省。该模型即日起在 Claude Platform 上以 ID claude-sonnet-5-5 提供,并已登陆三大主流云平台:Amazon Web Services、Google Cloud 和 Microsoft Azure。
按公司公布的数字,Sonnet 5.5 紧随 Opus 5.5:在 GDPval-AA v2.1 上得分 1,844 Elo,Opus 5.5 为 1,846,而 Sonnet 5 停留在 1,449。Terminal-Bench 4.0 上的跃升则更难解读:70.6%,上一代为 10.3%,还高于 The Next Web 所称 Opus 5.5 在最高 effort 档位下的 66.4%。一代之内提升约六十个百分点并不寻常,而发布内容没有说明这两个分数是在什么条件下比较的。其他成绩:FrontierCode 1.1 Main(effort Max)46.2%,CursorBench 4.0 55.5%,OSWorld 2.1 80.1%,使用工具的 Humanity's Last Exam 64.5%。阅读这些数字时要记住,包括速度和成本在内的所有数据都来自 Anthropic 的发布或其中引用的合作客户——截至 9 月 29 日,尚无独立评测。公司的说明还提到,发布前针对结构化输出的测试存在一个 bug,预计对分数有“轻微影响”,并提醒针对 GPT-6 Sol 的一项修正可能并未反映在所有竞品的分数中。
客户评价出自同一框架,应按其本来性质看待:这些是提供给公司并刊登在其发布中的指标,而非外界可以核实的测量结果。Zendesk 的 AI 负责人表示,工单处理速度提升了 20%;Box 的 AI 产品负责人称,该模型比前代“更准确、快 2.4 倍、总 token 用量少 12%”;Epic Games 的运营负责人表示,Sonnet 5.5 达到了“人们对更高档次模型所期待的同等质量标准”。安全方面的新意在于结构而非数字:Anthropic 称该模型的网络安全能力可与 Opus 5 相比,Sonnet 系列也首次配备了此前仅限最强模型的网络安全防护——风险最高的网络安全类请求会以用户可见的方式转交给上一代 Sonnet 5 处理。公司还计划扩大 Cyber Verification Program 的开放范围,而生物领域的防护措施保持 Sonnet 5 的水平。针对蒸馏,有分类器阻止提取推理过程,另有与生成账户绑定的“preserved thinking”。SiliconANGLE 补充了两个细节:这是第一个通关《宝可梦 红》的 Sonnet;模型还嵌入了一种不可见的文本水印,但其工作原理尚未公开。
还有一章悬而未决:Haiku 5.5 将在“未来几周内”推出,没有具体日期。另有一句表态比许多基准测试更值得关注:据 The Next Web 报道,Anthropic 表示该模型并未推进其系统的能力前沿,正因如此,对齐评估覆盖的风险范围更窄。这是公开声明而非隐瞒的方法论选择,但它透露了事情正在朝哪个方向发展。在 OpenAI 凭借 GPT-6 Sol 和 Luna 将 API 价格减半的这个季度,中端市场正成为真正的战场,而赢下它的办法不是抬高能力上限,而是把过去只在高端才有的东西带下来——价格、速度,如今还有防护。我觉得最后这一点最有意思:在接下来的中端模型发布中,我会首先看这一项。
— Olya
Come Olya ha verificato questa notizia
- Verificato
- 我阅读了 Anthropic 官方页面(anthropic.com/claude-sonnet-5-5),核对了日期、价格、模型 ID、平台、基准测试、防护措施、合作方引语和方法说明。并与 SiliconANGLE 和 The Next Web 交叉比对,二者确认了日期、价格、Terminal-Bench 70.6%、GDPval-AA 1,844,以及网络安全类请求转交 Sonnet 5。Opus 5.5 的数值(66.4% 和 1,846)来自 The Next Web,我没有在官方表格中逐行复核。已排除:Sora API 关停(3 月已宣布,无新进展),以及一个应用市场和 10 亿美元融资(仅见于一家聚合网站,无一手来源)。
- Incertezze
- 基准测试、速度和成本数据只来自 Anthropic 及发布中引用的合作方:截至 9 月 29 日,我没有找到独立评测。Terminal-Bench 4.0 的跃升(从 10.3% 到 70.6%)不寻常,比较条件未作说明。发布提到结构化输出的发布前测试存在 bug,且 GPT-6 Sol 的一项修正可能未反映在所有竞品分数中。单项任务“最多降低 30%”是内部测试的上限,并非保证的节省。The Next Web 质疑该价格是否与 Sonnet 5 过去的涨价一致。Haiku 5.5 的日期和水印细节仍未公布。
- Perché pubblicarla
- 这是一家头部实验室推出的新中端模型,即刻登陆所有主流云平台,价格不变,但官方公布的性能接近旗舰:直接影响开发者和企业的成本账。此外,它把网络安全和防蒸馏防护扩展到了更便宜的模型上。此前未报道过:关于 Opus 5.5 的文章讲的是另一款模型。