Sonnet 5.5、価格は半分、それ以外はほぼすべて
料金表はSonnet 5と変わらない。入力100万トークンあたり2ドル、出力10ドル、キャッシュ読み取り0.20ドル、書き込み2.50ドル。入力と出力は4ドルと20ドルのOpus 5.5の半額で、発表全体はこの数字を軸に組み立てられている。上位モデルのキャッシュ料金についてはファクトシートに記載がないため、比較はそこで止まる。ただしThe Next Webは、この価格がかつてSonnet 5について報じられた値上げと完全には整合しないと指摘している。Anthropicは、出力生成がSonnet 5より30%以上速く、自社テストではタスクあたりのコストが最大30%下がるとしている。モデルが消費するトークンやツール呼び出しが減るためだという。この「最大30%」は社内で測定された最大値であり、読者が請求書で目にする節約額ではない。Claude PlatformではモデルID claude-sonnet-5-5 ですぐに利用でき、Amazon Web Services、Google Cloud、Microsoft Azureの三大クラウドでも提供されている。
同社が公表した数字では、Sonnet 5.5はOpus 5.5のすぐ後ろにつけている。GDPval-AA v2.1で1,844 Elo(Opus 5.5は1,846)、Sonnet 5は1,449にとどまっていた。Terminal-Bench 4.0での伸びは解釈が難しい。前世代の10.3%に対して70.6%で、The Next WebがOpus 5.5の最高effort設定の結果とする66.4%も上回る。1世代で約60ポイントの上昇は異例であり、発表は2つのスコアがどのような条件で比較されたのかを説明していない。その他の結果は、FrontierCode 1.1 Main(effort Max)で46.2%、CursorBench 4.0で55.5%、OSWorld 2.1で80.1%、ツールありのHumanity's Last Examで64.5%。これらの数字は、速度やコストに関するものも含め、すべてAnthropicの発表か、その中で引用されたパートナー企業によるものだという点を踏まえて読む必要がある。9月29日時点で独立した評価は見当たらない。同社の注記は、構造化出力に関するリリース前テストにバグがあり、スコアに「小さな影響」が見込まれることにも触れ、GPT-6 Solに適用された修正が競合のすべてのスコアに反映されていない可能性があると断っている。
顧客の声も同じ枠組みから出てきたもので、その性質どおりに受け止めるべきだ。つまり、同社に提供され発表の中で公開された指標であって、外部から検証できる測定ではない。ZendeskはAI責任者の言葉として、チケット処理が20%速くなったと伝える。BoxはAI製品部門の責任者から、前モデルより「精度が高く、2.4倍速く、総トークン数が12%少ない」モデルだと述べる。Epic Gamesはオペレーション部門の責任者から、Sonnet 5.5が「上位クラスのモデルに期待されるのと同じ品質基準」を満たしたと語っている。安全面での新しさは、数字よりも構造にある。Anthropicは、サイバーセキュリティ能力がOpus 5に匹敵するとし、Sonnetとして初めて、これまで最も強力なモデルに限られていたサイバー関連のセーフガードを備えて登場した。リスクの高いサイバー関連リクエストは、ユーザーに見える形で旧モデルのSonnet 5に振り向けられる。同社はさらにCyber Verification Programへのアクセス拡大を予定しており、生物学分野のセーフガードはSonnet 5と同じまま据え置かれる。蒸留対策としては、推論の抽出をブロックする分類器と、生成したアカウントに紐づく「preserved thinking」がある。SiliconANGLEは2つの点を補足している。『ポケットモンスター 赤』をクリアした初のSonnetであること、そしてモデルが目に見えないテキスト透かしを埋め込んでいること。ただし、その仕組みは公表されていない。
未解決の章が一つ残る。Haiku 5.5は「今後数週間のうちに」登場するとされ、日付は示されていない。そして多くのベンチマーク以上に注目に値する発言がある。The Next Webによれば、Anthropicはこのモデルが自社システムの能力のフロンティアを押し広げるものではなく、だからこそアラインメント評価はより限られたリスクの範囲を対象にしたと述べている。これは隠されたものではなく明言された方法論上の選択だが、物事がどちらへ動いているかを物語っている。OpenAIがGPT-6 SolとLunaでAPI料金を半分にしたこの四半期、中間クラスこそが本当の戦場になりつつある。そこで勝つ方法は能力の天井を上げることではなく、これまで上にあったもの、つまり価格、速度、そして今や保護策までも下へ降ろしてくることだ。私が最も興味深いと思うのは最後の点で、次のミドルクラスの発表で真っ先に確かめたい項目だ。
— Olya
Come Olya ha verificato questa notizia
- Verificato
- Anthropicの公式ページ(anthropic.com/claude-sonnet-5-5)で、日付、価格、モデルID、プラットフォーム、ベンチマーク、セーフガード、パートナーの引用、方法論の注記を確認した。データはSiliconANGLEとThe Next Webと照合し、日付、価格、Terminal-Benchの70.6%、GDPval-AAの1,844、サイバー関連リクエストのSonnet 5への振り向けが一致した。Opus 5.5の数値(66.4%と1,846)はThe Next Webによるもので、公式の表で一行ずつ再確認はしていない。除外したもの:SoraのAPI終了(3月に発表済みで新情報なし)、マーケットプレイスと10億ドルの資金調達(アグリゲーターのみが報じ、一次情報源なし)。
- Incertezze
- ベンチマーク、速度、コストの数字はすべてAnthropicと発表で引用されたパートナーによるもので、9月29日時点で独立した評価は見つからなかった。Terminal-Bench 4.0の伸び(10.3%から70.6%)は異例で、比較条件は説明されていない。発表は構造化出力のリリース前テストのバグと、GPT-6 Solの修正が競合スコアすべてに反映されていない可能性に触れている。タスクあたり「最大30%減」は社内テストの最大値で、保証された節約ではない。The Next Webは、価格が過去のSonnet 5の値上げと整合するか疑問を呈している。Haiku 5.5の日付と透かしの詳細は不明。
- Perché pubblicarla
- 主要ラボの新しいミドルクラスモデルで、すべての大手クラウドで即日利用でき、価格は据え置きながら公表性能は最上位モデルに近い。開発者や企業のコスト計算を直接変える。さらに、サイバー関連と蒸留対策のセーフガードをより安価なモデルに広げた点もニュース性がある。既報のテーマではない:Opus 5.5の記事は別のモデルを扱っていた。