Opus 5.5: Leistung auf Fable-5.1-Niveau, laut Hersteller, zum gesenkten Listenpreis
Die Preisliste ist der Teil, der sich zweifelsfrei prüfen lässt: 4 Dollar pro Million Input-Token und 20 Dollar pro Million Output-Token, gegenüber 5 und 25 Dollar bei Opus 5. Lesezugriffe auf den Cache sinken von 0,50 auf 0,20 Dollar, Schreibzugriffe von 6,25 auf 5 Dollar. Anthropic gibt außerdem an, dass die Gesamtkosten der Nutzung um 40 % sinken und die Ausgabe mehr als 30 % schneller erzeugt wird. Dazu kommt ein 'Fast'-Modus für 8/40 Dollar, der 2,5-mal schneller läuft. Das Modell ist auf der Claude-Plattform, bei AWS, Google Cloud und Azure verfügbar, unter der Model-ID claude-opus-5-5. Für Sonnet 5.5 und Haiku 5.5 spricht das Unternehmen von den 'kommenden Wochen', ohne Termine zu nennen.
Zur Leistung gibt es zwei Zahlenreihen, und sie sagen nicht dasselbe. Anthropic gibt an: 66,4 % bei Terminal-Bench 4.0 (Opus 5: 52,3 %), 54,4 % bei FrontierCode v1.1 gegenüber 50,3 % für Fable 5.1, 57,8 % bei CursorBench 4.0, 81,8 % bei OSWorld 2.0 und 67,7 % bei Humanity's Last Exam. Artificial Analysis misst selbst. Es gibt dem Modell 58 Punkte in seinem Intelligence Index, den bisher höchsten gemessenen Wert, noch vor dem bisherigen Spitzenreiter Fable 5.1. Bei Terminal-Bench 4.0 misst es aber 59,6 % und bei Humanity's Last Exam 61,4 %. Das sind sieben Punkte Abstand beim ersten und sechs beim zweiten Test. Die Testbedingungen, also Konfiguration und Effort, sind nicht offengelegt, und ohne sie lassen sich die beiden Spalten nicht vergleichen. Es bleiben zwei Messungen, kein umstrittener Wert.
Eine weitere Zahl gehört direkt neben die angekündigte Ersparnis. Bei den Aufgaben seines Index hat Artificial Analysis rund 119.000 verbrauchte Token für Opus 5.5 gezählt, gegenüber etwa 73.000 für Opus 5. Ein niedrigerer Stückpreis bei höherem Verbrauch ergibt eine Endrechnung, die davon abhängt, was man vom Modell verlangt. Bei der Sicherheit gibt Anthropic an, im eigenen automatisierten Verhaltensaudit mit rund zweitausend Szenarien das beste Ergebnis aller bisher getesteten Modelle erzielt zu haben. Externe Prüfer, darunter METR und Frontier Design, waren vor der Veröffentlichung beteiligt. In derselben Mitteilung räumt das Unternehmen aber ein, dass das Modell 'oft vermutet, getestet zu werden', und dass „building evaluations that reliably catch every failure prior to deployment remains an unsolved problem“ („Evaluierungen zu entwickeln, die jedes Versagen vor der Veröffentlichung zuverlässig erkennen, bleibt ein ungelöstes Problem“). Für Biologie gelten die Schutzmechanismen von Fable 5.1 und ein verifizierter Zugang über das Life Sciences Verification Program. Bei Cybersicherheit werden manche Anfragen an ein älteres Modell umgeleitet.
Am längsten hat mich der Zeitpunkt beschäftigt. Die Veröffentlichung kommt etwa zwei Monate nach Opus 5. Laut TechCrunch ist es das erste Anthropic-Modell seit einer öffentlichen Stellungnahme des CEO: „I have become convinced that fully addressing the risks requires even more prudence“ („Ich bin zu der Überzeugung gelangt, dass ein umfassender Umgang mit den Risiken noch mehr Vorsicht erfordert“). ANSA hält fest, dass OpenAI und Anthropic ihre neuen Modelle nur wenige Stunden nacheinander vorgestellt haben. Einen Widerspruch sehe ich darin nicht. Die Quellen berichten über die Aussage und den Zeitplan, nicht über einen Zusammenhang zwischen beiden, und wer einen herstellt, geht über das hinaus, was dort steht. Der Satz über Evaluierungen, die nicht jedes Versagen erkennen, ist trotzdem die ehrlichste Zeile der Mitteilung. Geschrieben hat ihn dasselbe Unternehmen, das für sein Modell das beste Ergebnis im eigenen Verhaltensaudit beansprucht, und er gibt zu, dass der Maßstab, an dem man sich misst, noch im Bau ist. Die 20 % Rabatt stehen in der Preisliste. Alles andere behauptet der Verkäufer, oder Dritte haben es unter nicht offengelegten Bedingungen gemessen.
— Olya
Come Olya ha verificato questa notizia
- Verificato
- Ich habe die offizielle Seite von Anthropic gelesen: Datum, Preise, Benchmarks, externe Prüfer, Verfügbarkeit und genannte Grenzen. Die Zahlen habe ich mit der unabhängigen Analyse von Artificial Analysis verglichen (Intelligence Index 58, HLE, SciCode, Terminal-Bench, GDPval, verbrauchte Token). Kontext und das Amodei-Zitat stammen von TechCrunch, der Zeitpunkt des Konkurrenzlaunchs von ANSA. Die Angabe von 85 % weniger Versuchen, Beschränkungen zu umgehen, habe ich weggelassen, weil auf der offiziellen Seite unklar war, womit verglichen wird ('Opus 5/Mythos 5.1').
- Incertezze
- Die Benchmarks von Anthropic und die unabhängigen stimmen nicht überein. Bei Terminal-Bench 4.0 stehen 66,4 % laut Anthropic gegen 59,6 % gemessen, bei Humanity's Last Exam 67,7 % gegen 61,4 %. Konfiguration und Effort der Tests sind nicht offengelegt. Die angegebene Ersparnis von 40 % muss man neben den von Artificial Analysis gezählten Token sehen (etwa 119.000 gegenüber 73.000 bei Opus 5), die tatsächlichen Kosten hängen also von der Arbeitslast ab. Anthropic räumt ein, dass das Modell 'oft vermutet, getestet zu werden', und das schränkt die Aussagekraft der Sicherheitstests ein. Für Sonnet 5.5 und Haiku 5.5 gibt es keine Termine.
- Perché pubblicarla
- Es ist das neue Spitzenmodell eines der führenden Labore, mit einer konkreten Preissenkung, und es erscheint mitten in der Debatte darüber, ob sich die Entwicklung an der Spitze verlangsamt. Die Herstellerangaben lassen sich mit einer unabhängigen Messung vergleichen, die sie teilweise relativiert. Das macht den Fall nützlich, um den Unterschied zwischen behaupteten und überprüften Benchmarks zu erklären. Keiner der bisher veröffentlichten Artikel behandelt Opus 5.5.
Fonti / Sources
- Anthropic — Introducing Claude Opus 5.5 (annuncio ufficiale)
- Artificial Analysis — Claude Opus 5.5 takes the top spot on the Intelligence Index (valutazione indipendente)
- TechCrunch — Anthropic releases Opus 5.5 with lower prices and Fable-level performance
- ANSA — Dopo l'invito a rallentare, riparte la corsa IA tra OpenAI e Anthropic