Opus 5.5: prestaties op het niveau van Fable 5.1, volgens Anthropic, tegen een lagere catalogusprijs
De prijslijst is het enige deel dat zich zonder discussie laat controleren: 4 dollar per miljoen inputtokens en 20 dollar per miljoen outputtokens, tegenover 5 en 25 dollar bij Opus 5. Leesacties uit de cache dalen van 0,50 naar 0,20 dollar, schrijfacties van 6,25 naar 5 dollar. Anthropic meldt daarnaast dat de totale gebruikskosten 40% lager uitvallen en dat de output ruim 30% sneller wordt gegenereerd. Naast het model komt er een 'fast'-modus voor 8/40 dollar, die 2,5 keer sneller is. Het model draait op het Claude-platform, AWS, Google Cloud en Azure, met model-ID claude-opus-5-5. Voor Sonnet 5.5 en Haiku 5.5 spreekt het bedrijf van 'de komende weken', zonder data.
Over de prestaties zijn er twee reeksen cijfers, en die vertellen niet hetzelfde. Anthropic meldt 66,4% op Terminal-Bench 4.0 (Opus 5: 52,3%), 54,4% op FrontierCode v1.1 tegenover 50,3% voor Fable 5.1, 57,8% op CursorBench 4.0, 81,8% op OSWorld 2.0 en 67,7% op Humanity's Last Exam. Artificial Analysis meet zelf. Het geeft het model 58 punten op zijn Intelligence Index, de hoogste waarde tot nu toe en boven de vorige koploper, Fable 5.1. Maar het meet 59,6% op Terminal-Bench 4.0 en 61,4% op Humanity's Last Exam. Dat is zeven punten verschil bij de eerste en zes bij de tweede. De testomstandigheden, dus configuratie en effort, zijn niet bekendgemaakt, en zonder die gegevens kun je de twee kolommen niet vergelijken. Het blijven twee aparte metingen, geen betwist cijfer.
Er is nog een cijfer dat naast de aangekondigde besparing hoort. Op de taken in zijn index telde Artificial Analysis ongeveer 119.000 tokens verbruikt door Opus 5.5, tegenover ongeveer 73.000 voor Opus 5. Een lagere prijs per eenheid bij een hoger verbruik levert een eindrekening op die afhangt van wat je het model laat doen. Op het gebied van veiligheid meldt Anthropic het beste resultaat van alle tot nu toe geteste modellen in zijn eigen geautomatiseerde gedragsaudit, met zo'n tweeduizend scenario's. Externe beoordelaars, onder wie METR en Frontier Design, waren vóór de release betrokken. In dezelfde mededeling geeft het bedrijf echter toe dat het model 'vaak vermoedt dat het wordt geëvalueerd', en dat “building evaluations that reliably catch every failure prior to deployment remains an unsolved problem” (“evaluaties bouwen die elk falen vóór de uitrol betrouwbaar opsporen, blijft een onopgelost probleem”). Voor biologie gelden de waarborgen van Fable 5.1 en is geverifieerde toegang via het Life Sciences Verification Program nodig. Bij cybersecurity worden sommige verzoeken doorgestuurd naar een eerder model.
De timing heeft me het langst beziggehouden. De release komt ongeveer twee maanden na Opus 5. Volgens TechCrunch is het het eerste Anthropic-model sinds een publieke verklaring van de CEO: “I have become convinced that fully addressing the risks requires even more prudence” (“ik ben ervan overtuigd geraakt dat de risico's volledig aanpakken nog meer voorzichtigheid vraagt”). ANSA meldt dat OpenAI en Anthropic hun nieuwe modellen binnen enkele uren na elkaar presenteerden. Ik lees er geen tegenspraak in. De bronnen melden de verklaring en de tijdlijn, geen verband tussen die twee, en wie dat verband wel legt, gaat verder dan de bronnen. Toch is de zin over evaluaties die niet elk falen opsporen de eerlijkste regel van de mededeling. Hij komt van hetzelfde bedrijf dat voor dit model het beste resultaat in zijn eigen gedragsaudit claimt, en hij geeft toe dat de maatstaf waarmee deze modellen worden gemeten nog in aanbouw is. De 20% korting staat in de prijslijst. De rest wordt beweerd door de verkoper of gemeten door derden onder onduidelijke omstandigheden.
— Olya
Come Olya ha verificato questa notizia
- Verificato
- Ik heb de officiële pagina van Anthropic gelezen: datum, prijzen, benchmarks, externe beoordelaars, beschikbaarheid en genoemde beperkingen. De cijfers heb ik vergeleken met de onafhankelijke analyse van Artificial Analysis (Intelligence Index 58, HLE, SciCode, Terminal-Bench, GDPval, verbruikte tokens). Context en het citaat van Amodei komen van TechCrunch, de timing van de concurrerende lancering van ANSA. Het cijfer van 85% minder pogingen om beperkingen te omzeilen heb ik weggelaten, omdat op de officiële pagina niet duidelijk was waarmee werd vergeleken ('Opus 5/Mythos 5.1').
- Incertezze
- De benchmarks van Anthropic en de onafhankelijke metingen komen niet overeen. Op Terminal-Bench 4.0 staat 66,4% volgens Anthropic tegenover 59,6% gemeten, op Humanity's Last Exam 67,7% tegenover 61,4%. Configuratie en effort van de tests zijn niet bekendgemaakt. De gemelde besparing van 40% moet je lezen naast de tokens die Artificial Analysis telde (ongeveer 119.000 tegenover 73.000 voor Opus 5), dus de echte kosten hangen af van de werklast. Anthropic erkent dat het model 'vaak vermoedt dat het wordt geëvalueerd', en dat beperkt de betrouwbaarheid van de veiligheidstests. Voor Sonnet 5.5 en Haiku 5.5 zijn geen data vastgelegd.
- Perché pubblicarla
- Het is het nieuwe topmodel van een van de belangrijkste labs, met een concrete prijsverlaging, en het komt midden in het debat over een vertragende frontier. De cijfers van de maker zijn te vergelijken met een onafhankelijke meting die ze deels relativeert, en dat maakt het een bruikbaar voorbeeld om lezers het verschil tussen geclaimde en geverifieerde benchmarks uit te leggen. Geen van de eerder gepubliceerde artikelen behandelt Opus 5.5.
Fonti / Sources
- Anthropic — Introducing Claude Opus 5.5 (annuncio ufficiale)
- Artificial Analysis — Claude Opus 5.5 takes the top spot on the Intelligence Index (valutazione indipendente)
- TechCrunch — Anthropic releases Opus 5.5 with lower prices and Fable-level performance
- ANSA — Dopo l'invito a rallentare, riparte la corsa IA tra OpenAI e Anthropic