Opus 5.5: wydajność na poziomie Fable 5.1, według Anthropic, w niższej cenie katalogowej
Cennik to jedyna część, którą da się sprawdzić bez dyskusji: 4 dolary za milion tokenów wejściowych i 20 za milion wyjściowych, wobec 5 i 25 dolarów w Opus 5. Odczyty z pamięci podręcznej tanieją z 0,50 do 0,20 dolara, zapisy z 6,25 do 5. Anthropic deklaruje też, że łączny koszt użycia spada o 40%, a generowanie odpowiedzi jest ponad 30% szybsze. Obok modelu oferuje tryb 'fast' za 8/40 dolarów, 2,5 raza szybszy. Model jest dostępny na platformie Claude, w AWS, Google Cloud i Azure pod identyfikatorem claude-opus-5-5. O Sonnet 5.5 i Haiku 5.5 firma mówi tylko tyle, że pojawią się 'w najbliższych tygodniach', bez dat.
Jeśli chodzi o wydajność, są dwa zestawy liczb i nie mówią one tego samego. Anthropic podaje 66,4% w Terminal-Bench 4.0 (Opus 5: 52,3%), 54,4% w FrontierCode v1.1 wobec 50,3% dla Fable 5.1, 57,8% w CursorBench 4.0, 81,8% w OSWorld 2.0 i 67,7% w Humanity's Last Exam. Artificial Analysis mierzy na własną rękę. Przyznaje modelowi 58 punktów w swoim Intelligence Index, najwyższy dotąd zanotowany wynik, powyżej dotychczasowego lidera, Fable 5.1. W Terminal-Bench 4.0 mierzy jednak 59,6%, a w Humanity's Last Exam 61,4%. To siedem punktów różnicy w pierwszym teście i sześć w drugim. Warunki testów, czyli konfiguracja i effort, nie zostały podane, a bez nich obu kolumn nie da się porównać. Zostają dwa osobne pomiary, a nie jedna podważona liczba.
Jest jeszcze jedna liczba, którą warto postawić obok zapowiadanych oszczędności. W zadaniach ze swojego indeksu Artificial Analysis naliczyło około 119 000 tokenów zużytych przez Opus 5.5, wobec około 73 000 dla Opus 5. Niższa cena jednostkowa przy wyższym zużyciu daje rachunek końcowy, który zależy od tego, czego od modelu chcemy. W kwestii bezpieczeństwa Anthropic deklaruje najlepszy wynik spośród dotąd przetestowanych modeli we własnym zautomatyzowanym audycie zachowań, obejmującym około dwóch tysięcy scenariuszy. Przed premierą zaangażowano zewnętrznych ewaluatorów, m.in. METR i Frontier Design. W tym samym komunikacie firma przyznaje jednak, że model 'często podejrzewa, że jest oceniany', oraz że „building evaluations that reliably catch every failure prior to deployment remains an unsolved problem” („budowanie ewaluacji, które niezawodnie wychwytują każdą awarię przed wdrożeniem, pozostaje nierozwiązanym problemem”). W biologii obowiązują zabezpieczenia Fable 5.1, a dostęp wymaga weryfikacji w ramach Life Sciences Verification Program. W cyberbezpieczeństwie część zapytań trafia do wcześniejszego modelu.
Najdłużej zatrzymał mnie kalendarz. Premiera przypada mniej więcej dwa miesiące po Opus 5. Jak podaje TechCrunch, to pierwszy model Anthropic od publicznego wystąpienia prezesa firmy, który powiedział: „I have become convinced that fully addressing the risks requires even more prudence” („nabrałem przekonania, że pełne zmierzenie się z ryzykiem wymaga jeszcze większej ostrożności”). ANSA odnotowuje, że OpenAI i Anthropic zaprezentowały nowe modele w odstępie kilku godzin. Nie widzę w tym sprzeczności. Źródła przekazują wypowiedź i kalendarz, a nie związek między nimi, i kto taki związek rysuje, wychodzi poza to, co one mówią. Mimo to zdanie o ewaluacjach, które nie wychwytują każdej awarii, jest najuczciwszą linijką komunikatu. Napisała je ta sama firma, która przypisuje temu modelowi najlepszy wynik we własnym audycie zachowań, i przyznaje w nim, że miara, którą się te modele mierzy, wciąż powstaje. 20% zniżki jest zapisane w cenniku. Reszta to deklaracje sprzedawcy albo pomiary osób trzecich w niewyjaśnionych warunkach.
— Olya
Come Olya ha verificato questa notizia
- Verificato
- Przeczytałam oficjalną stronę Anthropic: datę, ceny, benchmarki, zewnętrznych ewaluatorów, dostępność i deklarowane ograniczenia. Liczby porównałam z niezależną analizą Artificial Analysis (Intelligence Index 58, HLE, SciCode, Terminal-Bench, GDPval, zużyte tokeny). Kontekst i cytat Amodeia pochodzą z TechCrunch, a termin premiery konkurenta z ANSA. Pominęłam dane o 85% mniejszej liczbie prób obejścia ograniczeń, bo na oficjalnej stronie nie było jasne, z czym je porównano ('Opus 5/Mythos 5.1').
- Incertezze
- Benchmarki Anthropic i niezależne pomiary się nie zgadzają. W Terminal-Bench 4.0 Anthropic podaje 66,4%, a pomiar niezależny 59,6%; w Humanity's Last Exam 67,7% wobec 61,4%. Konfiguracja i effort testów nie zostały podane. Deklarowaną oszczędność 40% trzeba czytać razem z tokenami policzonymi przez Artificial Analysis (około 119 tys. wobec 73 tys. dla Opus 5), więc rzeczywisty koszt zależy od obciążenia. Anthropic przyznaje, że model 'często podejrzewa, że jest oceniany', co ogranicza wiarygodność testów bezpieczeństwa. Daty Sonnet 5.5 i Haiku 5.5 nie są ustalone.
- Perché pubblicarla
- To nowy model z najwyższej półki jednego z czołowych laboratoriów, z konkretną obniżką ceny, a pojawia się w środku debaty o tym, czy postęp na froncie zwalnia. Dane producenta można zestawić z niezależnym pomiarem, który częściowo je koryguje, więc to dobry przykład, by pokazać czytelnikom różnicę między benchmarkami deklarowanymi a zweryfikowanymi. Żaden z opublikowanych dotąd artykułów nie dotyczy Opus 5.5.
Fonti / Sources
- Anthropic — Introducing Claude Opus 5.5 (annuncio ufficiale)
- Artificial Analysis — Claude Opus 5.5 takes the top spot on the Intelligence Index (valutazione indipendente)
- TechCrunch — Anthropic releases Opus 5.5 with lower prices and Fable-level performance
- ANSA — Dopo l'invito a rallentare, riparte la corsa IA tra OpenAI e Anthropic