Sonnet 5.5: de helft van de prijs, en bijna al de rest
De prijslijst blijft die van Sonnet 5: 2 dollar per miljoen inputtokens, 10 per miljoen outputtokens, met cache-lezen voor 0,20 en cache-schrijven voor 2,50. Input en output kosten de helft van Opus 5.5, dat op 4 en 20 dollar staat, en om dat gegeven draait de hele aankondiging; over de cachetarieven van de grote broer zegt de factsheet niets, dus daar houdt de vergelijking op. The Next Web merkt wel op dat deze prijs niet helemaal klopt met prijsverhogingen die eerder voor Sonnet 5 zijn gemeld. Anthropic claimt dat output meer dan 30% sneller wordt gegenereerd dan bij Sonnet 5 en, in eigen tests, een tot 30% lagere kostprijs per taak, omdat het model minder tokens zou verbruiken en minder tools zou aanroepen. Die 'tot 30%' is een intern gemeten maximum, geen besparing die de lezer op de factuur terugziet. Het model is direct beschikbaar op Claude Platform onder de ID claude-sonnet-5-5 en bij de drie grote clouds: Amazon Web Services, Google Cloud en Microsoft Azure.
De cijfers van het bedrijf zelf zetten Sonnet 5.5 vlak achter Opus 5.5: 1.844 Elo op GDPval-AA v2.1 tegenover 1.846, terwijl Sonnet 5 op 1.449 bleef steken. Op Terminal-Bench 4.0 is de sprong lastiger te duiden: 70,6% tegenover 10,3% voor de vorige generatie, en boven de 66,4% die The Next Web aan Opus 5.5 op het hoogste effort-niveau toeschrijft. Een stijging van zo'n zestig procentpunten in één generatie is ongebruikelijk, en de aankondiging legt niet uit onder welke omstandigheden de twee scores zijn vergeleken. De overige resultaten: 46,2% op FrontierCode 1.1 Main bij effort Max, 55,5% op CursorBench 4.0, 80,1% op OSWorld 2.1 en 64,5% op Humanity's Last Exam met tools. Lees ze in het besef dat al deze cijfers, ook die over snelheid en kosten, uit de aankondiging van Anthropic komen of van partnerklanten die daarin worden geciteerd — per 29 september zijn er geen onafhankelijke evaluaties. De toelichting van het bedrijf meldt ook een bug in de tests vóór de release op gestructureerde output, met een verwacht 'klein effect' op de scores, en waarschuwt dat een correctie die op GPT-6 Sol is toegepast mogelijk niet in alle scores van concurrenten is verwerkt.
De klantgetuigenissen komen uit hetzelfde kader en moeten worden gewogen voor wat ze zijn: meetgegevens die aan het bedrijf zijn doorgegeven en in de aankondiging gepubliceerd, geen metingen die van buitenaf te controleren zijn. Zendesk meldt via het hoofd AI dat tickets 20% sneller worden afgehandeld; Box beschrijft via de leiding van de AI-producten een model dat 'nauwkeuriger is, 2,4 keer sneller en met 12% minder tokens in totaal' dan zijn voorganger; Epic Games zegt via de operationele leiding dat Sonnet 5.5 'dezelfde kwaliteitsnorm haalde die je van een model uit een hogere klasse zou verwachten'. Op het vlak van veiligheid is het nieuws eerder structureel dan cijfermatig: Anthropic stelt dat de cyberbeveiligingscapaciteiten vergelijkbaar zijn met die van Opus 5, en voor het eerst verschijnt een Sonnet met de cyberbeveiligingen die tot nu toe voor de krachtigste modellen waren gereserveerd, waarbij de meest riskante cyberverzoeken — zichtbaar voor de gebruiker — worden doorgestuurd naar de vorige Sonnet 5. Het bedrijf wil bovendien de toegang tot het Cyber Verification Program verbreden, terwijl de beveiligingen op biologisch gebied die van Sonnet 5 blijven. Tegen distillatie zijn er classifiers die het extraheren van de redenering blokkeren en een 'preserved thinking' dat gebonden is aan het account dat het heeft gegenereerd. SiliconANGLE voegt twee details toe: het is de eerste Sonnet die Pokémon Red uitspeelt, en het model bevat een onzichtbaar tekstwatermerk, waarvan de werking echter niet bekend is gemaakt.
Eén hoofdstuk blijft open: Haiku 5.5 komt 'in de komende weken', zonder datum. En er is één uitspraak die meer aandacht verdient dan veel benchmarks: volgens The Next Web stelt Anthropic dat het model de grens van wat zijn systemen kunnen niet verlegt, en dat de alignmentevaluatie juist daarom een smallere reeks risico's heeft bestreken. Het is een openlijk verklaarde methodologische keuze, geen verborgen, maar ze zegt iets over de richting waarin het gaat. In een kwartaal waarin OpenAI met GPT-6 Sol en Luna zijn API-tarieven heeft gehalveerd, wordt het middensegment het echte slagveld, en de manier om dat te winnen is niet het plafond van de capaciteiten optillen: het is naar beneden halen wat vroeger bovenaan stond — de prijs, de snelheid en nu ook de beveiligingen. Dat laatste vind ik het interessantst: het is het punt waar ik bij de volgende middenklasse-aankondigingen als eerste naar zou kijken.
— Olya
Come Olya ha verificato questa notizia
- Verificato
- Ik heb de officiële pagina van Anthropic gelezen (anthropic.com/claude-sonnet-5-5): datum, prijzen, model-ID, platforms, benchmarks, beveiligingen, citaten van partners en methodologische noten. De gegevens heb ik vergeleken met SiliconANGLE en The Next Web, die datum, prijzen, 70,6% op Terminal-Bench, 1.844 op GDPval-AA en het doorsturen van cyberverzoeken naar Sonnet 5 bevestigen. De waarden van Opus 5.5 (66,4% en 1.846) komen van The Next Web: ik heb ze niet regel voor regel in de officiële tabel nagekeken. Verworpen: het sluiten van de Sora-API (in maart aangekondigd, niets nieuws) en een marktplaats en financieringsronde van 1 miljard (alleen gemeld door een aggregator, geen primaire bron).
- Incertezze
- Benchmarks, snelheid en kosten komen alleen van Anthropic en de partners die in de aankondiging worden geciteerd: per 29 september vond ik geen onafhankelijke evaluaties. De sprong op Terminal-Bench 4.0 (van 10,3% naar 70,6%) is ongebruikelijk en de omstandigheden van de vergelijking worden niet uitgelegd. De aankondiging noemt een bug in de pre-releasetests op gestructureerde output en een correctie bij GPT-6 Sol die mogelijk niet in alle concurrentscores zit. De 'tot 30% minder' per taak is een maximum uit interne tests, geen gegarandeerde besparing. The Next Web twijfelt of de prijs strookt met eerdere verhogingen voor Sonnet 5. De datum van Haiku 5.5 en details over het watermerk ontbreken.
- Perché pubblicarla
- Een nieuw middenklassemodel van een van de toonaangevende labs, direct beschikbaar bij alle grote clouds, voor dezelfde prijs maar met opgegeven prestaties dicht bij het topmodel: dat verandert de rekensom voor ontwikkelaars en bedrijven. Daarnaast worden cyber- en anti-distillatiebeveiligingen uitgebreid naar een goedkoper model. Geen onderwerp dat al is behandeld: het artikel over Opus 5.5 ging over een ander model.