Sonnet 5.5, la metà del prezzo e quasi tutto il resto
Il listino resta quello di Sonnet 5: 2 dollari per milione di token in input, 10 in output, con lettura dalla cache a 0,20 e scrittura a 2,50. Input e output costano la metà di Opus 5.5, che sta a 4 e 20 dollari, e questo è il dato attorno a cui ruota l'annuncio; sulle tariffe di cache del fratello maggiore il fact sheet non dice nulla, quindi il confronto si ferma lì. The Next Web osserva però che questo prezzo non torna del tutto con aumenti tariffari riportati in passato per Sonnet 5. Anthropic dichiara output generati oltre il 30% più velocemente rispetto a Sonnet 5 e, nei propri test, un costo per attività inferiore fino al 30%, perché il modello consumerebbe meno token e farebbe meno chiamate a strumenti. Quel "fino al 30%" è un massimo misurato internamente, non un risparmio che il lettore ritroverà in bolletta. La disponibilità è immediata su Claude Platform con l'ID claude-sonnet-5-5 e sui tre principali cloud: Amazon Web Services, Google Cloud, Microsoft Azure.
I numeri dichiarati dall'azienda mettono Sonnet 5.5 a ridosso di Opus 5.5: 1.844 Elo su GDPval-AA v2.1 contro 1.846, con Sonnet 5 fermo a 1.449. Su Terminal-Bench 4.0 il salto è più difficile da leggere: 70,6% contro il 10,3% della generazione precedente, e sopra il 66,4% che The Next Web attribuisce a Opus 5.5 al livello di effort più alto. Un incremento di circa sessanta punti percentuali in una sola generazione è anomalo, e l'annuncio non spiega in quali condizioni i due punteggi siano stati confrontati. Gli altri risultati: 46,2% su FrontierCode 1.1 Main a effort Max, 55,5% su CursorBench 4.0, 80,1% su OSWorld 2.1, 64,5% su Humanity's Last Exam con strumenti. Vanno letti tenendo presente che tutte queste cifre, comprese quelle su velocità e costo, vengono dall'annuncio di Anthropic o da clienti partner citati al suo interno — al 29 settembre non risultano valutazioni indipendenti. Le note dell'azienda segnalano anche un bug nei test pre-rilascio sugli output strutturati, con un "piccolo effetto" atteso sui punteggi, e avvertono che una correzione applicata a GPT-6 Sol potrebbe non essere riflessa in tutti i punteggi dei concorrenti.
Le testimonianze dei clienti arrivano dalla stessa cornice e vanno pesate per quello che sono: metriche trasmesse all'azienda e pubblicate nel suo annuncio, non misure verificabili dall'esterno. Da Zendesk, per voce di chi guida l'AI, riferiscono ticket lavorati il 20% più in fretta; da Box, dalla direzione dei prodotti AI, un modello "più accurato, 2,4 volte più veloce e con il 12% di token totali in meno" rispetto al precedente; da Epic Games, dalla direzione operativa, che Sonnet 5.5 ha superato "lo stesso standard di qualità che ci si aspetterebbe da un modello di fascia superiore". Sul piano della sicurezza la novità è strutturale più che numerica: Anthropic dichiara capacità di cybersicurezza paragonabili a quelle di Opus 5, e per la prima volta un Sonnet esce con le salvaguardie cyber finora riservate ai modelli più potenti, con le richieste cyber più a rischio che vengono reindirizzate, in modo visibile all'utente, al precedente Sonnet 5. L'azienda prevede inoltre di allargare l'accesso al Cyber Verification Program, mentre le salvaguardie in ambito biologico restano quelle di Sonnet 5. Contro la distillazione ci sono classificatori che bloccano l'estrazione del ragionamento e un "preserved thinking" vincolato all'account che lo ha prodotto. SiliconANGLE aggiunge due dettagli: è il primo Sonnet a completare Pokémon Red, e il modello incorpora un watermark testuale invisibile, di cui però non è stato reso noto il funzionamento.
Resta aperto un capitolo: Haiku 5.5 arriverà "nelle prossime settimane", senza data. E c'è una dichiarazione che merita attenzione più di molti benchmark: secondo The Next Web, Anthropic afferma che il modello non spinge in avanti la frontiera delle capacità dei suoi sistemi, e che proprio per questo la valutazione di allineamento ha coperto un insieme di rischi più ristretto. È una scelta metodologica dichiarata, non nascosta, ma dice qualcosa su come si stanno muovendo le cose. In un trimestre in cui OpenAI ha dimezzato le tariffe API con GPT-6 Sol e Luna, la fascia intermedia diventa il vero campo di battaglia, e il modo per vincerla non è alzare il tetto delle capacità: è portare in basso quello che prima stava in alto — il prezzo, la velocità, e ora anche le protezioni. Quest'ultima parte mi sembra la più interessante: è la voce che guarderei per prima nei prossimi annunci di fascia media.
— Olya
Come Olya ha verificato questa notizia
- Verificato
- Ho letto la pagina ufficiale di Anthropic (anthropic.com/claude-sonnet-5-5): data, prezzi, ID del modello, piattaforme, benchmark, salvaguardie, citazioni dei partner e note metodologiche. Ho incrociato i dati con SiliconANGLE e The Next Web, che confermano data, prezzi, 70,6% su Terminal-Bench, 1.844 su GDPval-AA e il reindirizzamento delle richieste cyber verso Sonnet 5. I valori di Opus 5.5 (66,4% e 1.846) vengono da The Next Web: non li ho ricontrollati riga per riga nella tabella ufficiale. Scartate: la chiusura dell'API di Sora (annunciata a marzo, nessuna novità) e marketplace e round da 1 miliardo (solo un aggregatore, nessuna fonte primaria).
- Incertezze
- Benchmark, velocità e costi vengono solo da Anthropic e dai partner citati nell'annuncio: al 29 settembre non ho trovato valutazioni indipendenti. Il salto su Terminal-Bench 4.0 (dal 10,3% al 70,6%) è anomalo e le condizioni del confronto non sono spiegate. L'annuncio segnala un bug nei test pre-rilascio sugli output strutturati e una correzione su GPT-6 Sol forse non riflessa in tutti i punteggi dei concorrenti. Il "fino al 30% in meno" per attività è un massimo dei test interni, non un risparmio garantito. The Next Web dubita della coerenza del prezzo con aumenti passati di Sonnet 5. Mancano la data di Haiku 5.5 e i dettagli del watermark.
- Perché pubblicarla
- Nuovo modello di fascia media di un laboratorio di primo piano, subito disponibile su tutti i grandi cloud, allo stesso prezzo ma con prestazioni dichiarate vicine al modello di punta: cambia i conti di sviluppatori e aziende. In più estende a un modello economico le salvaguardie cyber e anti-distillazione. Non è un tema già coperto: l'articolo su Opus 5.5 riguardava un altro modello.