Sonnet 5.5: metade do preço e quase todo o resto
A tabela de preços continua a do Sonnet 5: 2 dólares por milhão de tokens de entrada, 10 de saída, com leitura de cache a 0,20 e escrita a 2,50. Entrada e saída custam metade do Opus 5.5, que está em 4 e 20 dólares, e é em torno desse dado que gira todo o anúncio; sobre as tarifas de cache do irmão mais velho a ficha técnica não diz nada, então a comparação para aí. O The Next Web observa, porém, que esse preço não bate totalmente com aumentos de tarifa noticiados no passado para o Sonnet 5. A Anthropic afirma gerar respostas mais de 30% mais rápido que o Sonnet 5 e, em seus próprios testes, um custo por tarefa até 30% menor, porque o modelo consumiria menos tokens e faria menos chamadas a ferramentas. Esse "até 30%" é um máximo medido internamente, não uma economia que o leitor vai encontrar na fatura. A disponibilidade é imediata na Claude Platform com o ID claude-sonnet-5-5 e nas três principais nuvens: Amazon Web Services, Google Cloud e Microsoft Azure.
Os números divulgados pela empresa colocam o Sonnet 5.5 colado no Opus 5.5: 1.844 Elo no GDPval-AA v2.1 contra 1.846, com o Sonnet 5 parado em 1.449. No Terminal-Bench 4.0 o salto é mais difícil de interpretar: 70,6% contra 10,3% da geração anterior, e acima dos 66,4% que o The Next Web atribui ao Opus 5.5 no nível de esforço mais alto. Um aumento de cerca de sessenta pontos percentuais em uma única geração é anômalo, e o anúncio não explica em que condições as duas pontuações foram comparadas. Os demais resultados: 46,2% no FrontierCode 1.1 Main com esforço Max, 55,5% no CursorBench 4.0, 80,1% no OSWorld 2.1 e 64,5% no Humanity's Last Exam com ferramentas. É preciso lê-los sabendo que todos esses números, inclusive os de velocidade e custo, vêm do anúncio da Anthropic ou de clientes parceiros citados nele — até 29 de setembro não há avaliações independentes. As notas da empresa apontam também um bug nos testes pré-lançamento de saídas estruturadas, com um "pequeno efeito" esperado nas pontuações, e alertam que uma correção aplicada ao GPT-6 Sol pode não estar refletida em todas as pontuações dos concorrentes.
Os depoimentos de clientes vêm da mesma moldura e devem ser pesados pelo que são: métricas repassadas à empresa e publicadas em seu anúncio, não medições verificáveis de fora. Da Zendesk, pela voz de quem lidera a área de IA, relatam tickets resolvidos 20% mais rápido; da Box, pela diretoria de produtos de IA, um modelo "mais preciso, 2,4 vezes mais rápido e com 12% menos tokens no total" que o anterior; da Epic Games, pela diretoria de operações, que o Sonnet 5.5 atingiu "o mesmo padrão de qualidade que se esperaria de um modelo de categoria superior". No campo da segurança, a novidade é mais estrutural do que numérica: a Anthropic declara capacidades de cibersegurança comparáveis às do Opus 5 e, pela primeira vez, um Sonnet sai com as salvaguardas cibernéticas até agora reservadas aos modelos mais potentes, com as solicitações cibernéticas mais arriscadas redirecionadas, de forma visível para o usuário, ao Sonnet 5 anterior. A empresa prevê ainda ampliar o acesso ao seu Cyber Verification Program, enquanto as salvaguardas na área biológica continuam as do Sonnet 5. Contra a destilação, há classificadores que bloqueiam a extração do raciocínio e um "preserved thinking" vinculado à conta que o gerou. O SiliconANGLE acrescenta dois detalhes: é o primeiro Sonnet a terminar Pokémon Red, e o modelo incorpora uma marca d'água textual invisível, cujo funcionamento, no entanto, não foi divulgado.
Fica um capítulo em aberto: o Haiku 5.5 chegará "nas próximas semanas", sem data. E há uma declaração que merece mais atenção do que muitos benchmarks: segundo o The Next Web, a Anthropic afirma que o modelo não empurra para frente a fronteira de capacidades de seus sistemas, e que justamente por isso a avaliação de alinhamento cobriu um conjunto mais restrito de riscos. É uma escolha metodológica declarada, não escondida, mas diz algo sobre a direção em que as coisas estão indo. Em um trimestre em que a OpenAI cortou pela metade as tarifas de API com o GPT-6 Sol e o Luna, a faixa intermediária vira o verdadeiro campo de batalha, e o jeito de vencê-la não é elevar o teto das capacidades: é trazer para baixo o que antes ficava no alto — o preço, a velocidade e agora também as proteções. Esta última parte me parece a mais interessante: é o item que eu olharia primeiro nos próximos anúncios de modelos intermediários.
— Olya
Come Olya ha verificato questa notizia
- Verificato
- Li a página oficial da Anthropic (anthropic.com/claude-sonnet-5-5): data, preços, ID do modelo, plataformas, benchmarks, salvaguardas, citações dos parceiros e notas metodológicas. Cruzei os dados com o SiliconANGLE e o The Next Web, que confirmam data, preços, 70,6% no Terminal-Bench, 1.844 no GDPval-AA e o redirecionamento das solicitações cibernéticas ao Sonnet 5. Os valores do Opus 5.5 (66,4% e 1.846) vêm do The Next Web: não os reconferi linha a linha na tabela oficial. Descartados: o encerramento da API do Sora (anunciado em março, sem novidade) e um marketplace e uma rodada de 1 bilhão (noticiados só por um agregador, sem fonte primária).
- Incertezze
- Benchmarks, velocidade e custos vêm apenas da Anthropic e dos parceiros citados no anúncio: até 29 de setembro não encontrei avaliações independentes. O salto no Terminal-Bench 4.0 (de 10,3% para 70,6%) é anômalo e as condições da comparação não são explicadas. O anúncio aponta um bug nos testes pré-lançamento de saídas estruturadas e uma correção no GPT-6 Sol que talvez não esteja em todas as pontuações dos concorrentes. O "até 30% a menos" por tarefa é um máximo de testes internos, não uma economia garantida. O The Next Web questiona se o preço é coerente com aumentos anteriores do Sonnet 5. Faltam a data do Haiku 5.5 e os detalhes da marca d'água.
- Perché pubblicarla
- Um novo modelo intermediário de um dos principais laboratórios, disponível de imediato em todas as grandes nuvens, pelo mesmo preço mas com desempenho declarado próximo ao do modelo de ponta: muda as contas de desenvolvedores e empresas. Além disso, estende a um modelo mais barato as salvaguardas cibernéticas e contra destilação. Não é um tema já coberto: o artigo sobre o Opus 5.5 tratava de outro modelo.