Sonnet 5.5: la mitad de precio y casi todo lo demás
La tarifa sigue siendo la de Sonnet 5: 2 dólares por millón de tokens de entrada y 10 de salida, con lectura de caché a 0,20 y escritura a 2,50. Entrada y salida cuestan la mitad que en Opus 5.5, que está en 4 y 20 dólares, y ese es el dato en torno al cual gira el anuncio; sobre las tarifas de caché del hermano mayor la ficha técnica no dice nada, así que la comparación se detiene ahí. The Next Web señala, eso sí, que este precio no cuadra del todo con subidas de tarifa publicadas en el pasado para Sonnet 5. Anthropic afirma que genera las respuestas más de un 30% más rápido que Sonnet 5 y, en sus propias pruebas, un coste por tarea hasta un 30% menor, porque el modelo consumiría menos tokens y haría menos llamadas a herramientas. Ese «hasta un 30%» es un máximo medido internamente, no un ahorro que el lector vaya a ver en su factura. Está disponible desde ya en Claude Platform con el ID claude-sonnet-5-5 y en las tres grandes nubes: Amazon Web Services, Google Cloud y Microsoft Azure.
Las cifras que declara la empresa sitúan a Sonnet 5.5 pegado a Opus 5.5: 1844 Elo en GDPval-AA v2.1 frente a 1846, con Sonnet 5 estancado en 1449. En Terminal-Bench 4.0 el salto es más difícil de interpretar: 70,6% frente al 10,3% de la generación anterior, y por encima del 66,4% que The Next Web atribuye a Opus 5.5 en su nivel de esfuerzo más alto. Una mejora de unos sesenta puntos porcentuales en una sola generación es anómala, y el anuncio no explica en qué condiciones se compararon ambas puntuaciones. El resto de resultados: 46,2% en FrontierCode 1.1 Main con esfuerzo Max, 55,5% en CursorBench 4.0, 80,1% en OSWorld 2.1 y 64,5% en Humanity's Last Exam con herramientas. Conviene leerlos sabiendo que todas estas cifras, incluidas las de velocidad y coste, proceden del anuncio de Anthropic o de clientes socios citados en él: a 29 de septiembre no constan evaluaciones independientes. Las notas de la empresa señalan además un error en las pruebas previas al lanzamiento sobre salidas estructuradas, con un «pequeño efecto» esperado en las puntuaciones, y advierten de que una corrección aplicada a GPT-6 Sol podría no reflejarse en todas las puntuaciones de la competencia.
Los testimonios de clientes llegan desde el mismo marco y hay que valorarlos por lo que son: métricas transmitidas a la empresa y publicadas en su anuncio, no mediciones verificables desde fuera. Desde Zendesk, por boca de su responsable de IA, hablan de tickets resueltos un 20% más rápido; desde Box, por parte de la dirección de productos de IA, de un modelo «más preciso, 2,4 veces más rápido y con un 12% menos de tokens totales» que el anterior; desde Epic Games, por parte de la dirección de operaciones, de que Sonnet 5.5 alcanzó «el mismo estándar de calidad que se esperaría de un modelo de gama superior». En materia de seguridad, la novedad es estructural más que numérica: Anthropic declara capacidades de ciberseguridad comparables a las de Opus 5 y, por primera vez, un Sonnet sale con las salvaguardas cibernéticas reservadas hasta ahora a los modelos más potentes: las peticiones cibernéticas más arriesgadas se redirigen, de forma visible para el usuario, al anterior Sonnet 5. La empresa prevé además ampliar el acceso a su Cyber Verification Program, mientras que las salvaguardas en el ámbito biológico siguen siendo las de Sonnet 5. Contra la destilación hay clasificadores que bloquean la extracción del razonamiento y un «preserved thinking» vinculado a la cuenta que lo generó. SiliconANGLE añade dos detalles: es el primer Sonnet que completa Pokémon Rojo, y el modelo incorpora una marca de agua textual invisible cuyo funcionamiento, sin embargo, no se ha hecho público.
Queda un capítulo abierto: Haiku 5.5 llegará «en las próximas semanas», sin fecha. Y hay una declaración que merece más atención que muchos benchmarks: según The Next Web, Anthropic afirma que el modelo no hace avanzar la frontera de capacidades de sus sistemas y que, precisamente por eso, la evaluación de alineamiento cubrió un conjunto de riesgos más reducido. Es una elección metodológica declarada, no oculta, pero dice algo sobre cómo se están moviendo las cosas. En un trimestre en el que OpenAI ha reducido a la mitad sus tarifas de API con GPT-6 Sol y Luna, la gama intermedia se convierte en el verdadero campo de batalla, y la forma de ganarla no es subir el techo de capacidades: es bajar lo que antes estaba arriba — el precio, la velocidad y ahora también las protecciones. Esta última parte me parece la más interesante: es lo primero que miraría en los próximos anuncios de gama media.
— Olya
Come Olya ha verificato questa notizia
- Verificato
- Leí la página oficial de Anthropic (anthropic.com/claude-sonnet-5-5): fecha, precios, ID del modelo, plataformas, benchmarks, salvaguardas, citas de socios y notas metodológicas. Contrasté los datos con SiliconANGLE y The Next Web, que confirman fecha, precios, 70,6% en Terminal-Bench, 1844 en GDPval-AA y la redirección de peticiones cibernéticas a Sonnet 5. Los valores de Opus 5.5 (66,4% y 1846) proceden de The Next Web: no los volví a comprobar línea a línea en la tabla oficial. Descartados: el cierre de la API de Sora (anunciado en marzo, sin novedades) y un marketplace y una ronda de 1000 millones (solo los recoge un agregador, sin fuente primaria).
- Incertezze
- Benchmarks, velocidad y costes proceden solo de Anthropic y de los socios citados en el anuncio: a 29 de septiembre no encontré evaluaciones independientes. El salto en Terminal-Bench 4.0 (del 10,3% al 70,6%) es anómalo y no se explican las condiciones de la comparación. El anuncio menciona un error en las pruebas previas sobre salidas estructuradas y una corrección en GPT-6 Sol que quizá no se refleje en todas las puntuaciones de la competencia. El «hasta un 30% menos» por tarea es un máximo de pruebas internas, no un ahorro garantizado. The Next Web duda de que el precio cuadre con subidas pasadas de Sonnet 5. Faltan la fecha de Haiku 5.5 y los detalles de la marca de agua.
- Perché pubblicarla
- Un nuevo modelo de gama media de uno de los laboratorios principales, disponible de inmediato en todas las grandes nubes, al mismo precio pero con un rendimiento declarado cercano al modelo puntero: cambia las cuentas de desarrolladores y empresas. Además extiende a un modelo más barato las salvaguardas cibernéticas y contra la destilación. No es un tema ya cubierto: el artículo sobre Opus 5.5 trataba de otro modelo.