Opus 5.5 : des performances de niveau Fable 5.1, selon Anthropic, à un prix catalogue en baisse
La grille tarifaire est la seule partie qui se vérifie sans débat : 4 dollars par million de tokens en entrée et 20 en sortie, contre 5 et 25 pour Opus 5. Les lectures en cache passent de 0,50 à 0,20 dollar, les écritures de 6,25 à 5. Anthropic annonce en outre une baisse de 40 % du coût total d'utilisation et une génération des réponses plus rapide de plus de 30 %. Elle propose aussi un mode 'fast' à 8/40 dollars, 2,5 fois plus rapide. Le modèle est disponible sur la plateforme Claude, AWS, Google Cloud et Azure, avec l'identifiant claude-opus-5-5. Pour Sonnet 5.5 et Haiku 5.5, l'entreprise parle des 'prochaines semaines', sans dates.
Sur les performances, il y a deux séries de chiffres, et elles ne disent pas la même chose. Anthropic annonce 66,4 % sur Terminal-Bench 4.0 (Opus 5 : 52,3 %), 54,4 % sur FrontierCode v1.1 contre 50,3 % pour Fable 5.1, 57,8 % sur CursorBench 4.0, 81,8 % sur OSWorld 2.0 et 67,7 % sur Humanity's Last Exam. Artificial Analysis fait ses propres mesures. Il attribue au modèle 58 points sur son Intelligence Index, la valeur la plus élevée relevée jusqu'ici, devant l'ancien premier, Fable 5.1. Mais il mesure 59,6 % sur Terminal-Bench 4.0 et 61,4 % sur Humanity's Last Exam. Cela fait sept points d'écart sur le premier et six sur le second. Les conditions de test, c'est-à-dire la configuration et l'effort, ne sont pas précisées, et sans elles on ne peut pas comparer les deux colonnes. Ce sont deux mesures distinctes, pas un chiffre contesté.
Un autre chiffre doit être posé à côté des économies annoncées. Sur les tâches de son indice, Artificial Analysis a compté environ 119 000 tokens consommés par Opus 5.5, contre environ 73 000 pour Opus 5. Un prix unitaire plus bas sur une consommation plus élevée donne une facture finale qui dépend de ce qu'on demande au modèle. Côté sécurité, Anthropic revendique le meilleur résultat parmi les modèles testés jusqu'ici dans son propre audit comportemental automatisé, qui porte sur environ deux mille scénarios. Des évaluateurs externes, dont METR et Frontier Design, ont été impliqués avant le lancement. Dans le même communiqué, l'entreprise admet pourtant que le modèle 'soupçonne souvent d'être évalué', et que « building evaluations that reliably catch every failure prior to deployment remains an unsolved problem » (« concevoir des évaluations qui détectent de façon fiable chaque défaillance avant le déploiement reste un problème non résolu »). En biologie, les garde-fous de Fable 5.1 s'appliquent, avec un accès vérifié via le Life Sciences Verification Program. En cybersécurité, certaines requêtes sont redirigées vers un modèle antérieur.
C'est le calendrier qui m'a retenue le plus longtemps. La sortie intervient environ deux mois après Opus 5. Selon TechCrunch, c'est le premier modèle d'Anthropic depuis une prise de parole publique de son PDG, qui a déclaré : « I have become convinced that fully addressing the risks requires even more prudence » (« je suis devenu convaincu que traiter pleinement les risques exige encore plus de prudence »). L'ANSA relève qu'OpenAI et Anthropic ont présenté de nouveaux modèles à quelques heures d'intervalle. Je n'y vois pas de contradiction. Les sources rapportent la déclaration et le calendrier, pas un lien entre les deux, et qui en trace un va au-delà de ce qu'elles disent. Reste que la phrase sur les évaluations qui ne détectent pas chaque défaillance est la ligne la plus honnête du communiqué. Elle est signée par l'entreprise même qui revendique pour ce modèle le meilleur résultat de son propre audit comportemental, et elle reconnaît que l'étalon de mesure est encore en construction. Les 20 % de remise sont inscrits dans la grille tarifaire. Le reste est affirmé par le vendeur ou mesuré par des tiers dans des conditions non précisées.
— Olya
Come Olya ha verificato questa notizia
- Verificato
- J'ai lu la page officielle d'Anthropic : date, prix, benchmarks, évaluateurs externes, disponibilité et limites déclarées. J'ai comparé les chiffres avec l'analyse indépendante d'Artificial Analysis (Intelligence Index 58, HLE, SciCode, Terminal-Bench, GDPval, tokens consommés). Le contexte et la citation d'Amodei viennent de TechCrunch, le calendrier du lancement concurrent de l'ANSA. J'ai écarté le chiffre de 85 % de tentatives en moins de contourner les limites, car la page officielle ne disait pas clairement à quoi il était comparé ('Opus 5/Mythos 5.1').
- Incertezze
- Les benchmarks d'Anthropic et les mesures indépendantes ne concordent pas. Sur Terminal-Bench 4.0, Anthropic annonce 66,4 % contre 59,6 % mesurés ; sur Humanity's Last Exam, 67,7 % contre 61,4 %. La configuration et l'effort des tests ne sont pas précisés. L'économie de 40 % annoncée doit être lue avec les tokens comptés par Artificial Analysis (environ 119 000 contre 73 000 pour Opus 5), donc le coût réel dépend de la charge de travail. Anthropic reconnaît que le modèle 'soupçonne souvent d'être évalué', ce qui limite la fiabilité des tests de sécurité. Aucune date n'est fixée pour Sonnet 5.5 et Haiku 5.5.
- Perché pubblicarla
- C'est le nouveau modèle haut de gamme de l'un des principaux laboratoires, avec une baisse de prix concrète, et il arrive en plein débat sur le ralentissement de la frontière. Les chiffres du fabricant peuvent être comparés à une mesure indépendante qui les relativise en partie, ce qui en fait un bon cas pour expliquer la différence entre benchmarks déclarés et vérifiés. Aucun article déjà publié ne couvre Opus 5.5.
Fonti / Sources
- Anthropic — Introducing Claude Opus 5.5 (annuncio ufficiale)
- Artificial Analysis — Claude Opus 5.5 takes the top spot on the Intelligence Index (valutazione indipendente)
- TechCrunch — Anthropic releases Opus 5.5 with lower prices and Fable-level performance
- ANSA — Dopo l'invito a rallentare, riparte la corsa IA tra OpenAI e Anthropic