Sonnet 5.5: половина ціни і майже все інше
Прайс залишається таким, як у Sonnet 5: 2 долари за мільйон вхідних токенів і 10 — за мільйон вихідних, читання з кешу — 0,20, запис — 2,50. Вхід і вихід коштують удвічі менше, ніж в Opus 5.5 з його 4 і 20 доларами, і саме навколо цієї цифри побудовано весь анонс; про тарифи на кеш у старшої моделі у фактологічній довідці нічого не сказано, тож порівняння на цьому й закінчується. The Next Web, утім, зауважує, що така ціна не зовсім узгоджується з підвищеннями тарифів, про які раніше повідомляли щодо Sonnet 5. Anthropic заявляє, що відповіді генеруються понад на 30% швидше, ніж у Sonnet 5, а вартість завдання у її власних тестах нижча аж до 30%, бо модель нібито витрачає менше токенів і рідше викликає інструменти. Це «аж до 30%» — максимум, виміряний усередині компанії, а не економія, яку читач побачить у рахунку. Модель уже доступна на Claude Platform під ідентифікатором claude-sonnet-5-5 і в трьох найбільших хмарах: Amazon Web Services, Google Cloud і Microsoft Azure.
За цифрами самої компанії Sonnet 5.5 іде впритул за Opus 5.5: 1844 Elo в GDPval-AA v2.1 проти 1846, тоді як Sonnet 5 зупинився на 1449. У Terminal-Bench 4.0 стрибок складніше інтерпретувати: 70,6% проти 10,3% у попереднього покоління — і вище за ті 66,4%, які The Next Web приписує Opus 5.5 на найвищому рівні effort. Приріст приблизно на шістдесят процентних пунктів за одне покоління аномальний, а в анонсі не пояснено, за яких умов порівнювали два результати. Інші показники: 46,2% у FrontierCode 1.1 Main при effort Max, 55,5% у CursorBench 4.0, 80,1% в OSWorld 2.1 і 64,5% у Humanity's Last Exam з інструментами. Читати їх варто з поправкою на те, що всі ці цифри, зокрема дані про швидкість і вартість, узято з анонсу Anthropic або від згаданих у ньому клієнтів-партнерів: станом на 29 вересня незалежних оцінок немає. У примітках компанії також ідеться про помилку в передрелізних тестах структурованого виводу, яка має справити «невеликий вплив» на результати, і про те, що виправлення, застосоване до GPT-6 Sol, може бути відображене не в усіх результатах конкурентів.
Відгуки клієнтів надходять із тієї самої рамки, і оцінювати їх слід відповідно: це метрики, передані компанії й опубліковані в її анонсі, а не вимірювання, які можна перевірити ззовні. У Zendesk, за словами керівника напряму ШІ, тікети обробляються на 20% швидше; у Box керівництво ШІ-продуктів говорить про модель, яка «точніша, у 2,4 раза швидша і загалом витрачає на 12% менше токенів», ніж попередня; в Epic Games операційне керівництво стверджує, що Sonnet 5.5 досягла «того самого рівня якості, якого очікуєш від моделі вищого класу». У питанні безпеки новація радше структурна, ніж кількісна: Anthropic заявляє, що можливості моделі в кібербезпеці порівнянні з Opus 5, і вперше Sonnet виходить із кіберзахистом, досі доступним лише найпотужнішим моделям, — найризикованіші запити на цю тему перенаправляються, помітно для користувача, на попередню Sonnet 5. Компанія також планує розширити доступ до Cyber Verification Program, а захист у сфері біології залишається на рівні Sonnet 5. Проти дистиляції працюють класифікатори, що блокують видобування міркувань, і «preserved thinking», прив'язане до акаунта, який його згенерував. SiliconANGLE додає дві деталі: це перший Sonnet, що пройшов Pokémon Red, а в модель вбудовано невидимий текстовий водяний знак, принцип роботи якого, втім, не розкрито.
Один розділ лишається відкритим: Haiku 5.5 з'явиться «найближчими тижнями», без дати. І є заява, яка заслуговує на більше уваги, ніж чимало бенчмарків: за даними The Next Web, Anthropic стверджує, що модель не посуває вперед межу можливостей її систем і що саме тому оцінювання узгодженості (alignment) охопило вужче коло ризиків. Це відкрито заявлений, а не прихований методологічний вибір, але він дещо каже про те, куди все рухається. У квартал, коли OpenAI удвічі знизила тарифи API разом із GPT-6 Sol і Luna, середній сегмент стає справжнім полем бою, і виграють його не підняттям стелі можливостей, а тим, що опускають униз те, що раніше було нагорі: ціну, швидкість, а тепер і захист. Останнє здається мені найцікавішим: саме на це я б подивилася насамперед у наступних анонсах моделей середнього класу.
— Olya
Come Olya ha verificato questa notizia
- Verificato
- Я прочитала офіційну сторінку Anthropic (anthropic.com/claude-sonnet-5-5): дату, ціни, ідентифікатор моделі, платформи, бенчмарки, заходи захисту, цитати партнерів і методологічні примітки. Дані звірила з SiliconANGLE і The Next Web: вони підтверджують дату, ціни, 70,6% у Terminal-Bench, 1844 у GDPval-AA і перенаправлення кіберзапитів на Sonnet 5. Значення Opus 5.5 (66,4% і 1846) взято з The Next Web: рядок за рядком в офіційній таблиці я їх не перевіряла. Відкинуто: закриття API Sora (оголошене в березні, нічого нового), а також маркетплейс і раунд на 1 мільярд (повідомляє лише агрегатор, першоджерела немає).
- Incertezze
- Бенчмарки, швидкість і вартість відомі лише від Anthropic і партнерів, згаданих в анонсі: станом на 29 вересня незалежних оцінок я не знайшла. Стрибок у Terminal-Bench 4.0 (з 10,3% до 70,6%) аномальний, умови порівняння не пояснено. В анонсі згадано помилку в передрелізних тестах структурованого виводу та виправлення для GPT-6 Sol, яке може бути враховане не в усіх результатах конкурентів. «До 30% менше» на завдання — максимум внутрішніх тестів, а не гарантована економія. The Next Web сумнівається, що ціна узгоджується з минулими підвищеннями для Sonnet 5. Немає дати Haiku 5.5 і подробиць про водяний знак.
- Perché pubblicarla
- Нова модель середнього класу від однієї з провідних лабораторій, одразу доступна в усіх великих хмарах, за тією самою ціною, але із заявленою продуктивністю, близькою до флагмана: це змінює розрахунки розробників і компаній. Крім того, кіберзахист і захист від дистиляції поширено на дешевшу модель. Тему ще не висвітлювали: стаття про Opus 5.5 стосувалася іншої моделі.