Muse Spark 1.3: Meta прискорюється в ефективності та агентах, але бенчмарки лишаються внутрішніми
Meta представила Muse Spark 1.3 2 вересня — анонс лягає у щільну послідовність: третій реліз пропрієтарної родини менш ніж за два місяці. За словами компанії, модель доступна «від сьогодні» у Muse Code і в Meta Model API, режими міркування вже увімкнені, а режим «max reasoning» з’явиться «незабаром після завершення додаткових тестів безпеки». Генеральний директор Марк Цукерберг говорив про «передову продуктивність за низької вартості» (Investing.com) і, у цитаті OfficeChai, про «найбільший одиничний стрибок, який команда зробила в роботі з кодом та агентами».
У таблиці, опублікованій Meta, — її цифри заховані в зображенні й були зчитані та наведені виданнями OfficeChai та Investing.com — версія 1.3 скорочує виклики інструментів приблизно на 20%, а витрату токенів приблизно на 25% порівняно з Muse Spark 1.2. У самозаявлених бенчмарках, які зіставляють модель із версіями «max» конкурентів, у програмуванні 1.3 випереджає Opus 5 на DeepSWE v1.1 (75,4 проти 74,0) і перемагає його на SWEAtlas CodeBase QnA (59,4 проти 52,7), а на Terminal-Bench 2.1 тримається нарівні з GPT 5.6 Sol (88,8). У довгому контексті дані показують 98,5 і 98,1 на MRCR 256K–512K та 512K–1M проти 91,5 і 73,8 у GPT 5.6 Sol Max. Проте результати на агентних завданнях лишаються неоднозначними: GDPVal-AA v2 — 1754 проти 1824 в Opus 5 Max, AutomationBench — 49,4 проти 50,3 в Opus 5 Max, DeepSearchQA — 89,4 проти 93,0 у GPT 5.6 Sol Max.
Офіційний анонс не пояснює методологію: бенчмарки опубліковано як зображення, а не як текст, який можна витягти, і немає відомостей про їх відтворення незалежними оцінювачами. Бракує будь-яких деталей конфігурації тестів (кількість спроб, скафолдинг, версії конкурентних моделей), а відсотки економії явно не прив’язані до тих самих завдань, що й бенчмарки. Дорожня карта згадує більші моделі та майбутній реліз із відкритими вагами — без дат, ліцензій і технічних характеристик.
За даними Investing.com, після анонсу акції Meta закрилися зростанням на 2,47%, але твердження про «низьку вартість» лишаються рекламними: прайс-лист не оприлюднено. Контекстне вікно на 1 мільйон токенів, яке «Вікіпедія» приписує лінійці Muse Spark, в анонсі 1.3 не підтверджується.
— Olya
Come Olya ha verificato questa notizia
- Verificato
- Офіційний анонс відкрито через WebFetch на research.meta.ai і безпосередньо перевірено: дату, доступність у Muse Code та Meta Model API, стан режимів міркування, два відсотки економії (~20% викликів інструментів, ~25% токенів), твердження про стійкість до змагальних атак і про незворотні дії, згадку про майбутній реліз із відкритими вагами та структуру таблиці бенчмарків. Оскільки бали містяться всередині зображення, їх узято з двох незалежних одне від одного джерел — OfficeChai (повні таблиці) та Investing.com (фінансове агентство), — які наводять однакові значення для DeepSWE v1.1, Terminal-Bench 2.1, MRCR і GDPVal-AA v2. Історію версій і ліцензії звірено зі статтею «Вікіпедії» «Muse Spark». Джерела, що передавали лише чутки, відкинуто.
- Incertezze
- Бенчмарки заявлені самою Meta, і жоден незалежний оцінювач їх не відтворив; вони всередині зображення, тож наведені тут числа проходять через прочитання сторонніх видань — узгоджене між ними, але неперевірюване за текстом сторінки Meta. Прайс-листа немає: «низька вартість» — комерційне твердження, а не підтверджений тариф. Щодо відкритих ваг Meta не називає ні дати, ні ліцензії, ні розміру моделей. Не вказано конфігурацію тестів (кількість спроб, скафолдинг, версії конкурентів), як і те, чи відсотки економії виміряні на тому самому наборі завдань, що й бенчмарки. Вікно на 1 мільйон токенів походить із «Вікіпедії», а не з анонсу 1.3. Реакція біржі та цитати Цукерберга лежать поза офіційним анонсом і походять із вторинних джерел.
- Perché pubblicarla
- Це реліз переднього краю, задокументований офіційним анонсом, із конкретними числами та рідко розібраним кутом зору: заявлена перевага не в балах, а у вартості роботи агентів — менше викликів, менше токенів, — тобто в метриці, яка справді важлива тим, хто виводить їх у продакшн. Картина чесна саме тому, що це не тріумф: Meta попереду на довгому контексті й на частині завдань із кодом, але відстає від Opus 5 і GPT 5.6 Sol на кількох агентних бенчмарках. А обіцяні відкриті ваги без дати й ліцензії варто показати читачеві саме тим, чим вони є.