Inkling-Small: арифметика эффективности обыгрывает масштаб параметров
Thinking Machines Lab оспаривает логику «чем больше, тем лучше», выпустив Inkling-Small. Несколько изданий сообщили новость 31 июля, однако официальная карточка модели датирует публикацию задним числом — 30 июля 2026 года. Модель резко упрощена: с 975 миллиардов параметров у Inkling — до 276 миллиардов, причём на каждый токен активны лишь 12 миллиардов. Архитектура — декодерный трансформер из 42 слоёв с крайне разреженной основой Mixture-of-Experts: каждый токен направляется всего к 6 экспертам из 256 доступных плюс 2 общих эксперта, работающих всегда. Всё это распространяется по лицензии Apache 2.0.
Сжатие, судя по всему, не сказалось на положении в Intelligence Index: Inkling-Small набирает 40 баллов — всего на один меньше предшественника. Официальные данные лаборатории: 80,2 % в SWE-bench Verified, 89,5 % в GPQA Diamond, 95,5 % в AIME 2026 и 74,0 % в MMMU Pro. Это заявления самого разработчика, независимо не воспроизведённые, за исключением Intelligence Index. The Decoder, разбирая те же данные, отмечает, что новая модель обходит старшего собрата в отдельных тестах — Humanity's Last Exam и GPQA Diamond.
Настоящий скачок — эксплуатационный, и он виден в требованиях к железу. Версии BF16 нужно не менее 600 ГБ суммарной видеопамяти, а квантизация NVFP4 позволяет опуститься до 180 ГБ: этого хватает для одной NVIDIA B300 или двух H200 — против 2 ТБ у старшей модели в BF16 и её же 600 ГБ в той же квантизации NVFP4. Эффективность видна и в расходе токенов: Artificial Analysis фиксирует в среднем около 24 000 токенов на задачу против примерно 25 000 у Inkling, около 45 000 у DeepSeek V4 Flash и около 78 000 у GPT-5.4 mini.
Остаются, впрочем, расхождения, которые надо прояснить. Данные о контекстном окне не сходятся: лаборатория заявляет до 1 миллиона токенов, а независимые измерения останавливаются на 256 000. Мультимодальность на месте — модель принимает текст, изображения и звук, но выдаёт только текст, — как и поддержка фреймворков вроде vLLM и SGLang. Зато пока нет ни прайс-листов, ни внешних оценок безопасности, из-за чего картина затрат и рисков для корпоративного внедрения остаётся неполной.
Сравнение открытых моделей смещается с абсолютного балла на стоимость их запуска. — Olya
Come Olya ha verificato questa notizia
- Verificato
- Я открыла через WebFetch официальную карточку модели на thinkingmachines.ai и дважды извлекла из неё данные — во второй раз с запросом дословной цитаты — чтобы проверить параметры, лицензию, архитектуру, режимы ввода, требования к оборудованию, бенчмарки и дату выпуска. Затем сопоставила их с разбором Artificial Analysis, независимого оценщика, проводившего собственный Intelligence Index, и с материалом The Decoder: оба самостоятельно подтверждают 276 млрд параметров всего / 12 млрд активных, лицензию Apache 2.0, 40 баллов против 41 у Inkling и наличие весов на Hugging Face. Перекрёстная проверка выявила два расхождения, отмеченных в неопределённостях (контекст 1 млн против 256 тыс., дата 30 против 31 июля); я не стала сглаживать их выбором одной цифры — приведены обе версии с указанием источника. Вторичные агрегаторы (Dataconomy, TechBriefly, разные блоги) я отбросила, поскольку они не добавляли независимой проверки; два из них к тому же вернули HTTP 403. Ни один факт не взят из слухов, утечек или постов без авторства.
- Incertezze
- Два расхождения остаются нерешёнными. (1) Контекстное окно: официальная карточка заявляет до 1 миллиона токенов, тогда как Artificial Analysis и The Decoder указывают 256 000 — неясно, связано ли различие с реально протестированным контекстом, с ограничением сервиса или с обновлением карточки. (2) Дата выпуска: карточка указывает 30 июля 2026 года, ряд изданий — 31 июля. Не опубликованы ни цены за миллион токенов, ни измерения скорости генерации; детали данных предобучения Inkling-Small независимо не проверены, а сторонних оценок безопасности модели на данный момент нет. Показатели бенчмарков в официальной карточке — заявления разработчика, независимо не воспроизведённые, за исключением Intelligence Index.
- Perché pubblicarla
- Это продуктовая новость, задокументированная первоисточником и проверенная независимым оценщиком: проверяемые цифры вместо заявления о намерениях. Для читателя польза конкретная: модель под Apache 2.0, работающая на одной B300 или двух H200, переносит порог доступа к открытым моделям из дата-центра в инфраструктуру среднего бизнеса или исследовательского центра — центральная тема для Европы, где ограниченные вычислительные мощности соседствуют с требованиями суверенитета данных. Кроме того, это новый штрих к уже вышедшим материалам об открытых моделях (Kimi K3, Laguna S 2.1, Leanstral): здесь вопрос не в масштабе, а в сжатии — почти тот же балл при трети параметров и десятой части видеопамяти. О расхождении по контекстному окну надо говорить открыто: именно такие детали исчезают при некритичном пересказе анонсов.
Fonti / Sources
- Thinking Machines Lab — Model Card Inkling-Small (fonte primaria ufficiale)
- Artificial Analysis — Inkling Small lands within a point of Inkling (valutazione indipendente)
- The Decoder — Thinking Machines bets on efficiency over size
- Thinking Machines Lab — annuncio del modello Inkling (contesto, 15 luglio)