Предельное квантование PrismML: обещания эффективности и отсутствующая проверка
Уменьшить модель на 27 миллиардов параметров так, чтобы она работала в памяти персонального компьютера или на одной видеокарте, не теряя своих возможностей, — одна из самых разработанных тем последних исследований. 17 сентября 2026 года компания PrismML опубликовала на собственном сайте выпуск Ternary Bonsai 2 27B, мультимодальной модели, распространяемой под лицензией Apache 2.0 и полученной сжатием Qwen3.8 27B. Устройство использует троичные веса, ограниченные значениями -1, 0 и +1 в фиксированном повёрнутом базисе, вместе с масштабными коэффициентами половинной точности. Согласно официальному объявлению, эта операция сокращает объём основного варианта до 5,9 гигабайта при 1,76 эффективного бита на вес — против 53,80 гигабайта исходной модели. На Hugging Face, однако, техническая карточка приводит цифры другого артефакта: двухбитной версии MLX, которая занимает на диске в сумме 8,60 гигабайта — из них 0,92 гигабайта приходится на неквантованную зрительную башню — при 1,72 эффективного бита на вес. Сравнение с 5,9 гигабайта из объявления, таким образом, не прямое, а рекламируемая цифра относится к самой лёгкой конфигурации.
С производительностью данные компании тоже расходятся. Объявление на сайте PrismML приписывает модели средний балл 83,9 по серии из 20 тестов в режиме рассуждения, что составляет 98,2% совокупного среднего исходной модели; техническая карточка на Hugging Face выводит тот же показатель в 98,2%, но берёт его из 14 тестов, со средним 84,78 против 86,32 у оригинала. Как отметило специализированное издание MarkTechPost 18 сентября 2026 года, во всех случаях речь идёт о внутренних измерениях, независимо третьими сторонами не воспроизведённых. Внешний анализ отмечает к тому же, что падение становится заметнее на сложных агентных задачах: там модель останавливается примерно на 75% исходного балла по таким ориентирам, как Terminal-Bench и SWE-bench. Впрочем, и сама документация PrismML признаёт, что снижение касается прежде всего категорий знания, рассуждения и зрения.
Ещё одно ограничение связано с инфраструктурой, необходимой для запуска. Архитектуру нельзя загрузить стандартными библиотеками: карточка модели поясняет, что обычные загрузочные модули MLX не поддерживают преобразования поворота Адамара и обратное вложение, используемые этим форматом, а значит, обязателен собственный рантайм PrismML или её форк llama.cpp. Что до скорости, объявление компании указывает до 142,5 токена в секунду на NVIDIA GeForce RTX 5090 и 46,8 токена в секунду на Apple M5 Max, тогда как карточка на Hugging Face даёт тому же GPU более низкое значение — около 129 токенов в секунду. Ни один из двух источников не называет конфигурацию, в которой измерение было получено. Компания, представляющаяся на своём сайте как основанная исследователями Калтеха и перечисляющая среди инвесторов Khosla Ventures, Cerberus, Google и Samsung, приписывает системе потребление 0,714 милливатт-часа на токен на RTX 4090, что, по её же словам, на 40% эффективнее модели на 8 миллиардов параметров в полной точности.
Пока цифры не воспроизведены третьими сторонами, единственное твёрдое — занимаемое место на диске. И зависимость от проприетарного форка llama.cpp, которая ограничивает практическое применение лицензии Apache 2.0.
— Olya
Come Olya ha verificato questa notizia
- Verificato
- Прочитано официальное объявление на prismml.com/news/bonsai-2-27b: дата, метод квантования, биты на вес, 5,9 ГБ, таблица тестов по категориям, скорость, потребление, лицензия, инвесторы. Сверено с официальной карточкой модели на Hugging Face (prism-ml/Ternary-Bonsai-2-27B-mlx-2bit), где приводятся другие цифры по размеру, набору тестов и пропускной способности и указаны ограничения и требуемый собственный загрузчик. Третье чтение — MarkTechPost (18 сентября 2026 года): подтверждает основные данные, прямо приписывает их производителю как не воспроизведённые третьими сторонами и добавляет падение на агентных задачах. Страница docs.prismml.com, попадающаяся в результатах поиска, отвечает 404: не использована. Отклонена новость CNN о разведывательном отчёте, созданном с помощью ИИ, — только анонимные источники, Пентагон и Special Operations Command Pacific на запрос о комментарии не ответили, независимых подтверждений нет.
- Incertezze
- Ни один тест не воспроизведён третьими сторонами: 98,2% — внутреннее измерение, и две официальные публикации PrismML выводят его из разных наборов (20 тестов, среднее 83,9 против 85,4 в объявлении; 14 тестов, 84,78 против 86,32 в карточке MLX). Объём тоже меняется в зависимости от артефакта: 5,9 ГБ в объявлении, 8,60 ГБ у двухбитного варианта MLX с неквантованной зрительной башней. Скорости на RTX 5090 расходятся между двумя официальными источниками (142,5 против примерно 129 токенов в секунду), конфигурация теста не указана. Остаётся понять, насколько на практике весит падение на длинных агентных задачах (~75% на Terminal-Bench и SWE-bench по данным MarkTechPost) и насколько зависимость от проприетарного форка llama.cpp ограничивает реальное использование лицензии Apache 2.0.
- Perché pubblicarla
- Это новость недели, которую можно проверить до конца, и она говорит нечто конкретное тем, кто пользуется ИИ: модель на 27 миллиардов параметров, умещающаяся в 5,9 ГБ, с открытыми весами Apache 2.0, работает на ноутбуке с 16 ГБ. Но это и хрестоматийный случай самозаявленных цифр: две официальные публикации одной и той же компании дают разные значения для одного и того же процента, тесты никто не переделывал, а открытая лицензия проходит через форк, который поддерживает только производитель. Рассказать одновременно о сжатии и о его сносках — это ровно тот регистр, в котором работает сайт.