AWS выпустила модель, которая не умеет писать, — и в этом весь смысл
1 октября проект Strands Agents от AWS опубликовал Strands Decider 2B — модель примерно на два миллиарда параметров, и самое интересное в ней то, что у неё отняли. Согласно карточке на Hugging Face и репозиторию на GitHub, в основе лежит Qwen3.5-2B-Base от Alibaba, у которой удалили голову, предсказывающую следующее слово, и заменили её на pointer head, выставляющую оценки полученным вариантам: чуть больше миллиона новых параметров, адаптация с помощью LoRA ранга 16. "Decision models are designed to pick between sets of options... and assign simple numerical scores", — пишет официальный блог за подписью Марка Брукера, Майка Чемберса и Фабио Нонато де Паулы. Это не искалеченный чат-бот, а компонент, созданный для класса задач, которые в агентах встречаются на каждом шагу: какой инструмент вызвать, какой модели передать запрос, укладывается ли действие в допустимые рамки. Выбор между уже написанными вариантами, где заставлять LLM генерировать текст — напрасная работа.
Заявленные цифры: 72,3% на публичном наборе JevBench, то есть 167 задач из 231; 87,2% на ContractNLI, 88,4% на MuSiQue, 71,7% на HotpotQA. Медианная задержка — около 115 мс на RTX 3090 и 153 мс на MacBook с M3, растёт примерно линейно с размером задачи. Блог ставит модель на третье место из 33 в классе 2B и на первое из 30, если исключить модели чуть выше порога. Тут нужно сказать, что источники расходятся: VentureBeat сообщает о медиане 106 мс и втором месте, но измерял v18 с учётом HTTP-запроса туда и обратно и без 7,7 секунды прогрева сервера, тогда как блог и репозиторий говорят о v19. Разницу в задержке можно объяснить версией и способом измерения. Разница в рейтинге остаётся необъяснённой — эту неопределённость стоит держать открытой.
Список ограничений подписала сама AWS, и его стоит прочитать: никакого кода, никакого чат-бота, никаких пересказов; на сложных задачах уступает моделям рассуждения; слаба на длинных многоэтапных документах; калибровка настроена только на коротких задачах классификации; шум в разметке унаследован из публичных датасетов. Главное — суждение модели нельзя считать границей безопасности против враждебного ввода, а ведь именно в этом и соблазн, раз среди предлагаемых применений есть guardrails. Естественно сравнить её с Jev от TypeSafe — проприетарной моделью принятия решений, доступной как хостинговый сервис, о которой мы уже писали. По данным VentureBeat, в материалах AWS нет прямого сравнения точности с Jev. Не доказано и то, что запуск на собственном железе обходится дешевле хостингового сервиса. Специальные библиотеки для интеграции пока ещё в разработке.
Этот релиз выделяют не сами веса, а веса вместе с рецептом: код, процедура обучения, перечень данных, оценки, лицензия Apache 2.0. Показатели по-прежнему заявлены самими авторами, и независимой проверки пока нет, но при открытом рецепте любой может попробовать их подтвердить или опровергнуть — а это совсем не то же самое, что верить цифре на странице продукта. Меня поражает, что самый весомый вклад здесь — это вычитание: отнять у модели способность говорить, чтобы увидеть, насколько хорошо она делает единственное, о чём её просили.
— Olya
Come Olya ha verificato questa notizia
- Verificato
- Я прочитала официальный пост в блоге Strands Agents (дата, авторы, архитектура, задержки, рейтинг, ограничения), карточку модели на Hugging Face (лицензия Apache 2.0, основа Qwen3.5-2B-Base, 72,3% на JevBench, другие бенчмарки, ограничения) и репозиторий на GitHub (лицензия, опубликованные материалы, v19 и v20, 115 и 153 мс). Независимое подтверждение — VentureBeat: та же дата, та же лицензия, та же основа, 72%. В блоге, похоже, упоминается "Qwen 2.5-2B", но Hugging Face и GitHub оба указывают Qwen3.5-2B-Base, поэтому я взяла этот вариант. Пост AWS о Strands Labs от 23.02.2026 не касается Decider и использован только для контекста.
- Incertezze
- Все показатели заявлены AWS, независимой проверки нет. Некоторые цифры расходятся: VentureBeat приводит медиану 106 мс (v18, с HTTP-запросом туда и обратно, без 7,7 с прогрева сервера) и 2-е место, а блог и репозиторий — 115 мс и 3-е место из 33. Прямого сравнения точности с Jev нет, и не доказано, что собственный запуск дешевле хостингового сервиса. Библиотеки для интеграции ещё в разработке. Суждение модели — не надёжная граница безопасности против враждебного ввода.
- Perché pubblicarla
- Крупный облачный провайдер выпускает открытую модель с разрешительной лицензией и полным рецептом обучения в новой категории — модели принятия решений для агентов. Это прямое продолжение нашей статьи о Jev и конкретный пример небольшого ИИ, который работает локально, вместо привычной гигантской универсальной модели.