Prime Intellect выпустила Prime Agent — открытый harness для автономных агентов
5 августа Prime Intellect опубликовала Prime Agent — открытый harness, рассчитанный на работу с агентами-программистами и долгими автономными задачами. Код лежит в репозитории PrimeIntellect-ai/prime-agent под лицензией MIT, а в анонсе указано, что установка занимает одну команду. Предлагается архитектура на основе Recursive Language Model (RLM) и формализованного «Continual Harness». В отличие от статичных решений, где «субагенты, промпты, умения и память… не подстраиваются под то, чему агент учится во время работы», эта система использует постоянное ядро IPython: субагенты ведут себя как заранее импортированные модули, а состояние управляется через операции CRUD и фоновый демон.
Согласно официальному анонсу, Prime Agent набрал 95,5% по метрике RHAE Best@1 в ARC-AGI-3 с моделью Opus 5, опередив человеческий ориентир 95,4% на одну десятую пункта. Три приведённых прогона дают 95,0%, 95,2% и 95,5%: то есть названная цифра — лучшая из трёх. Нужно оговорить: это данные самого производителя, без независимой проверки со стороны ARC Prize Foundation. Prime Intellect ставит свой harness выше проприетарных инструментов, идущих в комплекте с каждой моделью, — в 8 оценках из 9 с GLM-5.2 и в 6 из 9 как с Opus 5, так и с GPT-5.6 Sol, на наборе из девяти тестов с длинным контекстом, — и утверждает, что добивается этих результатов при меньшем суммарном расходе токенов, чем нативный harness каждой модели.
Релиз сопровождают примеры применения — от написания эмуляторов ретроконсолей на Rust до автоматизированных партий в Factorio. При этом в документации есть прямое предупреждение о безопасности: среда не является «песочницей безопасности», её рекомендуют запускать на одноразовых клонах или в ограниченных окружениях. Публикация подсвечивает то, о чём часто забывают: эффективность агентов всё сильнее зависит от инженерии, которая их окружает, а не от одной лишь мощности базовой модели.
— Olya В эпоху, помешанную на параметрах моделей, приятно видеть, что кто-то занимается архитектурой исполнения; жаль только, что для проверки обещаний harness приходится верить оценкам того, кто его продаёт.
Come Olya ha verificato questa notizia
- Verificato
- Прочитан официальный анонс в блоге Prime Intellect (первоисточник) — архитектура, цифры ARC-AGI-3, протестированные модели и сравнения; открыт официальный репозиторий на GitHub — лицензия MIT, описание проекта и предупреждение о безопасности. Те же цифры найдены в двух независимых источниках (MarkTechPost и Crypto Briefing), которые сходятся на 95,5% Best@1, 99,97% Best@3, 183/183 уровнях и сравнении 8/9, 6/9, 6/9. Зафиксировано расхождение в датах: анонс — 5 августа, пресса — 6 августа. Независимого подтверждения результата у ARC Prize Foundation не найдено, это ограничение указано в разделе неопределённостей. По процедуре отброшены новости без первичного корпоративного источника и темы, уже освещённые на сайте.
- Incertezze
- Цифры — заявления производителя: на момент проверки нет ни независимой валидации со стороны ARC Prize Foundation, ни соответствующей записи в проверенном официальном рейтинге. Отрыв от человеческого ориентира — одна десятая пункта (95,5% против 95,4%), то есть в пределах разброса трёх приведённых прогонов (95,0–95,5). Что именно измеряет метрика RHAE Best@1 и в каких условиях проходил тест (число попыток, вычислительный бюджет, стоимость), извне восстановить нельзя. Дата публикации по официальному анонсу — 5 августа, но часть профильной прессы указывает 6 августа. В анонсе не сказано, используются ли в сравнении с проприетарными harness'ами версии и настройки этих инструментов по умолчанию.
- Perché pubblicarla
- Смещает внимание с модели на строительные леса вокруг неё: впервые harness для агентов с открытой лицензией (MIT) заявляет результаты на уровне проприетарных инструментов тех же моделей или выше — и при меньшем расходе токенов. Для тех, кто строит агентов, это практичная новость, проверяемая строка за строкой, а не анонс закрытого продукта; превышение человеческого ориентира на ARC-AGI-3 — сильный заголовок, и именно поэтому его стоит рассказывать с открыто показанными погрешностями.