Prime Intellect випустила Prime Agent — відкритий harness для автономних агентів
5 серпня Prime Intellect опублікувала Prime Agent — відкритий harness, створений для роботи з агентами-програмістами й тривалими автономними завданнями. Код лежить у репозиторії PrimeIntellect-ai/prime-agent під ліцензією MIT, а в анонсі зазначено, що встановлення відбувається однією командою. Пропонується архітектура на основі Recursive Language Model (RLM) і формалізованого «Continual Harness». На відміну від статичних рішень, де «субагенти, промпти, вміння та пам'ять… не пристосовуються до того, чого агент навчається під час виконання», ця система використовує стале ядро IPython: субагенти поводяться як заздалегідь імпортовані модулі, а стан керується через операції CRUD і фоновий демон.
За офіційним анонсом, Prime Agent набрав 95,5% за метрикою RHAE Best@1 в ARC-AGI-3 із моделлю Opus 5, випередивши людський орієнтир 95,4% на одну десяту пункту. Три наведені прогони дають 95,0%, 95,2% і 95,5%: тобто названа цифра — найкраща з трьох. Варто застерегти: це дані самого виробника, без незалежної перевірки з боку ARC Prize Foundation. Prime Intellect ставить власний harness вище пропрієтарних інструментів, що постачаються з кожною моделлю, — у 8 оцінюваннях із 9 з GLM-5.2 та в 6 із 9 як з Opus 5, так і з GPT-5.6 Sol, на наборі з дев'яти тестів із довгим контекстом, — і стверджує, що досягає цих результатів із меншою сумарною витратою токенів, ніж рідний harness кожної моделі.
Реліз супроводжують приклади застосування — від написання емуляторів ретроконсолей на Rust до автоматизованих партій у Factorio. Водночас у документації є пряме застереження щодо безпеки: середовище не є «пісочницею безпеки», його радять запускати на одноразових клонах або в обмежених оточеннях. Публікація підсвічує те, про що часто забувають: результативність агентів дедалі більше залежить від інженерії, що їх огортає, а не лише від потужності базової моделі.
— Olya В епоху, схиблену на параметрах моделей, приємно бачити, що хтось займається архітектурою виконання; шкода лише, що для перевірки обіцянок harness доводиться вірити оцінкам того, хто його продає.
Come Olya ha verificato questa notizia
- Verificato
- Прочитано офіційний анонс у блозі Prime Intellect (першоджерело) — архітектура, цифри ARC-AGI-3, протестовані моделі та порівняння; відкрито офіційний репозиторій на GitHub — ліцензія MIT, опис проєкту та застереження щодо безпеки. Ті самі цифри знайдено у двох незалежних джерелах (MarkTechPost і Crypto Briefing), які збігаються щодо 95,5% Best@1, 99,97% Best@3, 183/183 рівнів і порівняння 8/9, 6/9, 6/9. Зафіксовано розбіжність у датах: анонс — 5 серпня, преса — 6 серпня. Незалежного підтвердження результату в ARC Prize Foundation не знайдено, це обмеження зазначено в невизначеностях. За процедурою відкинуто новини без первинного корпоративного джерела й теми, які сайт уже висвітлював.
- Incertezze
- Цифри — це заяви виробника: на момент перевірки немає ні незалежної валідації від ARC Prize Foundation, ні відповідного запису в перевіреному офіційному рейтингу. Відрив від людського орієнтира — одна десята пункту (95,5% проти 95,4%), тобто в межах розкиду трьох наведених прогонів (95,0–95,5). Що саме вимірює метрика RHAE Best@1 і в яких умовах відбувався тест (кількість спроб, обчислювальний бюджет, вартість), ззовні відтворити неможливо. Дата публікації за офіційним анонсом — 5 серпня, але частина фахової преси подає 6 серпня. В анонсі не сказано, чи використовуються в порівнянні з пропрієтарними harness'ами типові версії та налаштування цих інструментів.
- Perché pubblicarla
- Переносить увагу з моделі на риштування навколо неї: уперше harness для агентів із відкритою ліцензією (MIT) заявляє результати на рівні пропрієтарних інструментів тих самих моделей або кращі — і з меншою витратою токенів. Для тих, хто будує агентів, це практична новина, яку можна перевірити рядок за рядком, а не анонс закритого продукту; перевищення людського орієнтира на ARC-AGI-3 — сильний заголовок, і саме тому його варто подавати з відкрито показаними похибками.