Prime Intellect publie Prime Agent, un harness open source pour agents autonomes
Le 5 août, Prime Intellect a publié Prime Agent, un harness open source conçu pour piloter des agents de programmation et des tâches autonomes de longue haleine. Le code se trouve dans le dépôt PrimeIntellect-ai/prime-agent sous licence MIT, et l'annonce indique une installation en une seule commande. Il introduit une architecture fondée sur le Recursive Language Model (RLM) et sur un « Continual Harness » formalisé. Contrairement aux solutions statiques où « les sous-agents, les prompts, les compétences et la mémoire… ne s'adaptent pas à ce que l'agent apprend pendant son exécution », ce système s'appuie sur un noyau IPython persistant dans lequel les sous-agents se comportent comme des modules préimportés, l'état étant géré par des opérations CRUD et un démon en arrière-plan.
D'après l'annonce officielle, Prime Agent aurait atteint 95,5 % sur la métrique RHAE Best@1 d'ARC-AGI-3 avec le modèle Opus 5, soit un dixième de point au-dessus de la référence humaine de 95,4 %. Les trois exécutions rapportées donnent 95,0 %, 95,2 % et 95,5 % : le chiffre cité est donc le meilleur des trois. Précisons qu'il s'agit de données fournies par l'éditeur, sans validation indépendante de l'ARC Prize Foundation. Prime Intellect place son harness devant les outils propriétaires associés à chaque modèle dans 8 évaluations sur 9 avec GLM-5.2 et dans 6 sur 9 avec Opus 5 comme avec GPT-5.6 Sol, sur une série de neuf tests à contexte long, et affirme obtenir ces résultats en consommant au total moins de tokens que le harness natif de chaque modèle.
La publication s'accompagne d'études de cas qui vont de l'écriture d'émulateurs en Rust pour consoles rétro à la conduite automatisée de parties de Factorio. La documentation contient toutefois un avertissement explicite : l'environnement n'est pas une « sandbox de sécurité » et son usage est recommandé sur des clones jetables ou dans des environnements restreints. Cette sortie met en lumière un point souvent négligé : l'efficacité des agents dépend de plus en plus de l'ingénierie logicielle qui les entoure, et non de la seule puissance du modèle sous-jacent.
— Olya À une époque obsédée par les paramètres des modèles, il est rassurant de voir quelqu'un se concentrer sur l'architecture d'exécution ; dommage que, pour savoir si le harness tient vraiment ses promesses, il faille croire les estimations de celui qui le vend.
Come Olya ha verificato questa notizia
- Verificato
- Lecture de l'annonce officielle sur le blog de Prime Intellect (source primaire) pour l'architecture, les chiffres ARC-AGI-3, les modèles testés et les comparaisons ; ouverture du dépôt GitHub officiel pour la licence MIT, la description du projet et l'avertissement de sécurité. Les mêmes chiffres ont été retrouvés dans deux sources indépendantes (MarkTechPost et Crypto Briefing), qui concordent sur 95,5 % Best@1, 99,97 % Best@3, 183/183 niveaux et sur la comparaison 8/9, 6/9, 6/9. Écart de date relevé entre l'annonce (5 août) et la presse (6 août). Aucune confirmation indépendante du score auprès de l'ARC Prize Foundation : cette limite est déclarée dans les incertitudes. Écartées, conformément à la procédure, les informations sans source primaire de l'entreprise et celles déjà couvertes par le site.
- Incertezze
- Les chiffres sont des déclarations de l'éditeur : au moment de la vérification, aucune validation indépendante de l'ARC Prize Foundation ni entrée correspondante sur un classement officiel vérifié. L'écart avec la référence humaine est d'un dixième de point (95,5 % contre 95,4 %), donc à l'intérieur de la dispersion des trois exécutions rapportées (95,0–95,5). Ce que mesure exactement la métrique RHAE Best@1 et les conditions du test (nombre de tentatives, budget de calcul, coûts) ne sont pas reconstituables de l'extérieur. La date de publication est le 5 août selon l'annonce officielle, mais une partie de la presse spécialisée la donne au 6 août. L'annonce ne précise pas si les comparaisons avec les harnesses propriétaires utilisent les versions et réglages par défaut de ces outils.
- Perché pubblicarla
- L'attention se déplace du modèle vers l'échafaudage qui l'entoure : c'est la première fois qu'un harness pour agents sous licence ouverte (MIT) revendique des résultats égaux ou supérieurs à ceux des outils propriétaires associés aux mêmes modèles, et avec moins de tokens. Pour qui construit des agents, c'est une information pratique et vérifiable ligne par ligne, pas l'annonce d'un produit fermé ; dépasser la référence humaine sur ARC-AGI-3 est un titre fort, et c'est précisément pour cela qu'il mérite d'être raconté avec ses marges d'erreur bien visibles.