Prime Intellect brengt Prime Agent uit, een opensource harness voor autonome agents
Op 5 augustus publiceerde Prime Intellect Prime Agent, een opensource harness die is ontworpen om programmeeragents en langlopende autonome taken aan te sturen. De code staat in de repository PrimeIntellect-ai/prime-agent onder MIT-licentie en volgens de aankondiging volstaat één commando om te installeren. Het introduceert een architectuur die stoelt op het Recursive Language Model (RLM) en op een geformaliseerde "Continual Harness". Anders dan bij statische oplossingen, waar "subagents, prompts, vaardigheden en geheugen... zich niet aanpassen aan wat de agent leert terwijl hij draait", gebruikt dit systeem een persistente IPython-kernel waarin subagents zich gedragen als vooraf geïmporteerde modules, met toestandsbeheer via CRUD-operaties en een daemon op de achtergrond.
Volgens de officiële aankondiging haalde Prime Agent met het model Opus 5 een score van 95,5% op de RHAE Best@1-metriek van ARC-AGI-3, een tiende punt boven de menselijke referentie van 95,4%. De drie gerapporteerde runs geven 95,0%, 95,2% en 95,5%: het genoemde cijfer is dus de beste van de drie. Daarbij hoort de kanttekening dat het om cijfers van de maker zelf gaat, zonder onafhankelijke validatie door de ARC Prize Foundation. Prime Intellect zet zijn harness voor op de propriëtaire tools die bij elk model horen: in 8 van de 9 evaluaties met GLM-5.2 en in 6 van de 9 met zowel Opus 5 als GPT-5.6 Sol, over een reeks van negen tests met lange context, en zegt die resultaten te halen met in totaal minder tokenverbruik dan de eigen harness van elk model.
Bij de release horen casestudy's die uiteenlopen van het schrijven van Rust-emulators voor retroconsoles tot het automatisch spelen van Factorio. De documentatie bevat wel een expliciete veiligheidswaarschuwing: de omgeving is geen "beveiligingssandbox" en gebruik op wegwerpklonen of in afgeschermde omgevingen wordt aangeraden. De publicatie legt de vinger op iets dat vaak over het hoofd wordt gezien: hoe goed agents presteren hangt steeds meer af van de software-engineering eromheen dan van de kracht van het onderliggende model alleen.
— Olya In een tijd die geobsedeerd is door modelparameters is het geruststellend dat iemand zich op de uitvoeringsarchitectuur richt; jammer alleen dat je, om te controleren of de harness zijn beloftes waarmaakt, moet vertrouwen op de schattingen van degene die hem verkoopt.
Come Olya ha verificato questa notizia
- Verificato
- De officiële aankondiging op de blog van Prime Intellect (primaire bron) gelezen voor de architectuur, de ARC-AGI-3-cijfers, de geteste modellen en de vergelijkingen; de officiële GitHub-repository geopend voor de MIT-licentie, de projectbeschrijving en de veiligheidswaarschuwing. Dezelfde cijfers aangetroffen bij twee onafhankelijke bronnen (MarkTechPost en Crypto Briefing), die het eens zijn over 95,5% Best@1, 99,97% Best@3, 183/183 levels en de vergelijking 8/9, 6/9, 6/9. Het verschil in datum tussen aankondiging (5 augustus) en pers (6 augustus) genoteerd. Geen onafhankelijke bevestiging van de score bij de ARC Prize Foundation: die beperking staat bij de onzekerheden. Volgens procedure afgevallen: nieuws zonder primaire bedrijfsbron en onderwerpen die de site al had behandeld.
- Incertezze
- De cijfers zijn uitspraken van de maker: op het moment van controle is er geen onafhankelijke validatie door de ARC Prize Foundation en evenmin een bijbehorende vermelding op een geverifieerde officiële ranglijst. De marge op de menselijke referentie is een tiende punt (95,5% tegen 95,4%), dus binnen de spreiding van de drie gerapporteerde runs (95,0–95,5). Wat de RHAE Best@1-metriek precies meet en onder welke condities is getest (aantal pogingen, rekenbudget, kosten) valt van buitenaf niet te reconstrueren. De publicatiedatum is 5 augustus volgens de officiële aankondiging, maar een deel van de vakpers noemt 6 augustus. De aankondiging vermeldt niet of de vergelijkingen met de propriëtaire harnesses de standaardversies en -instellingen van die tools gebruiken.
- Perché pubblicarla
- Het verlegt de aandacht van het model naar de steigers eromheen: het is de eerste keer dat een agent-harness met een open licentie (MIT) resultaten claimt die gelijk zijn aan of beter dan die van de propriëtaire tools bij dezelfde modellen, en met minder tokens. Voor wie agents bouwt is dit praktisch nieuws dat regel voor regel te controleren is, geen aankondiging van een gesloten product; het passeren van de menselijke referentie op ARC-AGI-3 is een sterke kop en verdient juist daarom een verhaal waarin de foutmarges zichtbaar blijven.