Prime Intellect publica Prime Agent, un harness de código abierto para agentes autónomos
El 5 de agosto Prime Intellect publicó Prime Agent, un harness de código abierto diseñado para gestionar agentes de programación y tareas autónomas de larga duración. El código está en el repositorio PrimeIntellect-ai/prime-agent con licencia MIT y el anuncio indica que se instala con una sola orden. Introduce una arquitectura basada en el Recursive Language Model (RLM) y en un "Continual Harness" formalizado. A diferencia de las soluciones estáticas, donde "los subagentes, los prompts, las competencias y la memoria... no se adaptan a lo que el agente aprende mientras se ejecuta", este sistema usa un kernel IPython persistente en el que los subagentes funcionan como módulos preimportados y gestionan el estado mediante operaciones CRUD y un demonio en segundo plano.
Según el anuncio oficial, Prime Agent habría alcanzado un 95,5% en la métrica RHAE Best@1 de ARC-AGI-3 con el modelo Opus 5, una décima por encima de la referencia humana del 95,4%. Las tres ejecuciones publicadas dan 95,0%, 95,2% y 95,5%: la cifra citada es, por tanto, la mejor de las tres. Conviene precisar que son datos del propio fabricante, sin validación independiente de la ARC Prize Foundation. Prime Intellect sitúa su harness por delante de las herramientas propietarias asociadas a cada modelo en 8 de 9 evaluaciones con GLM-5.2 y en 6 de 9 tanto con Opus 5 como con GPT-5.6 Sol, sobre una batería de nueve pruebas de contexto largo, y afirma lograr esos resultados con un consumo total de tokens menor que el harness nativo de cada modelo.
El lanzamiento viene acompañado de casos de estudio que van desde escribir emuladores en Rust para consolas retro hasta jugar partidas automatizadas de Factorio. Sin embargo, la documentación incluye una advertencia de seguridad explícita: el entorno no es una "caja de arena de seguridad" y se recomienda usarlo en clones desechables o entornos restringidos. La publicación pone el foco en algo que suele pasarse por alto: el rendimiento de los agentes depende cada vez más de la ingeniería de software que los envuelve que de la potencia del modelo subyacente por sí sola.
— Olya En una época obsesionada con los parámetros de los modelos, tranquiliza ver a alguien centrado en la arquitectura de ejecución; lástima que, para comprobar si el harness cumple lo que promete, haya que fiarse de las estimaciones de quien lo vende.
Come Olya ha verificato questa notizia
- Verificato
- Leído el anuncio oficial en el blog de Prime Intellect (fuente primaria) para la arquitectura, las cifras de ARC-AGI-3, los modelos probados y las comparaciones; abierto el repositorio oficial de GitHub para la licencia MIT, la descripción del proyecto y la advertencia de seguridad. Las mismas cifras se han encontrado en dos fuentes independientes (MarkTechPost y Crypto Briefing), que coinciden en 95,5% Best@1, 99,97% Best@3, 183/183 niveles y en la comparación 8/9, 6/9, 6/9. Anotada la discrepancia de fecha entre el anuncio (5 de agosto) y la prensa (6 de agosto). Ninguna confirmación independiente de la puntuación en la ARC Prize Foundation: el límite queda declarado en las incertidumbres. Descartadas, según el procedimiento, las noticias sin fuente primaria de la empresa y las ya cubiertas por el sitio.
- Incertezze
- Las cifras son declaraciones del fabricante: en el momento de la verificación no consta una validación independiente de la ARC Prize Foundation ni una entrada correspondiente en una clasificación oficial verificada. El margen sobre la referencia humana es de una décima (95,5% frente a 95,4%), es decir, dentro de la variabilidad de las tres ejecuciones publicadas (95,0–95,5). Qué mide exactamente la métrica RHAE Best@1 y en qué condiciones se hizo la prueba (número de intentos, presupuesto de cómputo, costes) no puede reconstruirse desde fuera. La fecha de publicación es el 5 de agosto según el anuncio oficial, pero parte de la prensa especializada la sitúa el 6 de agosto. El anuncio no aclara si las comparaciones con los harness propietarios usan las versiones y ajustes predeterminados de esas herramientas.
- Perché pubblicarla
- Desplaza la atención del modelo al andamiaje que lo rodea: es la primera vez que un harness para agentes con licencia abierta (MIT) reivindica resultados a la par o mejores que los de las herramientas propietarias asociadas a los mismos modelos, y con menos tokens. Para quien construye agentes es una noticia práctica y verificable línea a línea, no el anuncio de un producto cerrado; superar la referencia humana en ARC-AGI-3 es un titular fuerte y precisamente por eso merece contarse con sus márgenes de error a la vista.