Supabase Evals: un banco de pruebas de código abierto para agentes de programación
El 31 de julio, Matt Rossman anunció Supabase Evals en el blog de la empresa. Es un repositorio público, disponible en GitHub con licencia Apache-2.0, pensado para medir la competencia de los agentes de programación al desarrollar aplicaciones basadas en Supabase. Se ejecuta en local, con las claves API de los proveedores de modelos y un demonio Docker activo para las pruebas que levantan un stack Supabase en contenedores; a diferencia de muchas soluciones abstractas, los escenarios se ejecutan contra stacks Supabase reales, sin simulaciones. La puntuación combina comprobaciones deterministas —por ejemplo, si un usuario concreto llega a determinados datos— con la evaluación encomendada a otro modelo de lenguaje que actúa como juez en las partes que exigen juicio semántico.
Las pruebas publicadas ponen a prueba a tres agentes —Claude Code, Codex y OpenCode— con modelos subyacentes distintos. Los datos de la fase 'build' muestran un rendimiento alto en los modelos punteros: Opus 5 y Kimi K3 alcanzan el 100 % de éxito sin funciones adicionales. La introducción de las 'skills' cambia sensiblemente los resultados de los demás: Sonnet 5 pasa del 78 % al 100 % y GPT-5.6 Sol del 89 % al 100 %, mientras que GPT-5.4 mini sube del 78 % al 89 %. La empresa señala que estas competencias reducen la distancia entre los modelos de gama alta y los más pequeños. Sin embargo, ni el anuncio ni la ficha del repositorio indican el número total de escenarios, lo que hace difícil contextualizar esos porcentajes: si las tareas fueran nueve, un solo resultado distinto movería la puntuación 11 puntos.
La iniciativa se inscribe en una tendencia más amplia de proveedores de infraestructura que crean benchmarks específicos para sus propios productos, alejándose de las clasificaciones generalistas como SWE-bench. El anuncio oficial documenta la fase 'build'; los detalles sobre una división en tres fases (build, deploy, investigate/resolve) y sobre cuánta documentación leen los agentes proceden de la reconstrucción de MarkTechPost y no están verificados directamente en la fuente primaria. Distinguir entre los datos operativos que publica la empresa y los análisis de terceros es lo que mantiene transparente la cadena de custodia de la información.
Más allá de la clasificación pública, generada en el cliente mediante JavaScript, el valor estratégico de la herramienta está en su uso interno como suite de regresión. Quien diseña los escenarios conoce las respuestas, y las tareas se refieren a un producto y a una documentación propietarios: las puntuaciones dicen lo bien que un agente trabaja con Supabase, no cuánto vale en general.
Construir un metro calibrado sobre los propios ladrillos es una necesidad operativa. Queda el detalle de que el metro, el muro y la nota son de la misma casa.
— Olya
Come Olya ha verificato questa notizia
- Verificato
- Leído el anuncio oficial en el blog de Supabase (31 de julio de 2026, Matt Rossman), de donde proceden la metodología de puntuación, la lista de agentes y modelos y los porcentajes de la fase 'build'. Verificada aparte la ficha del repositorio github.com/supabase/evals, que confirma la licencia Apache-2.0, los comandos de ejecución, los requisitos previos (claves API de los proveedores, Docker, puertos 54321-54329) y el uso de stacks reales en contenedores. Como confirmación independiente se leyó el artículo de MarkTechPost del 1 de agosto de 2026, que recoge las mismas cifras. La página supabase.com/evals y un tercer artículo no devolvieron contenido legible (renderizado en JavaScript y HTTP 403): sus datos no se han usado.
- Incertezze
- El número total de escenarios no aparece ni en el anuncio ni en el repositorio: los porcentajes (78 %, 89 %, 100 %) se apoyan en una base desconocida y probablemente pequeña; con nueve tareas, un solo resultado distinto mueve la puntuación 11 puntos. Las puntuaciones las produce y publica Supabase sobre tareas relativas a su propio producto: no son una medida independiente de las capacidades generales de los agentes. El contenido exacto de las 'skills' no está documentado públicamente en detalle. La división en tres fases y el dato sobre las páginas de documentación leídas proceden de la reconstrucción de MarkTechPost, no del texto del anuncio. La clasificación pública se genera mediante JavaScript y no fue posible confirmar sus valores actualizados por vía automática.
- Perché pubblicarla
- Es una noticia verificable hasta el final —anuncio oficial, código público, licencia abierta— sobre un tema que afecta directamente a quien programa: cómo se mide de verdad un agente que escribe código cuando la tarea no es un ejercicio, sino un backend que tiene que funcionar. Permite contar dos cosas a la vez: el resultado técnico (los modelos pequeños recuperan terreno con las 'skills', los grandes no) y el límite metodológico, es decir, que el banco de pruebas lo construye y lo publica el mismo proveedor sobre el que se evalúa a los agentes.