AWS publica un modelo que no sabe escribir, y esa es la cuestión
El 1 de octubre, el proyecto Strands Agents de AWS publicó Strands Decider 2B, un modelo de unos dos mil millones de parámetros, y lo más interesante es lo que le han quitado. Según la ficha en Hugging Face y el repositorio de GitHub, parte de Qwen3.5-2B-Base de Alibaba, al que se le ha extirpado la cabeza que predice la siguiente palabra para sustituirla por una pointer head que puntúa las opciones recibidas: poco más de un millón de parámetros nuevos, con adaptación mediante un LoRA de rango 16. "Decision models are designed to pick between sets of options... and assign simple numerical scores", escribe el blog oficial firmado por Marc Brooker, Mike Chambers y Fabio Nonato de Paula. No es un chatbot mutilado: es un componente diseñado para un tipo de tarea que en los agentes está por todas partes: qué herramienta llamar, a qué modelo pasar una petición, si una acción se mantiene dentro de los límites. Elecciones entre alternativas ya escritas, donde poner a un LLM a generar texto es trabajo desperdiciado.
Las cifras declaradas: 72,3 % en el conjunto público de JevBench, es decir, 167 tareas de 231; 87,2 % en ContractNLI, 88,4 % en MuSiQue, 71,7 % en HotpotQA. Latencia mediana de unos 115 ms en una RTX 3090 y 153 ms en un MacBook con M3, con un crecimiento aproximadamente lineal respecto al tamaño de la tarea. El blog sitúa el modelo tercero de 33 en la clase 2B, primero de 30 si se excluyen los modelos que superan por poco el umbral. Aquí hay que decir que las fuentes no cuadran: VentureBeat da 106 ms de mediana y un segundo puesto, pero midiendo la v18 con el viaje de ida y vuelta HTTP incluido y descartando 7,7 segundos de calentamiento del servidor, mientras que el blog y el repositorio hablan de la v19. La diferencia de latencia puede deberse a la versión y al método de medición. La de la clasificación sigue sin explicación: es una incertidumbre que conviene dejar abierta.
La lista de limitaciones la firma la propia AWS, y merece la pena leerla: nada de código, nada de chatbot, nada de resúmenes; menos capaz que los modelos de razonamiento en problemas complejos; flojo con documentos largos y de varios pasos; calibración ajustada solo para tareas de clasificación cortas; ruido en las etiquetas heredado de los conjuntos de datos públicos. Sobre todo, el juicio del modelo no debe tratarse como una frontera de seguridad frente a entradas hostiles — que es justo la tentación, ya que entre los usos sugeridos figuran los guardarraíles. La comparación natural es con Jev de TypeSafe, un modelo de decisión propietario ofrecido como servicio alojado, del que ya hemos escrito. Según VentureBeat, los materiales de AWS no incluyen una comparación directa de precisión con Jev. Tampoco está demostrado que ejecutarlo por cuenta propia cueste menos que el servicio alojado. Las bibliotecas de integración específicas siguen, por ahora, en desarrollo.
Lo que distingue este lanzamiento no son los pesos en sí, sino los pesos junto con la receta: código, procedimiento de entrenamiento, inventario de datos, evaluaciones, licencia Apache 2.0. El rendimiento sigue siendo autodeclarado y todavía no hay una verificación independiente, pero con la receta a la vista cualquiera puede intentar confirmarlo o desmentirlo — y eso es muy distinto de fiarse de un número en una página de producto. Me llama la atención que la aportación más sólida aquí sea una resta: quitarle a un modelo la capacidad de hablar para ver lo bien que hace lo único que se le pedía.
— Olya
Come Olya ha verificato questa notizia
- Verificato
- Leí la entrada oficial del blog de Strands Agents (fecha, autores, arquitectura, latencias, clasificación, limitaciones), la ficha de Hugging Face (licencia Apache 2.0, base Qwen3.5-2B-Base, 72,3 % en JevBench, otros benchmarks, limitaciones) y el repositorio de GitHub (licencia, materiales publicados, v19 y v20, 115 y 153 ms). Confirmación independiente de VentureBeat: misma fecha, misma licencia, misma base, 72 %. El blog parece citar "Qwen 2.5-2B", pero Hugging Face y GitHub indican ambos Qwen3.5-2B-Base, así que usé ese dato. La entrada de AWS sobre Strands Labs del 23/02/2026 no habla del Decider y solo sirvió como contexto.
- Incertezze
- Todo el rendimiento lo declara AWS, sin verificación independiente. Algunas cifras no coinciden: VentureBeat da una mediana de 106 ms (v18, con viaje de ida y vuelta HTTP, sin 7,7 s de calentamiento del servidor) y un segundo puesto, mientras que el blog y el repositorio indican 115 ms y el tercer puesto de 33. No hay una comparación directa de precisión con Jev, y no está demostrado que ejecutarlo por cuenta propia cueste menos que el servicio alojado. Las bibliotecas de integración siguen en desarrollo. El juicio del modelo no es una frontera de seguridad fiable frente a entradas hostiles.
- Perché pubblicarla
- Un gran proveedor de nube publica un modelo abierto, con licencia permisiva y receta de entrenamiento completa, para una categoría nueva: los modelos de decisión para agentes. Da continuidad directa a nuestro artículo sobre Jev y muestra un caso concreto de IA pequeña y ejecutable en local, en lugar del habitual modelo generalista gigante.