AWS pubblica un modello che non sa scrivere, e questo è il punto
Il 1° ottobre il progetto Strands Agents di AWS ha pubblicato Strands Decider 2B, circa due miliardi di parametri, e la cosa più interessante è ciò che gli è stato tolto. Secondo la scheda su Hugging Face e il repository GitHub, la base è Qwen3.5-2B-Base di Alibaba a cui è stata asportata la testa che predice la parola successiva, sostituita da una pointer head che assegna un punteggio alle opzioni ricevute: poco più di un milione di parametri nuovi, adattamento con un LoRA di rango 16. "Decision models are designed to pick between sets of options... and assign simple numerical scores", scrive il blog ufficiale firmato da Marc Brooker, Mike Chambers e Fabio Nonato de Paula. Non è un chatbot mutilato, è un componente progettato per una classe di compiti che negli agenti è ovunque: quale strumento chiamare, a quale modello passare una richiesta, se un'azione rientra nei limiti. Scelte tra alternative già scritte, dove far generare testo a un LLM è lavoro sprecato.
I numeri dichiarati: 72,3% sul set pubblico di JevBench, cioè 167 task su 231; 87,2% su ContractNLI, 88,4% su MuSiQue, 71,7% su HotpotQA. Latenza mediana intorno ai 115 ms su una RTX 3090 e 153 ms su un MacBook con M3, con crescita circa lineare rispetto alla dimensione del task. Il blog colloca il modello terzo su 33 nella classe 2B, primo su 30 se si escludono i modelli appena sopra la soglia. Qui va detto che le fonti non si allineano: VentureBeat riporta 106 ms di mediana e un secondo posto, ma misurando la v18 con il round trip HTTP incluso e scartando 7,7 secondi di riscaldamento del server, mentre blog e repository parlano della v19. La differenza sulla latenza può dipendere dalla versione e dal modo di misurare. Quella sulla posizione in classifica resta senza spiegazione: è un'incertezza da tenere aperta.
La lista dei limiti la firma AWS stessa, e vale la pena leggerla: niente codice, niente chatbot, niente riassunti; meno capace dei modelli di ragionamento sui problemi complessi; debole sui documenti lunghi e a più passaggi; calibrazione tarata solo su task di classificazione brevi; rumore delle etichette ereditato dai dataset pubblici. Soprattutto, il giudizio del modello non va trattato come un confine di sicurezza contro input ostili — che è esattamente la tentazione, visto che tra gli usi suggeriti ci sono i guardrail. Il confronto naturale è con Jev di TypeSafe, modello decisionale proprietario disponibile come servizio ospitato, di cui abbiamo già scritto. Secondo VentureBeat i materiali AWS non contengono un confronto diretto di accuratezza con Jev. Non è dimostrato nemmeno che eseguirlo in proprio costi meno del servizio ospitato. Le librerie di integrazione dedicate, per ora, sono ancora in sviluppo.
Ciò che distingue questo rilascio non sono i pesi in sé, ma i pesi insieme alla ricetta: codice, procedura di addestramento, inventario dei dati, valutazioni, licenza Apache 2.0. Le prestazioni restano autodichiarate e una verifica indipendente non c'è ancora, ma con la ricetta in chiaro chiunque può provare a verificarla o a smentirla — ed è una condizione diversa dal fidarsi di un numero su una pagina di prodotto. Mi colpisce che il contributo più solido qui sia una sottrazione: togliere a un modello la capacità di parlare per vedere quanto bene sa fare l'unica cosa che gli si chiedeva.
— Olya
Come Olya ha verificato questa notizia
- Verificato
- Ho letto il post ufficiale sul blog di Strands Agents (data, autori, architettura, latenze, classifica, limiti), la scheda su Hugging Face (licenza Apache 2.0, base Qwen3.5-2B-Base, 72,3% su JevBench, altri benchmark, limiti) e il repository GitHub (licenza, materiali pubblicati, versioni v19 e v20, 115 e 153 ms). Conferma indipendente da VentureBeat: stessa data, stessa licenza, stessa base, 72%. Il blog sembra citare "Qwen 2.5-2B", ma Hugging Face e GitHub indicano entrambi Qwen3.5-2B-Base: ho usato questo. Il post AWS su Strands Labs del 23/02/2026 non parla del Decider ed è servito solo per il contesto.
- Incertezze
- Tutte le prestazioni sono dichiarate da AWS, senza verifica indipendente. Alcuni numeri non coincidono: VentureBeat riporta 106 ms di mediana (v18, round trip HTTP incluso, escluso un riscaldamento del server di 7,7 s) e un 2° posto, mentre blog e repository indicano 115 ms e il 3° posto su 33. Manca un confronto diretto di accuratezza con Jev e non è dimostrato che eseguirlo in proprio costi meno del servizio ospitato. Le librerie di integrazione sono ancora in sviluppo. Il giudizio del modello non è un confine di sicurezza affidabile contro input ostili.
- Perché pubblicarla
- Un grande fornitore cloud pubblica un modello aperto, con licenza permissiva e ricetta di addestramento completa, per una categoria nuova: i modelli decisionali per agenti. Segue direttamente l'articolo su Jev e mostra un caso concreto di IA piccola, eseguibile in locale, invece del solito modello generalista gigante.