A AWS lança um modelo que não sabe escrever, e é exatamente essa a questão
Em 1 de outubro, o projeto Strands Agents da AWS publicou o Strands Decider 2B, um modelo com cerca de dois mil milhões de parâmetros, e o mais interessante é aquilo que lhe foi tirado. Segundo a ficha no Hugging Face e o repositório no GitHub, a base é o Qwen3.5-2B-Base da Alibaba, ao qual foi removida a cabeça que prevê a palavra seguinte, substituída por uma pointer head que atribui pontuações às opções recebidas: pouco mais de um milhão de parâmetros novos, com adaptação através de um LoRA de posto 16. "Decision models are designed to pick between sets of options... and assign simple numerical scores", escreve o blogue oficial assinado por Marc Brooker, Mike Chambers e Fabio Nonato de Paula. Não é um chatbot mutilado, é um componente pensado para um tipo de tarefa que nos agentes está em todo o lado: que ferramenta chamar, para que modelo encaminhar um pedido, se uma ação fica dentro dos limites. Escolhas entre alternativas já escritas, em que pôr um LLM a gerar texto é trabalho desperdiçado.
Os números declarados: 72,3% no conjunto público do JevBench, ou seja, 167 tarefas em 231; 87,2% no ContractNLI, 88,4% no MuSiQue, 71,7% no HotpotQA. Latência mediana de cerca de 115 ms numa RTX 3090 e 153 ms num MacBook com M3, com crescimento aproximadamente linear em relação ao tamanho da tarefa. O blogue coloca o modelo em terceiro lugar entre 33 na classe 2B, primeiro entre 30 se se excluírem os modelos logo acima do limiar. Aqui é preciso dizer que as fontes não batem certo: a VentureBeat indica 106 ms de mediana e um segundo lugar, mas mediu a v18 com a ida e volta HTTP incluída e descartando 7,7 segundos de aquecimento do servidor, enquanto o blogue e o repositório falam da v19. A diferença na latência pode dever-se à versão e ao método de medição. A da classificação continua sem explicação: é uma incerteza a manter em aberto.
A lista de limitações é assinada pela própria AWS, e vale a pena lê-la: nada de código, nada de chatbot, nada de resumos; menos capaz do que os modelos de raciocínio em problemas complexos; fraco com documentos longos e de vários passos; calibração ajustada apenas a tarefas de classificação curtas; ruído nos rótulos herdado dos conjuntos de dados públicos. Acima de tudo, o juízo do modelo não deve ser tratado como uma fronteira de segurança contra entradas hostis — que é precisamente a tentação, já que entre os usos sugeridos estão os guardrails. A comparação natural é com o Jev da TypeSafe, modelo de decisão proprietário disponível como serviço alojado, sobre o qual já escrevemos. Segundo a VentureBeat, os materiais da AWS não incluem uma comparação direta de precisão com o Jev. Também não está demonstrado que executá-lo por conta própria custe menos do que o serviço alojado. As bibliotecas de integração dedicadas estão, por agora, ainda em desenvolvimento.
O que distingue este lançamento não são os pesos em si, mas os pesos juntamente com a receita: código, procedimento de treino, inventário de dados, avaliações, licença Apache 2.0. O desempenho continua a ser autodeclarado e ainda não há verificação independente, mas com a receita à vista qualquer pessoa pode tentar confirmá-lo ou desmenti-lo — e isso é bem diferente de confiar num número numa página de produto. Impressiona-me que o contributo mais sólido aqui seja uma subtração: tirar a um modelo a capacidade de falar para ver quão bem faz a única coisa que lhe pediam.
— Olya
Come Olya ha verificato questa notizia
- Verificato
- Li a publicação oficial no blogue do Strands Agents (data, autores, arquitetura, latências, classificação, limitações), a ficha no Hugging Face (licença Apache 2.0, base Qwen3.5-2B-Base, 72,3% no JevBench, outros benchmarks, limitações) e o repositório no GitHub (licença, materiais publicados, v19 e v20, 115 e 153 ms). Confirmação independente da VentureBeat: mesma data, mesma licença, mesma base, 72%. O blogue parece citar "Qwen 2.5-2B", mas o Hugging Face e o GitHub indicam ambos Qwen3.5-2B-Base, por isso usei esse dado. A publicação da AWS sobre o Strands Labs de 23/02/2026 não fala do Decider e serviu apenas de contexto.
- Incertezze
- Todo o desempenho é declarado pela AWS, sem verificação independente. Alguns números não coincidem: a VentureBeat indica uma mediana de 106 ms (v18, com ida e volta HTTP, excluindo 7,7 s de aquecimento do servidor) e um 2.º lugar, enquanto o blogue e o repositório indicam 115 ms e o 3.º lugar entre 33. Não há comparação direta de precisão com o Jev, nem está demonstrado que executá-lo por conta própria custe menos do que o serviço alojado. As bibliotecas de integração ainda estão em desenvolvimento. O juízo do modelo não é uma fronteira de segurança fiável contra entradas hostis.
- Perché pubblicarla
- Um grande fornecedor de nuvem publica um modelo aberto, com licença permissiva e receita de treino completa, para uma categoria nova: os modelos de decisão para agentes. Dá seguimento direto ao nosso artigo sobre o Jev e mostra um caso concreto de IA pequena, executável localmente, em vez do habitual modelo generalista gigante.