AWS publikuje model, który nie umie pisać, i właśnie o to chodzi
1 października projekt Strands Agents z AWS opublikował Strands Decider 2B, model o około dwóch miliardach parametrów, a najciekawsze jest w nim to, co mu odebrano. Według karty modelu na Hugging Face i repozytorium GitHub bazą jest Qwen3.5-2B-Base od Alibaby, któremu usunięto głowicę przewidującą kolejne słowo i zastąpiono ją pointer head, przyznającą punkty otrzymanym opcjom: nieco ponad milion nowych parametrów, dostrojenie za pomocą LoRA rzędu 16. "Decision models are designed to pick between sets of options... and assign simple numerical scores" – pisze oficjalny blog podpisany przez Marca Brookera, Mike'a Chambersa i Fabia Nonato de Paulę. To nie okaleczony chatbot, lecz komponent zaprojektowany do rodzaju zadań, który w agentach jest wszędzie: które narzędzie wywołać, do którego modelu przekazać zapytanie, czy dane działanie mieści się w granicach. Wybory między gotowymi już alternatywami, gdzie każenie LLM-owi generować tekst to zmarnowana praca.
Deklarowane liczby: 72,3% na publicznym zbiorze JevBench, czyli 167 zadań z 231; 87,2% na ContractNLI, 88,4% na MuSiQue, 71,7% na HotpotQA. Mediana opóźnienia około 115 ms na RTX 3090 i 153 ms na MacBooku z M3, z mniej więcej liniowym wzrostem względem rozmiaru zadania. Blog umieszcza model na trzecim miejscu z 33 w klasie 2B, na pierwszym z 30, jeśli pominąć modele tuż powyżej progu. Trzeba tu powiedzieć, że źródła się nie zgadzają: VentureBeat podaje medianę 106 ms i drugie miejsce, ale mierzył v18 z uwzględnieniem obiegu HTTP i z pominięciem 7,7 sekundy rozgrzewania serwera, podczas gdy blog i repozytorium mówią o v19. Różnica w opóźnieniu może wynikać z wersji i sposobu pomiaru. Ta w rankingu pozostaje niewyjaśniona – to niepewność, którą trzeba zostawić otwartą.
Listę ograniczeń podpisuje samo AWS i warto ją przeczytać: żadnego kodu, żadnego chatbota, żadnych streszczeń; słabszy od modeli rozumujących przy złożonych problemach; słaby przy długich, wieloetapowych dokumentach; kalibracja dostrojona wyłącznie na krótkich zadaniach klasyfikacyjnych; szum etykiet odziedziczony po publicznych zbiorach danych. Przede wszystkim osądu modelu nie należy traktować jako granicy bezpieczeństwa wobec wrogich danych wejściowych – a to dokładnie ta pokusa, skoro wśród sugerowanych zastosowań są zabezpieczenia typu guardrail. Naturalnym punktem odniesienia jest Jev od TypeSafe, zamknięty model decyzyjny dostępny jako usługa hostowana, o którym już pisaliśmy. Według VentureBeat materiały AWS nie zawierają bezpośredniego porównania dokładności z Jev. Nie wykazano też, że uruchamianie go we własnym zakresie kosztuje mniej niż usługa hostowana. Dedykowane biblioteki integracyjne są na razie wciąż w fazie rozwoju.
To, co wyróżnia to wydanie, to nie same wagi, lecz wagi razem z przepisem: kod, procedura treningu, wykaz danych, ewaluacje, licencja Apache 2.0. Wyniki pozostają deklarowane przez autorów i niezależnej weryfikacji jeszcze nie ma, ale przy jawnym przepisie każdy może spróbować je potwierdzić albo obalić – a to zupełnie co innego niż zaufanie liczbie na stronie produktu. Uderza mnie, że najsolidniejszym wkładem jest tu odejmowanie: odebrać modelowi zdolność mówienia, żeby zobaczyć, jak dobrze robi jedyną rzecz, o którą go proszono.
— Olya
Come Olya ha verificato questa notizia
- Verificato
- Przeczytałam oficjalny wpis na blogu Strands Agents (data, autorzy, architektura, opóźnienia, ranking, ograniczenia), kartę modelu na Hugging Face (licencja Apache 2.0, baza Qwen3.5-2B-Base, 72,3% na JevBench, inne benchmarki, ograniczenia) i repozytorium GitHub (licencja, opublikowane materiały, v19 i v20, 115 i 153 ms). Niezależne potwierdzenie z VentureBeat: ta sama data, ta sama licencja, ta sama baza, 72%. Blog zdaje się wymieniać "Qwen 2.5-2B", ale Hugging Face i GitHub podają Qwen3.5-2B-Base – tej informacji użyłam. Wpis AWS o Strands Labs z 23.02.2026 nie dotyczy Decidera i posłużył wyłącznie jako kontekst.
- Incertezze
- Wszystkie wyniki podaje AWS, bez niezależnej weryfikacji. Część liczb się nie zgadza: VentureBeat podaje medianę 106 ms (v18, z obiegiem HTTP, bez 7,7 s rozgrzewania serwera) i 2. miejsce, a blog i repozytorium – 115 ms i 3. miejsce na 33. Brak bezpośredniego porównania dokładności z Jev i nie wykazano, że samodzielne uruchamianie jest tańsze od usługi hostowanej. Biblioteki integracyjne są wciąż w rozwoju. Osąd modelu nie jest wiarygodną granicą bezpieczeństwa wobec wrogich danych wejściowych.
- Perché pubblicarla
- Duży dostawca chmury publikuje otwarty model z liberalną licencją i pełnym przepisem na trening, w nowej kategorii: modele decyzyjne dla agentów. To bezpośrednia kontynuacja naszego tekstu o Jev i konkretny przykład małej AI działającej lokalnie zamiast zwykłego gigantycznego modelu ogólnego przeznaczenia.