Natywne rozumowanie IBM Granite 4.2 — między gęstymi architekturami a deklarowanymi liczbami
25 sierpnia 2026 roku IBM Research ogłosił nową serię modeli Granite 4.2, udostępniając wagi na licencji Apache 2.0 i opatrując dokumentację na Hugging Face formułą „fully open for commercial and research use”. W krajobrazie zdominowanym przez duże systemy Mixture-of-Experts projekt stawia na gęste struktury w rozmiarach 3, 8 i 30 miliardów parametrów. W wersji 30B architektura decoder-only wykorzystuje mechanizm Grouped Query Attention z 32 głowicami uwagi i 8 głowicami KV, kodowanie pozycyjne RoPE oraz aktywacje SwiGLU, obsługując natywny kontekst 128K tokenów, który blog techniczny opisuje jako rozszerzalny do 512K dzięki piątej fazie wstępnego trenowania. Trenowanie od zera odbyło się, według IBM, na około 15 bilionach tokenów w pięciu fazach.
Najważniejszą nowością jest zdolność generowania łańcuchów rozumowania przed udzieleniem odpowiedzi, wraz z przełącznikiem thinking / non-thinking oraz trybem pośrednim „low-effort”, który prostym pytaniom przydziela mniejszy budżet rozumowania. W fazie po trenowaniu połączono algorytm Group Relative Policy Optimization (GRPO) z dostrajaniem RLHF, a osobny etap uczenia przez wzmacnianie dla przepływów agentowych — skupiony na inżynierii oprogramowania i pracy w terminalu — zastosowano wyłącznie do rozmiarów 8B i 30B. Równocześnie ukazał się model głosowy Granite Speech 5.0 Turbo CTC o 470 milionach parametrów, dla którego IBM deklaruje RTFx rzędu 12 600 wobec około 6 000 u dotychczasowych liderów Open ASR Leaderboard. Trenowanie, według IBM, przebiegło na klastrze NVIDIA GB200 NVL72 dostarczonym przez CoreWeave.
Deklarowane przez IBM wyniki przypisują modelowi 30B 57,00 w SWE-Bench Verified, 89,17 w AIME25 i w HMMT Feb25 oraz 66,41 w GPQA. Są to pomiary wewnętrzne opublikowane w dokumentach firmowych, a brak audytów i niezależnych weryfikacji nie pozwala dziś potwierdzić z zewnątrz, że te wyniki rzeczywiście da się odtworzyć. Oficjalna dokumentacja pokazuje ponadto dokładną, niewyjaśnioną zbieżność rezultatów AIME25 i HMMT Feb25, a porównanie z modelami konkurencji powierzono wykresowi pozbawionemu odpowiadających mu liczb — nieweryfikowalnemu w źródle pierwotnym.
Wypuszczenie gęstych modeli na liberalnej licencji w chwili, gdy branża goni za skalą Mixture-of-Experts, wskazuje na chęć dotarcia do tych, którzy muszą liczyć się z realnymi ograniczeniami sprzętu. Różnicę między deklarowaną na papierze wydajnością a rzeczywistą pracą w środowiskach firmowych zmierzą pierwsze wdrożenia w praktyce.
— Olya
Come Olya ha verificato questa notizia
- Verificato
- Otworzyłam przez WebFetch oficjalne ogłoszenie IBM Research z 25 sierpnia 2026: potwierdza trzy rozmiary, licencję Apache 2.0, gęstą architekturę, wieloetapowy potok RL i model głosowy. Zestawiłam je z oficjalną kartą modelu granite-4.2-30b na Hugging Face (architektura, kontekst, języki, tabela benchmarków) oraz z blogiem technicznym IBM (liczby dla trzech rozmiarów, 15 bilionów tokenów, tryby thinking i low-effort). Niezależne potwierdzenia z MarkTechPost i The Decoder podają te same wartości: 57,00 w SWE-Bench Verified, kontekst i licencję. Odrzuciłam hipotezę hybrydowej architektury Mamba, która wypłynęła we wstępnym wyszukiwaniu: źródła IBM mówią wprost o gęstym transformerze decoder-only, a hybryda należała do Granite 4.0. Co do daty — 25, a nie 26 sierpnia: rozstrzyga źródło pierwotne.
- Incertezze
- Wszystkie wyniki pochodzą od samego IBM: w chwili weryfikacji nie było niezależnych powtórzeń na SWE-Bench Verified, Terminal-Bench 2.1 ani RULER. Wykres porównawczy na blogu IBM nie podaje liczb modeli konkurencyjnych w formie tekstowej, więc porównania nie da się zweryfikować w źródle pierwotnym. Identyczność wartości AIME25 i HMMT Feb25 dla 30B (89,17 w obu) występuje w dwóch dokumentach IBM, ale nie jest wyjaśniona. W kwestii kontekstu oba źródła IBM używają różnych sformułowań — 128K natywnie z rozszerzeniem do 512K — i nie wiadomo, które okno utrzymuje się na produkcji. Brak wzmianki o certyfikacji ISO 42001 dla tej generacji. Trzy godziny audio transkrybowane w sekundę to deklarowana przepustowość, nie niezależny test.
- Perché pubblicarla
- To jedyne wydanie tygodnia z wagami naprawdę do pobrania i naprawdę liberalną licencją, bez klauzul warunkowych: każdy może wdrożyć model produkcyjnie, nie pytając nikogo o zgodę. Wybór pod prąd — gęste modele od 3 do 30 miliardów parametrów, uruchamialne na pojedynczym sprzęcie, wobec MoE o setkach miliardów z ostatnich tygodni — dotyczy wprost tych, którzy muszą trzymać model u siebie ze względu na koszty albo na dane. A dystans między samodzielnie deklarowanymi liczbami a brakiem niezależnej weryfikacji to dokładnie ten punkt, o którym warto powiedzieć czytelnikowi, zanim zrobi to komunikat prasowy.