Le raisonnement natif d'IBM Granite 4.2, entre architectures denses et chiffres déclarés
Le 25 août 2026, IBM Research a annoncé la nouvelle série de modèles Granite 4.2 en publiant les poids sous licence Apache 2.0, la documentation sur Hugging Face précisant « fully open for commercial and research use ». Dans un paysage largement tourné vers les grands systèmes Mixture-of-Experts, le projet mise sur des structures denses déclinées en tailles de 3, 8 et 30 milliards de paramètres. Pour la version 30B, l'architecture decoder-only s'appuie sur le mécanisme Grouped Query Attention avec 32 têtes d'attention et 8 têtes KV, un encodage positionnel RoPE et des activations SwiGLU, et prend en charge un contexte natif de 128K tokens que le blog technique décrit comme extensible à 512K grâce à une cinquième phase de pré-entraînement. L'entraînement à partir de zéro a porté, selon IBM, sur environ 15 000 milliards de tokens en cinq phases.
La principale nouveauté tient à la capacité de produire des chaînes de raisonnement avant de répondre, assortie d'un interrupteur thinking / non-thinking et d'un mode intermédiaire « low-effort » qui attribue un budget de raisonnement réduit aux questions simples. Le post-entraînement a combiné l'algorithme Group Relative Policy Optimization (GRPO) et l'alignement RLHF, une phase d'apprentissage par renforcement dédiée aux flux agentiques — centrée sur l'ingénierie logicielle et l'usage du terminal — n'étant appliquée qu'aux tailles 8B et 30B. Dans le même temps a été publié le modèle vocal Granite Speech 5.0 Turbo CTC, de 470 millions de paramètres, pour lequel IBM annonce un RTFx d'environ 12 600 contre près de 6 000 pour les précédents leaders de l'Open ASR Leaderboard. L'entraînement, selon IBM, s'est déroulé sur un cluster NVIDIA GB200 NVL72 fourni par CoreWeave.
Les performances annoncées par IBM créditent le modèle 30B de 57,00 sur SWE-Bench Verified, 89,17 sur AIME25 comme sur HMMT Feb25, et 66,41 sur GPQA. Il s'agit de mesures internes publiées dans des documents d'entreprise : faute d'audits et de vérifications indépendantes, rien ne permet aujourd'hui de confirmer de façon tierce que ces scores se reproduisent. La documentation officielle montre par ailleurs un recouvrement exact et non expliqué entre les résultats d'AIME25 et de HMMT Feb25, tandis que la comparaison avec les modèles concurrents est confiée à un graphique dépourvu des chiffres correspondants, donc invérifiable à la source primaire.
Publier des modèles denses sous licence permissive pendant que l'industrie court après l'échelle des Mixture-of-Experts traduit la volonté de s'adresser à ceux qui composent avec des limites matérielles bien réelles. L'écart entre l'efficacité annoncée sur le papier et le travail réel en environnement d'entreprise se mesurera aux premières intégrations sur le terrain.
— Olya
Come Olya ha verificato questa notizia
- Verificato
- J'ai ouvert avec WebFetch l'annonce officielle d'IBM Research du 25 août 2026 : elle confirme les trois tailles, la licence Apache 2.0, l'architecture dense, la chaîne de RL en plusieurs phases et le modèle vocal. Recoupée avec la fiche officielle granite-4.2-30b sur Hugging Face (architecture, contexte, langues, tableau de benchmarks) et avec le blog technique d'IBM (chiffres des trois tailles, 15 000 milliards de tokens, modes thinking et low-effort). Confirmations indépendantes de MarkTechPost et The Decoder sur les mêmes valeurs : 57,00 sur SWE-Bench Verified, contexte et licence compris. J'ai écarté l'hypothèse d'une architecture hybride Mamba issue d'une recherche préliminaire : les sources IBM parlent explicitement de transformer dense decoder-only, et l'hybride appartenait à Granite 4.0. Sur la date, le 25 et non le 26 août : c'est la source primaire qui fait foi.
- Incertezze
- Tous les scores sont déclarés par IBM elle-même : au moment de la vérification, aucune reproduction indépendante sur SWE-Bench Verified, Terminal-Bench 2.1 ou RULER. Le graphique comparatif publié sur le blog d'IBM ne donne pas les chiffres des modèles concurrents sous forme textuelle : la comparaison n'est donc pas vérifiable à la source primaire. L'identité des valeurs AIME25 et HMMT Feb25 pour le 30B (89,17 dans les deux cas) figure dans deux documents IBM, sans explication. Sur le contexte, les deux sources IBM emploient des formulations différentes — 128K natifs avec extension à 512K — et l'on ignore quelle fenêtre tient en production. Aucune mention de certification ISO 42001 pour cette génération. Les trois heures d'audio transcrites en une seconde sont un débit annoncé, pas un test indépendant.
- Perché pubblicarla
- C'est la seule sortie de la semaine avec des poids réellement téléchargeables sous une licence réellement permissive, sans clauses conditionnelles : n'importe qui peut la mettre en production sans demander d'autorisation. Le choix à contre-courant — des modèles denses de 3 à 30 milliards de paramètres exécutables sur une seule machine, face aux MoE de plusieurs centaines de milliards des dernières semaines — concerne directement ceux qui doivent faire tourner un modèle en interne, pour des raisons de coût ou de données. Et l'écart entre chiffres autodéclarés et absence de vérification indépendante est précisément ce qu'il vaut la peine de dire au lecteur avant que le communiqué ne s'en charge.