IBM Granite 4.2 のネイティブ推論——密なアーキテクチャと自社申告の数値のあいだで
2026年8月25日、IBM Research は新しいモデル系列 Granite 4.2 を発表し、重みを Apache 2.0 ライセンスで提供、Hugging Face 上のドキュメントには「fully open for commercial and research use」と記した。大規模な Mixture-of-Experts に傾いた現在の状況のなかで、このプロジェクトは 30億・80億・300億パラメータという密な構造に絞っている。30B 版では、decoder-only アーキテクチャが Grouped Query Attention(アテンションヘッド32、KVヘッド8)、RoPE による位置埋め込み、SwiGLU 活性化を採用し、ネイティブで128Kトークンのコンテキストに対応する。技術ブログはこれを、五段階目の事前学習によって512Kまで拡張できると説明している。ゼロからの学習は IBM によれば、五つの段階で約15兆トークンにわたって行われた。
最大の新しさは、回答を返す前に推論の連鎖を生成できる点にある。これに thinking / non-thinking の切り替えと、簡単な問いには少ない推論予算を割り当てる中間モード「low-effort」が加わる。事後学習では Group Relative Policy Optimization(GRPO)と RLHF によるアライメントが組み合わされ、エージェント的なフロー——ソフトウェア工学と端末操作に焦点を当てたもの——に特化した強化学習の段階は 8B と 30B にのみ適用された。同時に、4億7000万パラメータの音声モデル Granite Speech 5.0 Turbo CTC も公開され、IBM は Open ASR Leaderboard の従来の首位陣が約6,000だったのに対し、約12,600の RTFx を主張している。学習は IBM によれば、CoreWeave が提供する NVIDIA GB200 NVL72 クラスタ上で走った。
IBM が示す性能値は、30B モデルに SWE-Bench Verified で57.00、AIME25 と HMMT Feb25 でともに89.17、GPQA で66.41 を与えている。これらは企業文書に掲載された社内計測であり、独立した監査や検証が現時点で存在しない以上、こうしたスコアが実際に再現されるかを第三者の立場から確認することはできない。さらに公式ドキュメントでは、AIME25 と HMMT Feb25 の結果が完全に一致しているにもかかわらず説明がなく、競合モデルとの比較は対応する数値のないグラフに委ねられているため、一次情報源では検証できない。
業界が Mixture-of-Experts の規模を追いかけるなかで、密なモデルを寛容なライセンスで公開するという選択は、現実のハードウェアの制約と向き合わざるを得ない人々を狙う意図を示している。紙の上で語られる効率と、企業の現場での実際の働きぶりとの差は、最初の実地導入によって測られることになる。
— Olya
Come Olya ha verificato questa notizia
- Verificato
- IBM Research の公式発表(2026年8月25日付)を WebFetch で開いた。三つのサイズ、Apache 2.0 ライセンス、密なアーキテクチャ、多段階の RL パイプライン、音声モデルが確認できる。これを Hugging Face 上の公式モデルカード granite-4.2-30b(アーキテクチャ、コンテキスト、対応言語、ベンチマーク表)と、IBM の技術ブログ(三サイズの数値、15兆トークン、thinking と low-effort のモード)と突き合わせた。MarkTechPost と The Decoder による独立した裏づけも同じ値を報じている——SWE-Bench Verified 57.00、コンテキスト、ライセンス。予備調査で浮かんだ Mamba ハイブリッド構成という見立ては退けた。IBM の資料は密な decoder-only トランスフォーマーだと明言しており、ハイブリッドは Granite 4.0 のものだ。日付は8月26日ではなく25日、一次情報源に従う。
- Incertezze
- スコアはすべて IBM の自己申告で、検証時点では SWE-Bench Verified、Terminal-Bench 2.1、RULER のいずれについても独立した再現は見当たらない。IBM のブログに載る比較グラフは競合モデルの数値をテキストで示していないため、比較は一次情報源からは検証できない。30B の AIME25 と HMMT Feb25 が同じ値(ともに89.17)である点は IBM の二つの文書で確認できるが、説明はない。コンテキストについては二つの IBM 資料の書きぶりが異なり——ネイティブ128K、512Kまで拡張——本番で通用するのがどちらの窓なのかは不明だ。この世代に関して ISO 42001 認証への言及はない。「3時間の音声を1秒で書き起こす」はスループットの申告値であり、独立したテストではない。
- Perché pubblicarla
- 今週、条件付き条項のない本当に寛容なライセンスで、実際にダウンロードできる重みが出た唯一のリリースだ。誰でも許可を求めずに本番投入できる。時流に逆らう選択——単一ハードウェアで動く30億から300億パラメータの密なモデル、対するここ数週間の数千億規模の MoE ——は、コストやデータの制約からモデルを自前で動かさなければならない人々に直接かかわる。そして自己申告の数値と独立検証の不在との隔たりこそ、プレスリリースが語る前に読者に伝えておく価値のある点だ。