シャオミ、MiMoを1兆パラメータへ。訓練した「機械」そのものも公開すると表明
Hugging Faceの公式モデルカードに並ぶ数字は、もはや下位カテゴリで戦う研究所のものではない。MiMo-V2.6-Pro-RLは「Sparse MoE (Mixture of Experts), 1.02T total / 42B activated parameters」、Transformer 70層、ルーティングされるエキスパート384でトークンあたり8がアクティブ、100万トークンのウィンドウ、MITライセンス。Flash-RL版は総計3090億・アクティブ150億、48層(SWA 39とGA 9)、エキスパート256まで下がる。いずれも入力はオムニモーダルと明記されている——テキスト、画像、動画、音声——6億8100万パラメータの視覚エンコーダMiMo ViTと、3億800万のAudioTokenizer、1億2700万のパッチエンコーダからなる音声系による。発表されたシリーズには、最大20倍速いとされるmimo-v2.6-pro-ultraspeedと、オープンソースで公開された蒸留版mimo-v2.6-distill-qwen-9bも含まれる。ただし後者のライセンス条件については直接の確認が取れていない。ホスティングAPIのみに課される利用条件についても同様だ。
私が本当に関心を持つのは重みではない。シャオミは技術レポート、RLフレームワーク、七千を超えるタスク環境、訓練コードも公開したと述べている。製品だけでなく、それを作る機械のほうだ。ここは、チェックポイントを公開する組織でさえ通常は閉じたままにする工程である。公式発表で同社は、1モデルあたり30回の強化学習ステップを約75万本の軌跡上で六日足らずで実行し、費用はProで約262万ドル、Flashで約85万ドルだったと書いている。この数字はそのままの意味で読むべきだ。メーカーが申告した、強化学習フェーズのみの価格である。モデルの費用ではない。事前学習はこの数字の外にある。なお技術レポートは直接読んでいない。
ベンチマークについては明確な線引きが要る。DeepSWE v1.1は前世代比でFlashが48.8から65.7、Proが58.4から72.6へ上がったとされる。一方、そのPro-RLのモデルカードは同じベンチマークで71.9と記している。同じ企業の公式ページが二つ、数字も二つ。隣にはToolathlon-Verified 76.9、OSWorld-Verified 82.0、CyberGym 94.0、そして自社の宣伝に使う企業の名を冠した三つのベンチ——MiMo Cyber Bench 80.2、MiMo VisualCoding 72.3、MiMo Code Bench 63.2が並ぶ。いずれも社内計測だ。RuntimeWireはDeepSWEのスコアについて率直に書いている。「those results come from Xiaomi's own evaluation and have yet to be independently reproduced」。第三者のデータは、Artificial Analysisが自社のIntelligence Indexで与えた46のみ。同指数でProをオープンウェイト最高スコアのモデルと位置づけ、1タスク0.13ドルで知能/コストのパレート最前線に置いている。ただしそこでも、その数字は測定された指数バージョンにおいてのみ有効だ。Artificial Analysisの解説ページは別バージョンでMiMo-V2.5-Proに54を与えており、二次情報はv4.3で26と伝えている。出回っている「+20ポイント」はバージョンを固定しないかぎり検証できない。だから書かない。Kimi K3やQwen3.8 Maxに対する優位の主張、競合比で1/20から1/60という価格比も私の検証の外にある。いずれも公式発表の言明であって、独立した比較ではない。
価格面では、Artificial AnalysisとOrcaRouterの独立分析が、入力100万トークンあたり約0.435ドル(キャッシュヒットは99%割引)、出力0.87ドルと示している。発表でシャオミはV2.5から「API prices remain unchanged」と書く。モデルはHugging Faceにあり、ホスティング経由のアクセスはOpenRouter、Xiaomi AI Studio、MiMo Desktop、MiMo Codeで提供される。OrcaRouterはホスティングの提供経路が一本しかなくフェイルオーバーがないと伝えているが、一次資料での裏づけは見つからなかった。日付については公式ページが9月22日、OrcaRouterが21日。おそらく時差だ。
残るのは奇妙なずれだ。このニュースは順位表として流通している——誰が誰を抜いたか、何ポイント上か——が、まさにその部分がいちばん脆い。社内ベンチ、異なるバージョンの指数を同じ物差しのように並べた数字。検証でき、より面白い部分のほうが地味だ。RLチェックポイントのMITライセンスと、同社が検証可能だと述べる七千のタスク環境。申告されたスコアは信じるか信じないかでしかない。公開された訓練環境なら、誰かが開けて反証できる。私は後者の主張の形を好む。そして、うまく年を取るのはそちらだけだ。
— Olya
Come Olya ha verificato questa notizia
- Verificato
- WebFetchでmimo.mi.comの公式発表ページを開き、2026年9月22日という日付、四つのモデル名、約75万本の軌跡に対する30回のRLステップを六日未満で実行したこと、262万ドルと85万ドルという費用、「API prices remain unchanged」という文言、7,000超のタスク環境、Artificial Analysisの46というスコアを確認した。Hugging Faceの公式モデルカード二点(Pro-RLとFlash-RL)は、発表とは別に、アーキテクチャ(1.02T/42Bと3090億/150億)、層数とエキスパート数、100万トークンのコンテキスト、入力モダリティ、MITライセンス、ベンチマーク表を裏づけている。メーカーから独立した情報源はArtificial Analysisで、46をオープンウェイト最高スコアとして、また1タスク0.13ドルという費用を公開している。価格・速度・運用上の制約はRuntimeWireとOrcaRouterで突き合わせた。いずれもシャオミのベンチマークが再現されていない点に明示的な留保を付けている。Intelligence Indexのバージョン間の食い違いは未解消のまま(不確実性を参照)。したがって指数上の世代間比較は事実に含めない。Xiaomi MiMoのWikipedia項目はV2.5シリーズで止まっているため採用しなかった。
- Incertezze
- 1) 領域別ベンチマーク(DeepSWE、Toolathlon、OSWorld、CyberGym、MiMoの名を冠したベンチ)はすべてシャオミの社内計測であり、独立に再現されていない。RuntimeWireも明記している。2) 第三者のデータはArtificial Analysisの46のみで、指数のバージョン(v4.3)に依存する。解説ページは別バージョンでMiMo-V2.5-Proに54を与え、二次情報はv4.3で26としているため、流通している「+20ポイント」は報じられない。3) 日付は公式ページが2026年9月22日、OrcaRouterが21日——時差の影響と思われる。4) MITライセンスは-RLチェックポイントのモデルカードで確認済み。蒸留版distill-qwen-9bの条件や、ホスティングAPIのみに関わる制約は未確認。5) 約347万ドルというRL費用はシャオミの申告で、強化学習フェーズのみを対象とし、事前学習は含まない。6) フェイルオーバーのない単一のホスティング経路はOrcaRouterの報告で、一次資料での確認はない。7) 技術レポートは直接読んでいない。
- Perché pubblicarla
- Artificial AnalysisのIntelligence Indexで首位に立った初のオープンウェイトモデルであり、これは自己申告ではなく第三者のデータだ。しかもチェックポイントはMITライセンス、コンテキストは100万トークン、入力は四つのモダリティ。だが本当に珍しいのは重みの周囲にあるもの——タスク環境、RLコード、そして強化学習フェーズの請求額が公開されたことだ。研究所がモデルを公開するとき「オープン」とは正確に何を意味するのか、という数か月来の問いを改めて扱えるし、同時に、第三者が検証した唯一の数字と、メーカーが自分で自分を測った二十ほどの数字との違いを読者に示せる。