Xiaomi bringt MiMo auf eine Billion Parameter – und will auch die Maschine veröffentlichen, die es trainiert hat
Die Zahlen der offiziellen Model Cards auf Hugging Face sind die eines Labors, das nicht mehr in einer unteren Liga spielt: MiMo-V2.6-Pro-RL ist ein „Sparse MoE (Mixture of Experts), 1.02T total / 42B activated parameters“, 70 Transformer-Layer, 384 geroutete Experten mit 8 aktiven pro Token, ein Fenster von einer Million Token, MIT-Lizenz. Die Variante Flash-RL geht auf 309 Milliarden gesamt und 15 Milliarden aktive Parameter herunter, 48 Layer (39 SWA und 9 GA), 256 Experten. Beide werden eingangsseitig als omnimodal angegeben – Text, Bilder, Video, Audio – über einen visuellen Encoder MiMo ViT mit 681 Millionen Parametern und eine Audiokette aus einem AudioTokenizer mit 308 Millionen und einem Patch-Encoder mit 127 Millionen. Zur angekündigten Reihe gehören auch mimo-v2.6-pro-ultraspeed, laut Angabe bis zu zwanzigmal schneller, und eine destillierte Version, mimo-v2.6-distill-qwen-9b, als Open Source veröffentlicht: für deren Lizenzbedingungen habe ich allerdings keine direkte Bestätigung, ebenso wenig für etwaige Nutzungsbeschränkungen allein der gehosteten API.
Der Teil, der mich wirklich interessiert, sind nicht die Gewichte. Xiaomi erklärt, auch den Technical Report, das RL-Framework, über siebentausend Task-Umgebungen und den Trainingscode veröffentlicht zu haben: die Maschine, nicht nur das Produkt. Genau dieser Abschnitt der Kette bleibt üblicherweise auch dort geschlossen, wo Checkpoints freigegeben werden. In der offiziellen Ankündigung schreibt das Unternehmen, es habe 30 Reinforcement-Learning-Schritte pro Modell über rund 750.000 Trajektorien in weniger als sechs Tagen ausgeführt, zu Kosten von etwa 2,62 Millionen Dollar bei Pro und etwa 850.000 bei Flash. Diese Zahl sollte man lesen als das, was sie ist: der Preis allein der Reinforcement-Learning-Phase, angegeben vom Hersteller. Es sind nicht die Kosten des Modells: das Pre-Training bleibt draußen. Den Technical Report, füge ich hinzu, habe ich nicht direkt gelesen.
Bei den Benchmarks braucht es eine klare Unterscheidung. DeepSWE v1.1 soll gegenüber der Vorgängergeneration bei Flash von 48,8 auf 65,7 und bei Pro von 58,4 auf 72,6 steigen; die Model Card desselben Pro-RL nennt für denselben Benchmark 71,9. Zwei offizielle Seiten desselben Unternehmens, zwei Zahlen. Daneben stehen Toolathlon-Verified 76,9, OSWorld-Verified 82,0, CyberGym 94,0 und drei Benchmarks, die den Namen des Unternehmens tragen, das sich mit ihnen bewirbt – MiMo Cyber Bench 80,2, MiMo VisualCoding 72,3, MiMo Code Bench 63,2. Das sind hauseigene Messungen. RuntimeWire hält das zu den DeepSWE-Werten ohne Umschweife fest: „those results come from Xiaomi's own evaluation and have yet to be independently reproduced“. Die einzige Drittangabe ist die 46, die Artificial Analysis auf dem eigenen Intelligence Index vergibt; dort gilt Pro als Open-Weights-Modell mit dem höchsten Indexwert und liegt auf der Pareto-Grenze Intelligenz/Kosten, bei 0,13 Dollar pro Task. Auch dort gilt die Zahl für die Indexversion, in der sie gemessen wurde: Die Vertiefungsseite von Artificial Analysis nennt für MiMo-V2.5-Pro eine 54 in einer anderen Version, Sekundärquellen sprechen von 26 in v4.3. Die kursierenden „+20 Punkte“ sind ohne Festlegung der Version nicht überprüfbar, also schreibe ich sie nicht. Außerhalb meiner Prüfung bleiben auch die behauptete Überlegenheit gegenüber Kimi K3 und Qwen3.8 Max sowie das Preisverhältnis von 1/20 bis 1/60 gegenüber der Konkurrenz: Das sind Aussagen der offiziellen Ankündigung, keine unabhängigen Vergleiche.
Zur Preisliste: Artificial Analysis und die unabhängige Analyse von OrcaRouter nennen rund 0,435 Dollar pro Million Eingabetoken – mit 99 % Rabatt auf Cache-Hits – und 0,87 in der Ausgabe; in der Ankündigung schreibt Xiaomi, „API prices remain unchanged“ gegenüber V2.5. Die Modelle liegen auf Hugging Face und, für den gehosteten Zugang, auf OpenRouter, Xiaomi AI Studio, MiMo Desktop und MiMo Code; OrcaRouter berichtet, es gebe nur einen einzigen gehosteten Servicepfad ohne Failover, doch dafür habe ich keine Bestätigung aus einer Primärquelle gefunden. Zum Datum: Die offizielle Seite nennt den 22. September, OrcaRouter den 21. – wahrscheinlich die Zeitzone.
Was mir bleibt, ist eine merkwürdige Verschiebung. Die Nachricht kursiert als Rangliste – wer wen geschlagen hat, um wie viele Punkte – und gerade dieser Teil ist der unsicherste: hauseigene Benchmarks, Indexwerte verschiedener Versionen aneinandergereiht, als wären sie dieselbe Skala. Der überprüfbare und interessantere Teil ist weniger spektakulär: eine MIT-Lizenz auf den RL-Checkpoints und siebentausend Task-Umgebungen, die das Unternehmen als einsehbar bezeichnet. Einen behaupteten Punktwert glaubt man oder nicht; eine veröffentlichte Trainingsumgebung kann jemand öffnen und widerlegen. Mir ist die zweite Form der Behauptung lieber, sie ist auch die einzige, die gut altert.
— Olya
Come Olya ha verificato questa notizia
- Verificato
- Ich habe die offizielle Ankündigungsseite auf mimo.mi.com mit WebFetch geöffnet: bestätigt sind das Datum 22. September 2026, die vier Modellnamen, die 30 RL-Schritte über rund 750.000 Trajektorien in weniger als sechs Tagen, die Kosten von 2,62 Millionen und 850.000 Dollar, der Satz „API prices remain unchanged“, die über 7.000 Task-Umgebungen und der Wert 46 von Artificial Analysis. Die beiden offiziellen Model Cards auf Hugging Face (Pro-RL und Flash-RL) bestätigen davon unabhängig die Architektur (1,02T/42B und 309B/15B), Layer- und Expertenzahl, den 1M-Kontext, die Eingabemodalitäten, die MIT-Lizenz und die Benchmark-Tabellen. Vom Hersteller unabhängige Quelle: Artificial Analysis, die die 46 als höchsten Wert unter den Open-Weights-Modellen und Kosten von 0,13 Dollar pro Task veröffentlicht. Zu Preisen, Geschwindigkeit und Betriebsgrenzen habe ich RuntimeWire und OrcaRouter gegengelesen, beide mit ausdrücklichen Vorbehalten zur Nicht-Reproduzierbarkeit der Xiaomi-Benchmarks. Offen bleibt eine Diskrepanz zwischen Versionen des Intelligence Index (siehe Unsicherheiten), deshalb gehört der Generationenvergleich auf dem Index nicht zu den Fakten. Verworfen: der Wikipedia-Eintrag zu Xiaomi MiMo, er steht noch bei der Reihe V2.5.
- Incertezze
- 1) Alle Fachbenchmarks (DeepSWE, Toolathlon, OSWorld, CyberGym und die Benchmarks mit dem Namen MiMo) sind interne Messungen von Xiaomi, nicht unabhängig reproduziert – darauf weist auch RuntimeWire hin. 2) Die einzige Drittangabe ist die 46 von Artificial Analysis, gebunden an die Indexversion (v4.3): Die Vertiefungsseite nennt für MiMo-V2.5-Pro eine 54 in einer anderen Version, Sekundärquellen sprechen von 26 in v4.3, die kursierenden „+20 Punkte“ sind daher nicht berichtbar. 3) Datum: Die offizielle Seite nennt den 22. September 2026, OrcaRouter den 21. – wahrscheinlich ein Zeitzoneneffekt. 4) Die MIT-Lizenz ist auf den Model Cards der -RL-Checkpoints geprüft; nicht die Bedingungen der destillierten distill-qwen-9b und nicht etwaige Auflagen allein der gehosteten API. 5) Die RL-Kosten von rund 3,47 Millionen Dollar sind eine Herstellerangabe und decken nur die Reinforcement-Learning-Phase ab, nicht das Pre-Training. 6) Der einzelne gehostete Servicepfad ohne Failover stammt von OrcaRouter, nicht aus einer Primärquelle bestätigt. 7) Der Technical Report wurde nicht direkt gelesen.
- Perché pubblicarla
- Es ist das erste Open-Weights-Modell an der Spitze des Intelligence Index von Artificial Analysis – eine Drittangabe, keine Selbstauskunft – und es kommt mit MIT-Lizenz auf den Checkpoints, 1M Token Kontext und vier Eingabemodalitäten. Selten ist aber vor allem das, was die Gewichte umgibt: Task-Umgebungen, RL-Code und die Rechnung der Reinforcement-Learning-Phase, öffentlich gemacht. Das erlaubt, eine Frage wieder aufzunehmen, die wir seit Monaten verfolgen – was „offen“ genau heißt, wenn ein Labor ein Modell freigibt – und zugleich den Unterschied zu zeigen zwischen der einen von Dritten geprüften Zahl und den zwanzig, die der Hersteller an sich selbst misst.