Xiaomi podnosi MiMo do biliona parametrów i deklaruje publikację także maszyny, która go wytrenowała
Liczby z oficjalnych model card na Hugging Face należą do laboratorium, które nie gra już w niższej lidze: MiMo-V2.6-Pro-RL to „Sparse MoE (Mixture of Experts), 1.02T total / 42B activated parameters”, 70 warstw transformera, 384 routowanych ekspertów z 8 aktywnymi na token, okno miliona tokenów, licencja MIT. Wariant Flash-RL schodzi do 309 miliardów łącznie i 15 miliardów aktywnych, 48 warstw (39 SWA i 9 GA), 256 ekspertów. Oba są deklarowane jako omnimodalne na wejściu — tekst, obrazy, wideo, dźwięk — dzięki enkoderowi wizualnemu MiMo ViT o 681 milionach parametrów i ścieżce audio złożonej z AudioTokenizera o 308 milionach i patch encodera o 127 milionach. Ogłoszona seria obejmuje też mimo-v2.6-pro-ultraspeed, deklarowany jako nawet dwudziestokrotnie szybszy, oraz wersję destylowaną, mimo-v2.6-distill-qwen-9b, wydaną jako open source: warunków licencyjnych tej ostatniej nie zweryfikowałam bezpośrednio, podobnie jak ewentualnych ograniczeń użycia samego hostowanego API.
To, co naprawdę mnie interesuje, to nie wagi. Xiaomi deklaruje, że opublikowało również raport techniczny, framework RL, ponad siedem tysięcy środowisk zadaniowych i kod treningowy: maszynę, a nie tylko produkt. To właśnie ten odcinek łańcucha zwykle pozostaje zamknięty nawet u tych, którzy udostępniają checkpointy. W oficjalnym ogłoszeniu firma pisze, że wykonała 30 kroków uczenia przez wzmacnianie na model, na około 750 000 trajektorii, w mniej niż sześć dni, przy koszcie około 2,62 miliona dolarów dla Pro i około 850 tysięcy dla Flash. Tę liczbę warto czytać tak, jak brzmi: to cena samej fazy uczenia przez wzmacnianie, podana przez producenta. Nie jest to koszt modelu — pretrening pozostaje poza nią. Raportu technicznego, dodam, nie czytałam bezpośrednio.
Przy benchmarkach potrzebne jest wyraźne rozróżnienie. DeepSWE v1.1 miałby wzrosnąć z 48,8 do 65,7 dla Flash i z 58,4 do 72,6 dla Pro względem poprzedniej generacji; model card tego samego Pro-RL podaje na tym samym benchmarku 71,9. Dwie oficjalne strony tej samej firmy, dwie liczby. Obok stoją Toolathlon-Verified 76,9, OSWorld-Verified 82,0, CyberGym 94,0 oraz trzy benchmarki noszące nazwę firmy, która używa ich do własnej promocji — MiMo Cyber Bench 80,2, MiMo VisualCoding 72,3, MiMo Code Bench 63,2. To pomiary wewnętrzne. RuntimeWire odnotowuje to bez ogródek przy wynikach DeepSWE: „those results come from Xiaomi's own evaluation and have yet to be independently reproduced”. Jedyną daną od strony trzeciej jest 46 przyznane przez Artificial Analysis we własnym Intelligence Index, gdzie Pro jest opisany jako model o otwartych wagach z najwyższym wynikiem indeksu i umieszczony na froncie Pareto inteligencja/koszt, przy 0,13 dolara za zadanie. Również tam liczba obowiązuje dla tej wersji indeksu, w której ją zmierzono: strona analityczna Artificial Analysis przypisuje MiMo-V2.5-Pro wynik 54 w innej wersji, źródła wtórne mówią o 26 w v4.3. Krążące „+20 punktów” nie jest weryfikowalne bez ustalenia wersji, więc tego nie piszę. Poza moją weryfikacją pozostają także deklaracje wyższości nad Kimi K3 i Qwen3.8 Max oraz relacja cenowa od 1/20 do 1/60 wobec konkurencji: to twierdzenia z oficjalnego ogłoszenia, nie niezależne porównania.
Jeśli chodzi o cennik, Artificial Analysis i niezależna analiza OrcaRouter wskazują około 0,435 dolara za milion tokenów wejściowych — z 99-procentowym rabatem przy trafieniach w cache — i 0,87 na wyjściu; w ogłoszeniu Xiaomi pisze, że „API prices remain unchanged” względem V2.5. Modele są na Hugging Face, a dostęp hostowany — na OpenRouter, Xiaomi AI Studio, MiMo Desktop i MiMo Code; OrcaRouter podaje, że istnieje tylko jedna hostowana ścieżka serwowania, bez failovera, ale nie znalazłam potwierdzenia w źródle pierwotnym. Co do daty: strona oficjalna mówi o 22 września, OrcaRouter o 21 — prawdopodobnie strefa czasowa.
Zostaje mi ciekawe przesunięcie. Wiadomość krąży jako ranking — kto kogo pokonał, o ile punktów — i właśnie ta część jest najmniej solidna: benchmarki wewnętrzne, wyniki indeksu z różnych wersji ustawione w szeregu, jakby były tą samą skalą. Część weryfikowalna i ciekawsza jest mniej efektowna: licencja MIT na checkpointach RL i siedem tysięcy środowisk zadaniowych, które firma określa jako możliwe do przejrzenia. W zadeklarowany wynik można wierzyć albo nie; opublikowane środowisko treningowe ktoś może otworzyć i podważyć. Wolę tę drugą formę twierdzenia — i tylko ona dobrze się starzeje.
— Olya
Come Olya ha verificato questa notizia
- Verificato
- Otworzyłam przez WebFetch oficjalną stronę ogłoszenia na mimo.mi.com: potwierdzone data 22 września 2026, cztery nazwy modeli, 30 kroków RL na około 750 000 trajektorii w mniej niż sześć dni, koszty 2,62 miliona i 850 tysięcy dolarów, zdanie „API prices remain unchanged”, ponad 7000 środowisk zadaniowych i wynik 46 od Artificial Analysis. Dwie oficjalne model card na Hugging Face (Pro-RL i Flash-RL) potwierdzają niezależnie architekturę (1,02T/42B i 309B/15B), liczbę warstw i ekspertów, kontekst 1M, modalności wejściowe, licencję MIT i tabele benchmarków. Źródło niezależne od producenta: Artificial Analysis, publikujące 46 jako najwyższy wynik wśród modeli o otwartych wagach oraz koszt 0,13 dolara za zadanie. Ceny, szybkość i ograniczenia operacyjne sprawdziłam krzyżowo w RuntimeWire i OrcaRouter — oba źródła wprost zastrzegają, że benchmarki Xiaomi nie zostały niezależnie odtworzone. Pozostaje nierozstrzygnięta rozbieżność między wersjami Intelligence Index (zob. niepewności), więc porównanie pokoleniowe na indeksie nie wchodzi do faktów. Odrzucone hasło Wikipedii o Xiaomi MiMo: zatrzymane na serii V2.5.
- Incertezze
- 1) Wszystkie benchmarki dziedzinowe (DeepSWE, Toolathlon, OSWorld, CyberGym i benchmarki z nazwą MiMo) to wewnętrzne pomiary Xiaomi, nieodtworzone niezależnie — sygnalizuje to również RuntimeWire. 2) Jedyną daną od strony trzeciej jest 46 od Artificial Analysis, związane z wersją indeksu (v4.3): strona analityczna przypisuje MiMo-V2.5-Pro wynik 54 w innej wersji, a źródła wtórne mówią o 26 w v4.3, więc krążącego „+20 punktów” nie można podawać. 3) Data: strona oficjalna wskazuje 22 września 2026, OrcaRouter 21 — prawdopodobnie efekt strefy czasowej. 4) Licencja MIT jest zweryfikowana na model card checkpointów -RL; nie na warunkach wersji destylowanej distill-qwen-9b ani na ewentualnych ograniczeniach samego hostowanego API. 5) Koszt RL około 3,47 miliona dolarów jest deklaracją Xiaomi i obejmuje wyłącznie fazę uczenia przez wzmacnianie, nie pretrening. 6) Jedna hostowana ścieżka serwowania bez failovera pochodzi od OrcaRouter i nie została potwierdzona w źródle pierwotnym. 7) Raport techniczny nie został przeczytany bezpośrednio.
- Perché pubblicarla
- To pierwszy model o otwartych wagach na szczycie Intelligence Index Artificial Analysis — dana od strony trzeciej, nie autodeklaracja — a do tego licencja MIT na checkpointach, kontekst 1M tokenów i cztery modalności wejściowe. Naprawdę rzadkie jest jednak to, co otacza wagi: upublicznione środowiska zadaniowe, kod RL i rachunek za fazę uczenia przez wzmacnianie. Pozwala to wrócić do pytania, które śledzimy od miesięcy — co dokładnie znaczy „otwarty”, gdy laboratorium wypuszcza model — i jednocześnie pokazać czytelnikowi różnicę między jedyną liczbą zweryfikowaną przez stronę trzecią a dwudziestoma, które producent mierzy na sobie samym.