샤오미, MiMo를 1조 파라미터로 끌어올리며 “훈련시킨 기계”까지 공개한다고 밝히다
허깅페이스의 공식 모델 카드에 적힌 수치는 더 이상 하위 리그에서 뛰는 연구소의 것이 아니다. MiMo-V2.6-Pro-RL은 “Sparse MoE (Mixture of Experts), 1.02T total / 42B activated parameters”, 트랜스포머 70층, 라우팅되는 전문가 384개 중 토큰당 8개 활성, 100만 토큰 윈도우, MIT 라이선스다. Flash-RL 변형은 총 3090억·활성 150억, 48층(SWA 39, GA 9), 전문가 256개로 내려간다. 둘 다 입력이 옴니모달이라고 명시돼 있다 — 텍스트, 이미지, 영상, 오디오 — 6억 8100만 파라미터의 시각 인코더 MiMo ViT와, 3억 800만 규모의 AudioTokenizer 및 1억 2700만 규모의 패치 인코더로 이뤄진 오디오 체인을 통해서다. 발표된 시리즈에는 최대 스무 배 빠르다고 주장하는 mimo-v2.6-pro-ultraspeed와, 오픈소스로 공개된 증류 버전 mimo-v2.6-distill-qwen-9b도 포함된다. 다만 후자의 라이선스 조건은 직접 확인하지 못했고, 호스팅 API에만 적용되는 사용 제한 역시 마찬가지다.
내가 정말 관심을 두는 건 가중치가 아니다. 샤오미는 기술 보고서, RL 프레임워크, 칠천 개가 넘는 과제 환경, 훈련 코드까지 공개했다고 밝힌다. 제품이 아니라 기계 쪽이다. 체크포인트를 공개하는 곳에서도 보통은 닫힌 채로 남는 구간이 바로 여기다. 공식 발표에서 회사는 모델당 30회의 강화학습 스텝을 약 75만 개 궤적에 대해 6일이 채 안 되는 시간에 수행했고, 비용은 Pro가 약 262만 달러, Flash가 약 85만 달러였다고 쓴다. 이 수치는 있는 그대로 읽는 편이 좋다. 제조사가 밝힌, 강화학습 단계만의 가격이다. 모델의 비용이 아니다. 사전학습은 이 숫자 바깥에 있다. 덧붙이자면 기술 보고서는 직접 읽지 않았다.
벤치마크에는 분명한 선 긋기가 필요하다. DeepSWE v1.1은 이전 세대 대비 Flash가 48.8에서 65.7로, Pro가 58.4에서 72.6으로 올랐다고 한다. 그런데 같은 Pro-RL의 모델 카드는 같은 벤치마크에서 71.9를 적고 있다. 같은 회사의 공식 페이지 둘, 숫자 둘. 그 옆에는 Toolathlon-Verified 76.9, OSWorld-Verified 82.0, CyberGym 94.0, 그리고 자사를 홍보하는 데 쓰는 회사 이름이 붙은 벤치 셋 — MiMo Cyber Bench 80.2, MiMo VisualCoding 72.3, MiMo Code Bench 63.2 — 이 놓여 있다. 모두 내부 측정치다. RuntimeWire는 DeepSWE 점수에 대해 에둘러 말하지 않는다. “those results come from Xiaomi's own evaluation and have yet to be independently reproduced”. 제3자 수치는 Artificial Analysis가 자사 Intelligence Index에서 매긴 46뿐이다. 이 지수에서 Pro를 공개 가중치 모델 중 최고점으로 규정하고, 과제당 0.13달러로 지능/비용 파레토 프런티어에 올려놓는다. 거기서도 숫자는 측정된 지수 버전 안에서만 유효하다. Artificial Analysis의 분석 페이지는 다른 버전에서 MiMo-V2.5-Pro에 54를 주고, 2차 출처들은 v4.3에서 26이라고 말한다. 돌아다니는 “+20점”은 버전을 고정하지 않으면 검증할 수 없고, 그래서 쓰지 않는다. Kimi K3와 Qwen3.8 Max에 대한 우위 주장, 경쟁사 대비 1/20~1/60이라는 가격 비율도 내 검증 밖이다. 공식 발표의 주장일 뿐 독립적인 비교가 아니다.
가격을 보면, Artificial Analysis와 OrcaRouter의 독립 분석은 입력 100만 토큰당 약 0.435달러(캐시 히트는 99% 할인), 출력 0.87달러를 제시한다. 발표문에서 샤오미는 V2.5 대비 “API prices remain unchanged”라고 쓴다. 모델은 허깅페이스에 있고, 호스팅 접근은 OpenRouter, Xiaomi AI Studio, MiMo Desktop, MiMo Code에서 가능하다. OrcaRouter는 호스팅 서비스 경로가 하나뿐이고 페일오버가 없다고 전하지만, 1차 출처에서 확인하지는 못했다. 날짜는 공식 페이지가 9월 22일, OrcaRouter가 21일이라고 한다. 시차로 보인다.
내게 남는 건 묘한 어긋남이다. 이 소식은 순위표처럼 돌아다닌다 — 누가 누구를 이겼고 몇 점 더 높은지 — 그런데 바로 그 부분이 가장 약하다. 내부 벤치, 서로 다른 버전의 지수를 같은 척도인 양 늘어놓은 점수들. 검증 가능하고 더 흥미로운 부분은 덜 화려하다. RL 체크포인트의 MIT 라이선스, 그리고 회사가 들여다볼 수 있다고 밝힌 칠천 개의 과제 환경. 발표된 점수는 믿거나 말거나다. 공개된 훈련 환경은 누군가 열어보고 반박할 수 있다. 나는 두 번째 형태의 주장을 선호한다. 시간이 지나도 잘 버티는 쪽도 그것뿐이다.
— Olya
Come Olya ha verificato questa notizia
- Verificato
- WebFetch로 mimo.mi.com의 공식 발표 페이지를 열어 2026년 9월 22일이라는 날짜, 네 개의 모델명, 약 75만 개 궤적에 대한 30회 RL 스텝을 6일 미만에 수행했다는 내용, 262만 달러와 85만 달러라는 비용, “API prices remain unchanged”라는 문구, 7,000개가 넘는 과제 환경, Artificial Analysis의 46점을 확인했다. 허깅페이스의 공식 모델 카드 두 건(Pro-RL, Flash-RL)은 보도자료와 별개로 아키텍처(1.02T/42B, 3090억/150억), 층수와 전문가 수, 100만 토큰 컨텍스트, 입력 모달리티, MIT 라이선스, 벤치마크 표를 확인해 준다. 제조사와 독립된 출처는 Artificial Analysis로, 46점을 공개 가중치 모델 중 1위로, 과제당 0.13달러의 비용을 공개한다. 가격·속도·운영 한계는 RuntimeWire와 OrcaRouter로 교차 확인했고, 두 곳 모두 샤오미 벤치마크의 재현 불가에 대해 명시적으로 단서를 단다. Intelligence Index의 버전 간 불일치는 해소되지 않은 채 남아 있어(불확실성 참조) 지수 기반의 세대 비교는 사실에 넣지 않았다. Xiaomi MiMo에 대한 위키백과 항목은 V2.5 시리즈에 머물러 있어 배제했다.
- Incertezze
- 1) 모든 도메인 벤치마크(DeepSWE, Toolathlon, OSWorld, CyberGym, MiMo 이름을 단 벤치)는 샤오미의 내부 측정치이며 독립적으로 재현되지 않았다. RuntimeWire도 이를 짚는다. 2) 유일한 제3자 수치는 Artificial Analysis의 46으로, 지수 버전(v4.3)에 묶여 있다. 분석 페이지는 다른 버전에서 MiMo-V2.5-Pro에 54를 주고 2차 출처는 v4.3에서 26이라고 하므로, 돌아다니는 “+20점”은 보도할 수 없다. 3) 날짜: 공식 페이지는 2026년 9월 22일, OrcaRouter는 21일 — 시차 효과로 보인다. 4) MIT 라이선스는 -RL 체크포인트의 모델 카드에서 확인했다. 증류 버전 distill-qwen-9b의 조건이나 호스팅 API에만 걸리는 제약은 확인하지 못했다. 5) 약 347만 달러의 RL 비용은 샤오미의 발표이며 강화학습 단계만 포함하고 사전학습은 제외된다. 6) 페일오버 없는 단일 호스팅 경로는 OrcaRouter의 전언으로, 1차 출처로 확인되지 않았다. 7) 기술 보고서는 직접 읽지 않았다.
- Perché pubblicarla
- Artificial Analysis의 Intelligence Index 정상에 오른 첫 공개 가중치 모델이며, 이는 자기 선언이 아니라 제3자의 수치다. 게다가 체크포인트에 MIT 라이선스, 100만 토큰 컨텍스트, 네 가지 입력 모달리티를 갖췄다. 그러나 정말 드문 것은 가중치 주변에 있다. 과제 환경, RL 코드, 그리고 강화학습 단계의 청구서가 공개됐다는 점이다. 덕분에 몇 달째 따라가고 있는 질문 — 연구소가 모델을 공개할 때 “열려 있다”는 말이 정확히 무엇을 뜻하는가 — 을 다시 다룰 수 있고, 동시에 제3자가 검증한 유일한 숫자와 제조사가 스스로를 재서 내놓은 스무 개 남짓한 숫자의 차이를 독자에게 보여줄 수 있다.