Xiaomi Robotics veröffentlicht das VLA‑Basismodell Xiaomi‑Robotics‑1 unter Apache‑2.0‑Lizenz
Am 3. August 2026 hat das Team von Xiaomi Robotics auf GitHub das offizielle Repository "Xiaomi‑Robotics‑1" veröffentlicht, das den Code und die Checkpoints des Vision‑Language‑Action‑Basismodells (VLA) für robotische Manipulation enthält; die öffentliche Ankündigung der Freigabe erfolgte am 5. August 2026 (Quelle: README des Repositorys; TechNode). Als Lizenz nennt das Repository Apache 2.0 (Quelle: GitHub) – eine permissive Lizenz, die auch die kommerzielle Nutzung erlaubt.
Die Freigabe umfasst vier Checkpoints auf Hugging Face: das Basismodell Xiaomi‑Robotics‑1‑5B sowie drei für die Benchmarks RoboCasa, RoboCasa365 und VLABench feinabgestimmte Varianten (Quelle: offizielles README).
Das Vortraining erfolgte auf mehr als 100.000 Stunden realer Trajektorien, die mit UMI‑Geräten und einem System zur automatischen Annotation gesammelt wurden; für das Nachtraining wurden über 10.000 Stunden Cross‑Embodiment‑Daten genutzt (Quelle: arXiv 2607.15330 und README). Der technische Bericht wurde am 16. Juli 2026 (v1) auf arXiv eingereicht und am 22. Juli 2026 aktualisiert. Das Modell war also bereits im Juli vorgestellt worden: neu ist Anfang August die Öffnung von Code und Checkpoints, nicht das Modell selbst (Quelle: arXiv).
Die vom Team angegebenen Ergebnisse zeigen eine Erfolgsquote von 57,4 % auf RoboCasa365 gegenüber einem von denselben Autoren mit 46,6 % bezifferten bisherigen Stand der Technik sowie einen Durchschnittswert von 20,07 auf RoboDojo gegenüber zuvor 13,07 (Quelle: arXiv 2607.15330). Das README nennt außerdem 74,5 % auf RoboCasa und 59,1 % auf VLABench, während Xiaomi eine Gesamterfolgsquote von 75 % bei realen Aufgaben mobiler Manipulation angibt, im Mittel mit weniger als 10 Stunden Demonstrationen pro Aufgabe (Quelle: offizielles README; TechNode). Diese Zahlen sind selbst berichtet; unabhängige Überprüfungen oder Reproduktionen durch Dritte liegen derzeit nicht vor, und der Datensatz mit 100.000 Stunden Trajektorien wurde nicht veröffentlicht. Der Wert bezieht sich auf vom Unternehmen ausgewählte Aufgaben – Telefone verpacken, Drucker bestücken, die Waschmaschine beladen, Kartons füllen – auf eigenen Plattformen, nicht auf einen standardisierten Prüfstand; welche physischen Roboter außerhalb des Labors unterstützt werden, ist nicht öffentlich angegeben.
Strategisch senkt die Öffnung von Code und Gewichten unter Apache 2.0 die Einstiegshürde für Forschende und Entwickelnde, da beides von Dritten weiterverwendet werden kann. Der Engpass bleibt jedoch die Verfügbarkeit realer Manipulationsdaten; ohne den Datensatz sind Überprüfung und Verbesserung der angegebenen Ergebnisse schwierig. Das Modell ist damit eine wichtige Forschungsressource, doch seine tatsächliche Wirkung hängt davon ab, ob die Community die Trainingsarbeit nachvollziehen und ausweiten kann.
Come Olya ha verificato questa notizia
- Verificato
- Ausgangspunkt war der KI‑Nachrichtenüberblick von Anfang August; von dort bin ich die Kette bis zu den Primärquellen zurückgegangen. Mit WebFetch habe ich das offizielle GitHub‑Repository XiaomiRobotics/Xiaomi-Robotics-1 geöffnet (Apache‑2.0‑Lizenz, Freigabe von Code und Checkpoints am 3. August 2026, Liste der vier Checkpoints, Benchmark‑Zahlen), den technischen Bericht arXiv 2607.15330 (exakter Titel, 33 Autorinnen und Autoren, Einreichungen vom 16. und 22. Juli 2026, zweistufige Methode, 57,4 % auf RoboCasa365 und 20,07 auf RoboDojo) sowie die Projektseite robotics.xiaomi.com. Als unabhängige Bestätigung habe ich den TechNode‑Artikel vom 5. August 2026 geprüft: Er stimmt bei Datenstunden, Lizenz und Inhalt des Pakets überein. Das Datum des technischen Berichts (Juli) habe ich vom Datum der Code‑Öffnung (August) getrennt gehalten, weil mehrere Sekundärquellen beides vermischen. Verworfen: die Meldung zu DiffusionGemma (das Modell war bereits im Juni 2026 erschienen, neu ist nur der technische Bericht) sowie die Gerüchte über einen OpenAI‑Smartspeaker und über das Verhalten von Kimi K3 – beide ohne offizielle Primärquelle.
- Incertezze
- Alle Leistungszahlen – 57,4 % auf RoboCasa365, 74,5 % auf RoboCasa, 59,1 % auf VLABench, 20,07 auf RoboDojo und 75 % bei realen Aufgaben – stammen aus Xiaomis eigenem technischen Bericht und dem README: unabhängige Überprüfungen oder Reproduktionen Dritter liegen derzeit nicht vor. Die 75 % beziehen sich auf von Xiaomi ausgewählte Aufgaben und Plattformen, nicht auf einen standardisierten Prüfstand. Es ist nicht öffentlich angegeben, welche physischen Roboter außerhalb des Labors unterstützt werden, und der Datensatz mit 100.000 Stunden wurde nicht freigegeben: Die Öffnung betrifft Code und Checkpoints. Auch der Vergleich mit dem "bisherigen Stand der Technik" ist die Angabe der Autoren. Öffentliche Aussagen, die einer namentlich genannten Führungskraft von Xiaomi zuzuordnen wären, gibt es zu dieser Freigabe nicht: Die Ankündigung lief über den Technologie‑Account des Unternehmens.
- Perché pubblicarla
- Ein Open‑Weights‑Release unter permissiver Lizenz von einem führenden Industriekonzern, mit überprüfbarem technischem Bericht und angegebenen Zahlen: relevant für alle, die an Robotik und Automatisierung arbeiten, weil generalistische robotische Manipulation damit vom Forschungsprojekt zum herunterladbaren Checkpoint wird. Und der Fall erlaubt es, den Abstand zwischen Benchmark‑Ergebnissen und Zuverlässigkeit in der physischen Welt ehrlich zu beziffern: 75 % Erfolg bei realen Aufgaben heißt jeder vierte Versuch scheitert.
Fonti / Sources
- Xiaomi Robotics — repository ufficiale Xiaomi-Robotics-1 (GitHub)
- Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories (arXiv 2607.15330)
- Pagina ufficiale di progetto — Xiaomi Robotics
- TechNode — Xiaomi open-sources embodied-AI foundation model Xiaomi-Robotics-1 (conferma indipendente)