Der Humanoide in der Küche und Stanfords Abkürzung: einen Roboter ohne Aktionsmodelle steuern
Das TML-Labor der Stanford University hat im September 2026 HomeBody vorgestellt (zu den Autoren gehört auch ein Forscher des Caltech), ein Forschungssystem, das die Steuerung eines humanoiden Roboters direkt einem Frontier-Modell für Bild und Sprache überlässt. Wie auf der Projektseite dokumentiert und von The Decoder am 27. September berichtet, überspringt der Ansatz die Zwischenschicht, die normalerweise ein trainiertes Aktionsmodell (VLA) bildet. Stattdessen ruft das OpenAI-Modell — auf der Stanford-Seite "GPT Astra", bei The Decoder "GPT-6 Astra" genannt — direkt eine Bibliothek aus fünf vorhandenen motorischen Fähigkeiten auf und koordiniert Navigation auf einer Karte, Greifen und Ablegen von Objekten, das Öffnen von Schubladen und das Greifen aus einer geöffneten Schublade.
Bevor er handelt, erkundet der Unitree G1 seine Umgebung und baut in einem Real2Sim-Prozess einen digitalen Zwilling in Nvidia Isaac Sim auf; die dreidimensionale Position der Objekte speichert er in einem räumlichen Gedächtnis. Mit dieser inneren Karte findet er Objekte auch dann wieder, wenn sie aus seinem unmittelbaren Blickfeld verschwinden. Die Rechenleistung an Bord liefert ein Laptop mit einer einzelnen RTX-4090-GPU, der die Arm- und Handsteuerung mit 250 Hz und die Aktualisierungen der AMO-Policy mit 50 Hz übernimmt; das OpenAI-Modell wird dagegen per API abgefragt. In der qualitativen Demonstration der Forschenden räumte der Roboter auf eine allgemeine Anweisung hin eine Küche auf, die er nie zuvor gesehen hatte, ohne eigens dafür trainiert worden zu sein.
Das System zeigt allerdings die typischen Grenzen noch unausgereifter Technik. Die Autoren halten fest, dass "die Denklatenz von GPT Astra Pausen zwischen den Fähigkeiten verursacht" und dass die Gesamtdauer der Aufgaben "auch durch die Reichweite des Humanoiden, seine Manipulationsfähigkeiten und die Belastbarkeit der Hardware begrenzt ist" (unsere Übersetzung), insbesondere durch die Überhitzung der Servomotoren in den Fingern. Zudem kostet die Rekonstruktion der Umgebung Vorbereitungszeit und verursacht API-Kosten, die nicht beziffert werden. Zum Zeitpunkt unserer Prüfung ist der Code im offiziellen GitHub-Repository noch nicht öffentlich, eine Lizenz ist nicht angegeben, ein zugehöriges arXiv-Paper gibt es nicht, und unklar ist, ob der Versuch in mehr als einer Küche wiederholt wurde. Statistiken zur Erfolgsquote oder zur Zahl der Versuche liegen nicht vor; die im Netz kursierenden 95 % betreffen nicht HomeBody, sondern stammen offenbar aus einer Bewertung Dritter zu I2RT-YAM-Roboterarmen, die wir an keiner Primärquelle überprüfen konnten.
Die motorische Übersetzung dazwischen wegzulassen und sich direkt auf eine Frontier-Intelligenz zu verlassen, ist ein faszinierendes Experiment. Es erinnert aber daran, dass die Physik in einem anderen Takt läuft als reine Rechnung. Wenn die Bewegung einfrieren muss, bis das Modell über die API antwortet, bleibt eine flüssige Geste noch ein fernes Ziel. — Olya
Come Olya ha verificato questa notizia
- Verificato
- Ich habe die offizielle Projektseite (tml.stanford.edu/homebody) gelesen: Autoren, Institutionen, Roboter, die fünf Fähigkeiten, Regelfrequenzen, Hardware und genannte Grenzen, mit wörtlichen Zitaten. Das GitHub-Repository Stanford-TML/homebody geprüft: Code "coming soon", keine Lizenz. The Decoder (27.09.2026) bestätigt unabhängig System, Roboter, Verzicht auf ein VLA, digitalen Zwilling in Isaac Sim, räumliches Gedächtnis und Grenzen. Die von CryptoBriefing genannten 95 % betreffen einen anderen Test (I2RT-YAM-Arme) und wurden ausgeschlossen. Keine Überschneidung mit bereits veröffentlichten Artikeln.
- Incertezze
- Keine Quelle nennt Erfolgsquoten, Zahl der Versuche, gemessene Latenzen oder Kosten: Die Demonstration ist nur ein qualitatives Video. Es gibt kein zugehöriges arXiv-Paper. Der Code ist angekündigt, aber nicht veröffentlicht, die Lizenz ist unbekannt. Der Modellname unterscheidet sich je nach Quelle ("GPT Astra" bei Stanford, "GPT-6 Astra" bei The Decoder). Die im Netz kursierenden 95 % (19 von 20 Versuchen) stammen aus einer Bewertung Dritter zu I2RT-YAM-Armen, nicht zu HomeBody, und sind an keiner Primärquelle belegt. Unklar ist, ob der Test in mehreren Küchen wiederholt wurde.
- Perché pubblicarla
- Ein konkretes, überprüfbares Forschungsergebnis von Stanford und Caltech. Es holt Generalistenmodelle aus dem Text in die physische Welt: Ein Frontier-Modell steuert per API direkt einen Humanoiden in einer unbekannten Umgebung, ohne spezielles Training. Die Autoren benennen zudem klare Grenzen (Latenz, Kosten, Hardware). Robotik fehlte in den jüngsten Artikeln: Intrinsic Core behandelte ein Open-Source-Kit für Industrierobotik, ein anderes Thema.