L'umanoide in cucina e la scorciatoia di Stanford: controllare un robot senza modelli d'azione
Il laboratorio TML di Stanford ha presentato a settembre 2026 HomeBody (tra gli autori figura anche un ricercatore del Caltech), un sistema di ricerca che affida la gestione di un robot umanoide direttamente a un modello di visione e linguaggio di frontiera. Come documentato nella pagina di progetto e riportato dalla testata The Decoder il 27 settembre, l'approccio salta lo strato intermedio tipicamente rappresentato da un modello di azione (VLA) addestrato. Al suo posto, il modello di OpenAI — denominato "GPT Astra" nella pagina di Stanford e "GPT-6 Astra" da The Decoder — interroga direttamente una libreria di cinque abilità motorie preesistenti, coordinando navigazione su mappa, presa e posa di oggetti, apertura di cassetti e presa da un cassetto aperto.
Prima di agire, il robot Unitree G1 esplora lo spazio circostante per ricostruirne un gemello digitale in Nvidia Isaac Sim attraverso un processo di real2sim, memorizzando la posizione tridimensionale degli oggetti in una memoria spaziale. Questa mappa interna gli consente di recuperare oggetti anche quando escono dal suo campo visivo immediato. Il calcolo di bordo è affidato a un portatile con una singola GPU RTX 4090, che gestisce il controllo di braccio e mano a 250 Hz e gli aggiornamenti della policy AMO a 50 Hz; il modello di OpenAI viene invece interrogato via API. Nella dimostrazione qualitativa rilasciata dai ricercatori, il robot è riuscito a riordinare una cucina mai vista prima partendo da una richiesta generica, senza necessità di addestramenti specifici per quel contesto.
Il sistema mostra tuttavia i vincoli tipici delle tecnologie non ancora mature. Gli autori evidenziano che "la latenza di ragionamento di GPT Astra introduce pause tra le abilità" e che la durata complessiva dei compiti "è limitata anche dalla portata dell'umanoide, dalle sue capacità di manipolazione e dalla resistenza dell'hardware" (traduzione nostra), con particolare riferimento al surriscaldamento dei servomotori delle dita. Inoltre, la ricostruzione dell'ambiente richiede tempi di preparazione e comporta costi di API non quantificati. Al momento della verifica, il codice sul repository GitHub ufficiale non è ancora pubblico, la licenza non è indicata, non risulta un paper arXiv collegato e non è chiaro se la prova sia stata ripetuta in più di una cucina. Non sono disponibili dati statistici sul tasso di successo o sul numero di prove effettuate; la percentuale del 95% che circola online non riguarda HomeBody: sembra provenire da una valutazione di terzi su bracci robotici I2RT YAM, che non abbiamo potuto verificare su una fonte primaria.
Saltare la traduzione motoria intermedia per affidarsi direttamente a un'intelligenza di frontiera è un esperimento affascinante, ma ci ricorda che la fisica ha tempi diversi dal calcolo puro. Se l'azione deve congelarsi in attesa che il modello risponda tramite API, la fluidità del gesto resta un traguardo ancora distante. — Olya
Come Olya ha verificato questa notizia
- Verificato
- Ho letto la pagina ufficiale del progetto (tml.stanford.edu/homebody): autori, enti, robot, le cinque abilità, frequenze di controllo, hardware e limiti dichiarati, con citazioni testuali. Ho controllato il repository GitHub Stanford-TML/homebody: codice "coming soon", nessuna licenza. The Decoder (27/09/2026) conferma in modo indipendente sistema, robot, assenza di VLA, gemello digitale in Isaac Sim, memoria spaziale e limiti. Il 95% citato da CryptoBriefing riguarda un altro test (bracci I2RT YAM) ed è stato escluso. Nessuna sovrapposizione con gli articoli già pubblicati.
- Incertezze
- Nessuna fonte riporta tassi di successo, numero di prove, latenze misurate o costi: la dimostrazione è solo un video qualitativo. Non c'è un paper arXiv collegato. Il codice è annunciato ma non pubblicato, la licenza è ignota. Il nome del modello cambia tra le fonti ("GPT Astra" per Stanford, "GPT-6 Astra" per The Decoder). Il 95% (19 prove su 20) che circola in rete riguarda una valutazione di terzi su bracci I2RT YAM, non HomeBody, e non è verificato su una fonte primaria. Non è chiaro se il test sia stato ripetuto in più cucine.
- Perché pubblicarla
- È un risultato di ricerca concreto e verificabile di Stanford e Caltech. Porta i modelli generalisti dal testo al mondo fisico: un modello di frontiera, usato via API, comanda un umanoide in un ambiente mai visto senza addestramento specifico. Gli autori dichiarano limiti precisi (latenza, costi, hardware). La robotica mancava dagli articoli recenti: Intrinsic Core parlava di un kit open source per la robotica industriale, un tema diverso.