キッチンに立つヒューマノイドとスタンフォードの近道:行動モデルなしでロボットを動かす
スタンフォード大学のTMLラボは2026年9月、HomeBodyを発表した(著者にはカリフォルニア工科大学の研究者も名を連ねる)。ヒューマノイドロボットの操作を、フロンティア級の視覚言語モデルに直接委ねる研究用システムだ。プロジェクトページの記載と、The Decoderが9月27日に報じた内容によれば、このアプローチは通常なら学習済みの行動モデル(VLA)が担う中間層を飛ばしている。代わりにOpenAIのモデル(スタンフォードのページでは「GPT Astra」、The Decoderでは「GPT-6 Astra」と表記)が、既存の5つの動作スキルのライブラリを直接呼び出し、地図上の移動、物をつかむ・置く、引き出しを開ける、開いた引き出しから物を取る、といった動作を組み立てる。
動き出す前に、Unitree G1は周囲を探索し、real2simのプロセスでNvidia Isaac Sim上にデジタルツインを再構築する。物体の3次元位置は空間メモリに記録される。この内部地図のおかげで、物が視界から外れても取りに行ける。オンボードの計算はRTX 4090を1基載せたノートPCが担い、腕と手の制御を250Hz、AMOポリシーの更新を50Hzで処理する。一方、OpenAIのモデルにはAPI経由で問い合わせる。研究者が公開した定性的なデモでは、ロボットは大まかな指示だけで初めて見るキッチンを片付けてみせた。その環境向けの専用学習は行っていない。
とはいえ、このシステムには未成熟な技術に特有の制約もある。著者らは「GPT Astraの推論レイテンシがスキルとスキルの間に間を生む」こと、そしてタスク全体の長さが「ヒューマノイドのリーチ、操作能力、ハードウェアの耐久性によっても制限される」こと(当サイト訳)を認めており、特に指のサーボモーターの過熱を挙げている。さらに、環境の再構築には準備時間がかかり、金額の示されていないAPIコストも発生する。確認時点では、公式GitHubリポジトリのコードはまだ公開されておらず、ライセンスの記載もない。関連するarXiv論文も見当たらず、複数のキッチンで試験が繰り返されたかどうかもはっきりしない。成功率や試行回数の統計も公開されていない。ネット上で出回っている「95%」という数字はHomeBodyのものではなく、I2RT YAMロボットアームに関する第三者評価に由来するとみられ、一次情報源では確認できなかった。
中間の動作変換を省き、フロンティア級の知能に直接頼るのは魅力的な実験だ。けれども、物理の世界は純粋な計算とは違う時間で動いていることを思い出させてくれる。APIの応答を待つたびに動きが止まるのなら、なめらかな所作はまだ遠い目標だ。 — Olya
Come Olya ha verificato questa notizia
- Verificato
- 公式プロジェクトページ(tml.stanford.edu/homebody)を読み、著者、所属機関、ロボット、5つのスキル、制御周波数、ハードウェア、明記された限界を原文の引用とともに確認した。GitHubリポジトリStanford-TML/homebodyは「coming soon」でライセンスなし。The Decoder(2026年9月27日)が、システム、ロボット、VLAを使わない点、Isaac Sim上のデジタルツイン、空間メモリ、限界を独立に裏付けている。CryptoBriefingが挙げた95%は別の試験(I2RT YAMアーム)のもので、事実から除外した。既存記事との重複はない。
- Incertezze
- どの情報源にも成功率、試行回数、実測レイテンシ、コストの数字はなく、デモは定性的な動画のみ。関連するarXiv論文はない。コードは公開予定とされているが未公開で、ライセンスも不明。モデル名は情報源によって異なる(スタンフォードは「GPT Astra」、The Decoderは「GPT-6 Astra」)。ネット上の95%(20回中19回)はI2RT YAMアームに関する第三者評価の数字でHomeBodyのものではなく、一次情報源で確認できていない。複数のキッチンで試験したかどうかも不明。
- Perché pubblicarla
- スタンフォードとカリフォルニア工科大学による、具体的で検証可能な研究成果だから。汎用モデルの話をテキストから物理世界へ移すものだ:API経由のフロンティアモデルが、専用学習なしで初めての環境にいるヒューマノイドを直接動かす。著者らは限界(レイテンシ、コスト、ハードウェア)も明示している。最近の記事にロボット分野はなく、Intrinsic Coreは産業用ロボット向けオープンソースキットの話で、テーマが異なる。