Google DeepMind は 7 月 30 日、ロボット制御用の基盤モデル群「Gemini Robotics 2」を発表した。従来モデルが主に上半身操作に留まっていたのに対し、今回のリリースでは足先から指先までを含む全身制御に踏み込み、複数ロボットの協調動作も対象となる。
主なポイント
- 3 つのモデルで構成: 最上位の Vision-Language-Action モデル「Gemini Robotics 2」、身体化推論を担う「Gemini Robotics ER 2」、ロボット本体で動作する軽量版「Gemini Robotics On-Device 2」。
- 全身の重心バランスを動的に制御でき、静止姿勢からの手伸ばしに留まらず、しゃがむ・かがむ・またぐといった動作で乱雑な環境を移動できる。
- ER 2 はマルチステップのタスク計画・進捗モニタリング・人とロボット間の対話に加え、複数機体間の協調を扱えるエージェント型モデルと位置付けられる。
- On-Device 2 はロボット筐体上で動作し、数時間分のデモンストレーションで新しい機体構成に適応できるとされる。
- 発表と同時にモデルカードとアクセス階層が公開され、パートナー企業や研究者向けに段階的な提供が始まっている。
出典: Gemini Robotics 2 brings whole body intelligence to robots