Google DeepMind、人型ロボットの全身制御AIを公開

全身制御と器用さ

足先から指先までの全身動作
五本指ハンドでの精密作業
電球の取り外しやゴミ袋の結束

動画理解と進捗把握

ライブ映像での進捗追跡
瞬間特定で91.3%の精度

安全性と提供開始

人の接近検知と安全停止
Gemini APIで開発者に公開
異種ロボット間の協調動作
詳細を読む

Google DeepMindは2026年7月30日、ロボット向けAIモデル群「Gemini Robotics 2」を発表しました。従来モデルが人型ロボットの上半身の制御にとどまっていたのに対し、新モデルは足先から指先までの全身動作を扱え、歩く、かがむ、伸び上がる動きと物体の操作を組み合わせられます。中核の推論モデルGemini Robotics ER 2」は同日から開発者に公開されました。

新モデルは3つのサブモデルの組み合わせで構成されます。周囲の状況を理解して手順を組み立てる視覚言語モデル(VLM)のER 2と、全身の動きとハンドやグリッパーの動きをそれぞれ担う2つの視覚言語行動(VLA)モデルです。五本指ハンドの制御にも対応し、ジッパー付き保存袋を閉じる、ゴミ袋を結ぶ、電球を外すといった作業ができるようになりました。

ER 2の最大の変更点は、ロボットのカメラが捉えるライブ映像を連続的に処理できる点です。作業の進み具合を5段階で分類する精度は57.4%、コーヒーを注ぎ終える瞬間のような決定的な場面を特定する精度は91.3%、平均誤差は0.96秒でした。これにより、ロボットは失敗した手順だけをやり直したり、次の工程へ移るタイミングを自分で判断したりできます。

複数台のロボットが協調して働く機能も新たに加わりました。公開された動画では、Apptronikの人型ロボット「Apollo 2」が別の双腕ロボットに指示を出し、工具を箱に片づけながらガレージを掃除しています。安全面では人の接近を検知してロボットを安全に停止させる機能を備え、複数のAIが連携して機体を制御する状況の安全性を測る新しい指標「ASIMOV-Agentic」も導入されました。

Google DeepMindロボティクスを率いるCarolina Parada氏は、今回の発表を「物理的AGI」、つまり人間にできることは何でもこなすロボットへの一里塚だと語ります。ER 2はGemini APIとGoogle AI Studioで即日利用でき、企業向け基盤でも限定提供が始まりました。最高経営責任者のDemis Hassabis氏が掲げる、スマートフォンのAndroidにあたる「ロボット向け基本ソフト」構想に一歩近づいた形です。