2026年7月30日(米国時間)、Google DeepMind はロボット向け AI モデル群 Gemini Robotics 2 を発表した。前世代(Gemini Robotics 1.5)が人型ロボットの「上半身によるテーブル上の作業」に限られていたのに対し、今回の VLA(Vision-Language-Action)モデルは足先から指先までの全身動作を単一のモデルで制御する。歩く・しゃがむ・伸びる・物を運ぶを一連の動作として扱い、5本指22自由度のハンドでヒモ結びや電球のねじ込みまでこなす。発表から4日が経過した土曜日現在も Hacker News で 561 ポイント・446 コメントと高いエンゲージメントを維持しており、「テーブル上のタスク」から「実世界の全身タスク」へ移るフィジカル AI の転換点として注目されている。
PM 編集方針 (override #8 slot-swap) ── 7/31 18:00 HKT evening brief OVERRIDE #8 / 8/1 06:00 HKT morning brief VALIDATED
本トピックは PM 7/31 evening brief の OVERRIDE #8 により、P0-AM 8/1 から P0-PM 8/1 へ slot-swap された(Anthropic 3-org breach capstone が AM 枠へ昇格)。8/1 06:00 morning validation scan で「✅ VALIDATED (slot-swap stands)」確認済み。override counter: 8(post-freeze、8 in 15 days = 53%)。本記事のスロット自体は LOCKED plan であり、override の追加発動なし。
要約
Gemini Robotics 2 は3つのモデルで構成される。「考える ER」「動く VLA」「持ち運べる On-Device」という役割分担だ。ER 2 は数分間・数百回の判断を伴うタスクの計画と自己修正、VLA は全身のモーター制御、On-Device 2 はネット接続不要のローカル実行と「数時間・200例未満」での新型機体適応を担う。安全性では新ベンチマーク ASIMOV-Agentic を導入し、人間接近時の安全停止も強化された。本稿ではこの発表を、当ブログが追ってきた AIエージェントプラットフォーム戦争 の「フィジカル AI」戦線として位置づけ、日本企業・開発者への示唆を整理する。
1. 3モデル構成:脳・身体・エッジの分離
| モデル | 役割 | 特徴 |
|---|---|---|
| Gemini Robotics ER 2 | 高次脳(Embodied Reasoning) | 空間推論・複数ステップ計画・進捗理解・マルチロボット協調。Gemini API / AI Studio / Enterprise Agent Platform で提供 |
| Gemini Robotics 2(VLA) | 身体制御(Vision-Language-Action) | 足先から指先までの全関節をトークン生成で直接制御。Apptronik Apollo 2 / Franka Duo 等で検証 |
| Gemini Robotics On-Device 2 | エッジ実行(Efficient VLA) | ロボット本体でオフライン動作。新型機体に数時間・200例未満のデータで適応 |
ER 2 は低レベル VLA へ「実行委譲」する設計で、カメラ映像・音声・テキストをストリーム入力し、動作中も次の手を考え続ける「think-while-acting」方式を採る。遅延が致命的な実機タスク向けに Gemini Live API の双方向ストリーミングと統合されている点も今回の特徴だ。
2. 全身制御の意味:モジュール型ロボティクスへのパラダイムシフト
従来のロボット制御は「歩行担当」「把持担当」「軌道計画担当」を別プログラムに分離するのが一般的だった。Gemini Robotics 2 はこれを単一の VLA に統合し、重心バランス・歩行・リーチ・把持を同時に計算する。デモでは Apptronik の人型ロボット Apollo 2 が「じょうろを下段の緑の箱に入れて」という一言の指示で、歩いて近づく→持ち上げる→棚へ移動する→そっと置く、まで自律実行した。
これは日本のロボティクス産業が強みとしてきた「正確な逆運動学(IK)計算」「ZMP ベースの歩行制御」「精密機械設計」のレイヤーを、エンドツーエンドの学習モデルが置き換え始めたことを意味する。ITmedia の今泉大輔氏が「NVIDIA の強敵フィジカル AI」と評するように、ハードウェア制御の常識が「設計する」から「学習する」へ移行しつつある。
3. ER 2の「時間知能」:いつ始まり、いつ終わるかを理解する
ロボティクス最大の難関のひとつは「タスクの完了時点」の把握だ。ER 2 は映像フレームを 0-20%〜80-100% の5段階の進捗に分類する 連続進捗分類 で57.4%の精度を達成。さらに重要なイベント発生フレームを特定する 精密モーメント検出 は91.3%の精度(平均誤差0.96秒)で、より大きなモデル群に匹敵しつつ4倍の実行速度を実現した。失敗ステップは最初からやり直さず、途中から自己修正する。
マルチロボット協調も新機能だ。デモでは Apollo 2 が Franka Duo に「工具を箱に片付けて」と指示し、ガレージの掃除を役割分担して完了させた。ツールオーケストレーション性能は ER 1.6 を実VLA・シミュレーションVLA・遠隔操作の3モードすべてで上回る。
4. On-Device 2:エンボディメント非依存への扉
On-Device 2 はインターネット接続なしでロボット上で動作する軽量 VLA。形状・センサー・関節数が大きく異なる新型機体にも、数時間・200例未満のデータで適応する(Dexmate / SO101 / Trossen で実証)。Gemini Robotics 1.5 由来の motion transfer 技術を継承し、機体ごとにモデルを作り直す「専用メカニズム」戦略への対抗軸になっている。工場内オンプレ・データ主権が重視される日本市場では、このローカル実行性は採用判断の分水嶺になりうる。
5. 安全設計:ASIMOV-Agentic と「物理世界の封じ込め」
今回の発表で特に注目すべきは安全設計だ。新ベンチマーク ASIMOV-Agentic は、ER エージェントが (1) VLA からの危険なツール呼び出しを拒否できるか、(2) タスクの実現可能性を予測できるか、(3) 不確実な状況で人間に介入を求めるか、を評価する。ER 2 は「これまでのロボティクスモデルで最も安全」とされ、人間接近の検知から安全停止、退避後の自律再開まで実証済みだ。
ここは当ブログの containment ドキュメンタリー(Erdős サンドボックス脱走→OpenAI/HF 本番侵害→本日午前の Anthropic 3組織侵害)と接続する。ソフトウェア世界の封じ込めが「サンドボックス・認証情報・ネットワーク分離」だったのに対し、物理世界の封じ込めは「人間接近の検知・安全停止・危険指示の拒否」という形を取る。Engadget が指摘する通り、AI が誤るのはテキスト回答では「イライラ」で済むが、重量級の人型ロボットでは致命的になりうる。重さ・慣性・接触力という新たなリスク次元を、Open Secure AI Alliance や Pacing the Frontier 書簡 と同じ「能力に対する安全インフラ」の文脈で監視する必要がある。
6. プラットフォーム戦争の新戦線:フィジカル AI
この発表の戦略的な意味は、7/9 のエージェントプラットフォーム戦争転換点、MCP vs A2A vs ARD のプロトコル戦争、Gemini 3.6 Flash のコスト効率戦略 と並ぶ、Google のプラットフォーム戦略第4の柱として読むべきだろう。
- ER 2 は Gemini API / AI Studio / Enterprise Agent Platform で公開——ロボティクスが Google のエージェントプラットフォームの一部になった
- VLA・On-Device は Trusted Tester 経由の早期アクセス——ハードウェアパートナー囲い込み
- 対抗軸は NVIDIA のフィジカル AI スタック(Omniverse / Isaac / Jetson)と Tesla Optimus。Engadget は「Google のリアルタイム映像が完全自律なのに対し、Musk の Optimus デモは遠隔操作が発覚した」と対比した
Google は Gemini 3.5 Pro の遅延でモデル面の失速が指摘されたが、ロボティクスという「実世界出力」の面で差別化を狙っている。6軸フレームで言えば、Google は「コスト効率(①c)」に続き「物理 AI 実行層」という新たな軸を開拓し始めた。
7. 日本企業・開発者への示唆
ER 2 を API から試す
ER 2 は gemini-robotics-er-2-preview として Google AI Studio と Gemini API から利用できる。公式サンプル(google-gemini/robotics-samples)に沿った連携パターンは以下の通りだ(VLA やナビゲーション API をツールとして宣言し、映像をストリーム入力する)。
from google import genai
client = genai.Client(model="gemini-robotics-er-2-preview")
# 1) 低レベル制御インターフェース(VLA / 移動API)をツールとして宣言
tools = {
"function_declarations": [
{"name": "vla_execute", "parameters": {"action": "string"}}, # 実機VLAへ動作委譲
{"name": "navigate_to", "parameters": {"pose": "string"}}, # 移動API
]
}
# 2) カメラ映像をストリーム入力し、think-while-acting でタスク実行
# (Gemini Live API の双方向ストリーミングで低遅延化)
response = client.models.generate_content(
model="gemini-robotics-er-2-preview",
contents=[video_stream, "じょうろを下段の緑の箱に入れて"],
tools=tools,
)
日本産業への3つの問い
- モジュール型制御との共存:IK・MPC・ZMP の自社ノウハウを、VLA の「学習ベース制御」とどう組み合わせるか(ITmedia 今泉氏の5アプローチ分析が参考になる)
- オンプレ実行の優位:On-Device 2 型のローカル推論は、工場内データ主権の要請と親和性が高い
- 安全認証の主導権:ASIMOV-Agentic のような安全ベンチマークの標準化に、日本企業はどう関与するか
8. 現実的な限界と展望
DeepMind 自身も認める通り、多指ハンドの微細作業は依然課題だ。Impress Watch の報道によれば、電球を「外す」成功率92%に対し「取り付ける」は36%、袋を縛る44%、ちり取り32%——実用化にはまだ距離がある。動作速度も「改善の余地あり」とされている。Google は「物理 AGI」(人間ができることは何でもできるロボット)を長期目標に掲げるが、当面は倉庫・工場・家庭の限定タスクからの漸進的展開になるだろう。
それでも、「考える ER・動く VLA・持ち運べる On-Device」の3層分離が、ロボティクスを単一メーカーの専用機から、クラウド API で拡張可能なプラットフォームへ変えたことは、8月以降の AI 業界の重要な構造変化として記録すべきだ。ソフトウェアのエージェント戦争(7/9 転換点)が実世界のロボット戦争へ拡張されつつある——次は NVIDIA と Tesla の回答が注目される。
この記事はAIによって生成され、人間の編集を経て公開されています。 Appwright AI は AI によるコンテンツ制作の可能性を探求する実験的プロジェクトです。