重點摘要
機器人大腦從「看圖說話」進化為「看影片、排任務、協調多台機器人」
ER 2 引入即時影片流分析,Moment-finding 準確率達 91.3%,任務進度五級分類達 57.4%,並支援異構機器人透過共享語意層協作。
On-Device 2 以不足 200 個示範樣本即可適應全新機器人形體,大幅壓低硬體遷移與資料採集成本。
現已透過 Gemini API 及 Google AI Studio 可取用;多指靈巧操作成功率介於 44%–92%,全身操控達 45.7%–76.3%。
前情提要
2026 年 7 月 30 日,Google DeepMind 正式發布 Gemini Robotics 2 系列,涵蓋三個核心模型:Gemini Robotics 2(視覺-語言-動作模型)、Gemini Robotics ER 2(具身推理模型)、Gemini Robotics On-Device 2(本地端高效推理)。
此次發布的核心意義在於,機器人推理模型首次從靜態截圖轉向連續影片流分析,並整合跨機器人協作能力,標誌著機器人 AI 從「工具執行層」向「任務規劃層」的實質躍升。
章節一:影片理解如何賦予機器人環境感知能力
Gemini Robotics ER 2 最核心的技術突破,在於拋棄靜態截圖分析,改為持續輸入影片串流。模型對任務完成度進行五級分類(0%–100%,每 20% 一級),在進度分類任務上達到 57.4% 準確率。
Moment-finding 能力讓機器人精確定位影片中關鍵事件發生時刻,準確率達 91.3%,平均絕對距離僅 0.96 秒,比同級模型快 4 倍。這意味著機器人能在執行過程中即時偵測失敗並自動觸發重試,而非等待人類介入。
名詞解釋
Moment-finding:在連續影片流中,自動辨識特定動作或事件精確發生時刻的能力,類似在影片中自動打「書籤」的過程。
儀器讀取能力也同步擴展至 10 種類型,含數位顯示器,使機器人能從環境中直接讀取儀器數值,無需額外感測器轉接層。
章節二:任務編排架構——從單一指令到複雜工作流
ER 2 整合 Gemini Live API 的雙向串流機制,徹底消除傳統「停頓思考」的延遲瓶頸,讓機器人能在接收感測器資料的同時,持續推理並即時輸出動作指令。這種流暢的工具呼叫鏈設計,使複雜工作流的執行效率大幅提升。
模型原生支援 VLA 模型、導航 API 等工具宣告,亦可直接呼叫 Google Search 與自定義函式。在 Boston Dynamics Spot 機器人的實際示範中,操作者僅需下達自然語言指令,ER 2 便能依序調用導航 API、夾爪操作指令等工具,自主完成取物任務,完全無需人工拆解子步驟。
章節三:多機器人協作的技術突破與挑戰
透過共享語意理解層,ER 2 讓異構機器人得以互通。實測中,Apptronik Apollo 2 人形機器人與 Franka F3 Duo 機械臂協同作業,成功完成了單一機器人無法獨立執行的複合工作流,驗證了跨形體協作的技術可行性。
然而,社群對此仍有保留。HN 用戶 siekmanj 指出,重型搬運場景仍需高速比齒輪,纜索傳動方案目前難以實現,「我們距人類水準仍有差距」。nl 則從另一視角反駁:LeRobot 在缺乏靈活手指的條件下,如今已能折疊衣物,「Bitter lesson 的精髓在於規模加資料,這種進展不容小覷」。
名詞解釋
Bitter lesson(苦澀教訓):AI 研究者 Rich Sutton 提出的觀點,認為長期來看,依賴規模化算力與資料的通用方法,總是優於依賴人類先驗知識的特化設計。
章節四:從實驗室到現實世界的部署路徑
Gemini Robotics On-Device 2 的核心賣點是極低的遷移成本:以不足 200 個示範樣本、數小時資料即可適應全新機器人形體。這直接解決了傳統機器人部署中「每換一台機器就要重新訓練」的痛點,讓同一套推理引擎能在不同硬體上快速複用。
整體系統的實測成功率跨度相當大:全身操控任務為 45.7%–76.3%,多指靈巧操作從擰燈泡 (92%) 到綁袋子 (44%) 不等,夾爪插入任務則介於 74.2%–89.6%。
安全層面,DeepMind 推出 ASIMOV-Agentic 基準測試,涵蓋環境監控、物理可行性判斷及主動尋求人類確認等評估維度;人形機器人偵測到人員靠近時,可自動觸發停止保護機制。
核心技術深挖
ER 2 的技術突破集中在三個相互強化的機制上:從靜態圖像到連續影片的感知升級、從序列呼叫到即時串流的編排革新、從同構到異構的協作擴展。三者組合起來,使機器人首次具備在動態現實環境中自主完成長時序任務的能力。
機制 1:連續影片理解 (Video Understanding Pipeline)
傳統機器人視覺依賴靜態截圖,只能在特定時刻「拍照判斷」,無法追蹤動態過程。ER 2 改為持續輸入影片串流,配合五級進度分類(57.4% 準確率)與 Moment-finding(91.3% 準確率),使機器人能即時感知任務進展,並在偵測到失敗時自動重試,無需人工介入。
機制 2:即時工具鏈編排 (Live API Orchestration)
ER 2 整合 Gemini Live API 的雙向串流,消除傳統「停頓思考」的延遲瓶頸。機器人在接收感測器資料的同時持續推理並輸出指令,可原生呼叫 VLA 模型、導航 API、Google Search 及自定義函式,構成流暢的工具呼叫鏈,讓複雜多步驟任務能以自然語言一次觸發。
機制 3:共享語意協作層 (Shared Semantic Collaboration)
異構機器人(如 Apptronik Apollo 2 人形機器人與 Franka F3 Duo 機械臂)透過共享語意理解層互通,各自負責擅長的子任務,協同完成單一機器人無法獨立執行的複合工作流。ER 2 扮演統一的任務分配大腦,無需為每個機器人個別設計通訊協定。
白話比喻
想像 ER 2 是一位同時指揮多台機器的工廠領班。他不只看靜態照片,而是持續盯著現場監控畫面;不只下達單一指令,而是根據進度即時調整工序;不只管一台機器,而是讓不同型號的機器人各司其職、協同完成任務。
工程視角
環境需求
- Gemini API 金鑰(已開放取用)或 Google AI Studio 帳號
- Gemini Enterprise Agent Platform 私有預覽資格(多機器人協作功能)
- 目標機器人硬體需支援 Gemini Robotics On-Device 2 相容介面;VLA 控制層需能接收動作向量輸出
- Python 3.10+ 或支援 Gemini API REST 呼叫的執行環境
最小 PoC
# 使用 Gemini Live API 建立機器人任務編排原型
import google.generativeai as genai
genai.configure(api_key="YOUR_GEMINI_API_KEY")
# 定義機器人工具(導航、夾爪等)
navigation_tool = genai.protos.Tool(
function_declarations=[
genai.protos.FunctionDeclaration(
name="navigate_to",
description="導航至指定座標",
parameters=genai.protos.Schema(
type=genai.protos.Type.OBJECT,
properties={
"x": genai.protos.Schema(type=genai.protos.Type.NUMBER),
"y": genai.protos.Schema(type=genai.protos.Type.NUMBER),
}
)
)
]
)
# 初始化 ER 2 會話(具身推理模型)
model = genai.GenerativeModel(
model_name="gemini-robotics-er-2",
tools=[navigation_tool]
)
chat = model.start_chat()
response = chat.send_message("前往儲物架 A3 取回紅色容器")
print(response.text)
驗測規劃
優先驗測 Moment-finding 功能:錄製 5 段機器人操作失敗影片,確認 ER 2 能正確定位失敗發生的時刻(預期誤差 < 2 秒)。接著驗測工具呼叫鏈完整性:下達複合任務指令,觀察 ER 2 是否正確序列化呼叫導航 API 與夾爪指令。
常見陷阱
- 影片串流延遲超過 1 秒時,Moment-finding 準確率會顯著下降;確保影片管道低延遲
- On-Device 2 的示範資料品質比數量重要:動作不規範的示範會導致適應效果差
- 多機器人協作功能鎖在 Enterprise Agent Platform 私有預覽,直接用公開 API 無法取得此能力
- 夾爪插入等精確操作受光線條件影響大,需在訓練環境中覆蓋不同光源變化
上線檢核清單
- 觀測:Moment-finding 平均絕對距離、任務進度分類準確率、工具呼叫鏈延遲
- 成本:Gemini API token 用量(連續影片流輸入消耗較靜態截圖高 3–5 倍)、Enterprise Platform 授權費
- 風險:ASIMOV-Agentic 安全基準評估分數、人員偵測停止保護觸發率、失敗重試次數上限設定
商業視角
競爭版圖
- 直接競品:Figure AI + OpenAI(GPT-4o 視覺)、Physical Intelligence(pi0) 、1X Technologies;均聚焦 VLA 模型,但尚無同等規模的多機器人協作層公開發布
- 間接競品:Nvidia Isaac 平台(機器人模擬與部署)、Boston Dynamics 自研 AI(Spot 生態)、ROS 2 + 開源 LLM 整合方案
護城河類型
- 生態護城河:Gemini API、Google AI Studio、Google Search 原生整合,形成從感知到知識查詢的完整閉環,競品難以短期複製
- 工程護城河:ASIMOV-Agentic 安全基準的先佔優勢,在法規收緊前建立安全評估標準話語權
定價策略
ER 2 目前透過 Gemini API 按 token 計費;Enterprise Agent Platform 處於私有預覽,定價未公開。On-Device 2 的硬體授權模式尚未明確,是否採用 SaaS 訂閱或一次性授權仍是未知數。
企業導入阻力
- 多機器人協作功能鎖在 Enterprise Platform 私有預覽,一般企業難以快速評估實際效果
- 全身操控成功率最低僅 45.7%,無法直接套用於要求高一致性的製造流程
- 現有工廠機器人多使用封閉控制系統,整合 Gemini API 需額外的介面開發成本
第二序影響
- 機器人即服務 (RaaS) 商業模式加速:On-Device 2 的低遷移成本讓「租借機器人 + 按需調整形體」成為可能
- 機器人硬體商地位弱化:當 AI 層能跨形體快速適應,純硬體差異化的護城河逐漸收窄
判決:值得密切追蹤(多機器人協作是下一個競爭核心)
技術指標顯示 ER 2 在推理層已有實質突破,但落地成功率的跨度 (44%–92%) 揭示距離大規模工業部署仍有差距。對於已有機器人採購預算的企業,建議申請 Enterprise Platform 私有預覽,在受控場景先行評估多機器人協作可行性,再決定是否全面導入。
數據與對比
影片理解
- 任務進度分類(五級):57.4% 準確率
- Moment-finding:91.3% 準確率,平均絕對距離 0.96 秒,比同級模型快 4 倍
操作成功率
- 全身操控任務:45.7%–76.3%
- 擰燈泡:92%
- 綁袋子:44%
- 夾爪插入任務:74.2%–89.6%
遷移效率
- On-Device 2 適應全新形體所需示範樣本:< 200 個(數小時資料)
最佳 vs 最差場景
推薦用
- 工廠自動化:需要多台異構機器人協同完成流水線任務的場景,如零件分揀、組裝、搬運接力
- 物流倉儲:長時序取物任務,機器人需即時偵測夾取失敗並自動重試
- 研究機構:透過 Gemini API 快速試驗新型具身推理應用,無需大量示範資料
- 工業儀器讀取場景:機器人直接讀取數位顯示器數值並據此調整操作參數
千萬別用
- 重型搬運或大塊物操作:纜索傳動方案尚不成熟,需高速比齒輪的場景無法靠 ER 2 彌補硬體限制
- 需要 100% 成功率的高風險操作:綁袋子等靈巧操作成功率僅 44%,不適合零容錯環境
- 離線封閉環境:完整編排能力依賴 Gemini API,純本地部署目前功能受限
唱反調
操作成功率跨度過大 (44%–92%) :同一系統在不同任務上的表現差異如此懸殊,代表部署前仍需針對每個任務場景個別評估,「通用機器人大腦」的宣稱可能言過其實。
多機器人協作功能鎖在私有預覽,公開基準數據缺乏第三方獨立驗證,示範影片無法排除精心挑選的成功案例。
DeepMind 近期有多位頂尖研究員出走至 Anthropic 和 OpenAI,若人才流失趨勢持續,維持此技術領先地位的長期能力存疑。
社群風向
Bitter lesson 的意義在於規模加資料;LeRobot 現在連沒有靈活手指都能折衣服了,這種進展不容被輕視。
重型搬運與大塊物操作仍需高速比齒輪,纜索傳動目前難以實現。毫無疑問,我們尚未達到人類水準——但技術進步的速度前所未有,切勿低估。
Google DeepMind 表示,Gemini Robotics 2 可控制人形機器人的全身,從行走、蹲下到以五指手操作物體。系統結合三個模型:Gemini Robotics 2 將視覺與指令轉為動作;ER 2 規劃長達數分鐘的任務、追蹤數百個決策並協調多台機器人;On-Device 2 在本地執行,並可以不足 200 個示範樣本適應全新雙臂機器人。
Google DeepMind 剛發布首批機器人 AI 模型 Gemini Robotics 1.5 與 Gemini Robotics-ER 1.5,在具身推理任務上位居第一,並可透過 Gemini API 或 Google AI Studio 即時取用。
如果 DeepMind 真的是個絕佳工作環境,為什麼近期有多位頂尖研究員出走至 Anthropic 和 OpenAI?問題僅限於特定團隊,還是相關報導有所誤導?
炒作指數
行動建議
申請 Gemini API 金鑰,在沙盒環境測試 ER 2 的 Moment-finding 能力:上傳機器人操作影片,驗證模型是否能準確標定失敗時刻(預期誤差 < 2 秒)。
若有現有機器人硬體,用 On-Device 2 嘗試以 50–100 個示範樣本微調適應,評估遷移成本是否如官方宣稱低廉,再決定是否擴大資料採集規模。
追蹤 Enterprise Agent Platform 的公開時間表與定價,以及第三方對多機器人協作成功率的獨立基準測試——這兩個數據才是決定是否導入的關鍵。