
2026年7月30日Google DeepMind正式發(fā)布Gemini Robotics ER 2模型。官方博客用一句話概括了它的定位——“一個高級大腦”。同一天谷歌在社交平臺X上拋出了更直白的九個字“一個大腦。適用于任何機器人?!碑?dāng)特斯拉、Figure AI等玩家在機器人本體賽道上競速時谷歌選擇了一條截然不同的路徑不造機器人只造機器人的“大腦”。Gemini Robotics ER 2的發(fā)布標(biāo)志著這場“物理AGI”競賽進入了一個全新的階段。一、三層架構(gòu)讓機器人“思考”與“行動”分離Gemini Robotics 2并非單一模型而是一個由三個模型組成的分層系統(tǒng)。第一層是Gemini Robotics 2——視覺-語言-動作模型VLA將攝像頭畫面和自然語言指令直接轉(zhuǎn)換為電機控制指令能夠控制整個人形機器人從腳到指尖的每一個關(guān)節(jié)。與此前主要控制機器人上半身的模型不同Gemini Robotics 2實現(xiàn)了真正意義上的“全身控制”——機器人可以行走、下蹲、伸展、抓取完成“穿過房間、拿起灑水壺并將其放到架子上”這樣需要全身協(xié)調(diào)的完整任務(wù)。第二層是Gemini Robotics ER 2——具身推理模型也就是本次發(fā)布的核心。它不直接控制電機而是充當(dāng)機器人的“高級大腦”理解物理環(huán)境、規(guī)劃多步驟任務(wù)然后將執(zhí)行指令交給底層的VLA模型。官方演示中ER 2驅(qū)動Boston Dynamics的Spot機器人僅憑語音指令即可完成導(dǎo)航和物體抓取。第三層是Gemini Robotics On-Device 2——輕量級VLA模型經(jīng)過優(yōu)化可在機器人本地運行只需幾小時數(shù)據(jù)就能適配全新的機器人本體。三層各司其職動作、規(guī)劃、部署——這個架構(gòu)本身就是谷歌的競爭宣言。二、連續(xù)視頻理解從“停-想-動”到“邊想邊動”Gemini Robotics ER 2相比前代ER 1.6的核心突破在于連續(xù)視頻流處理能力。傳統(tǒng)機器人推理模型采用“停-想-動”模式——機器人必須先停下來思考再執(zhí)行動作再停下來思考下一步。這種模式在物理世界中造成了明顯的卡頓和不自然。ER 2通過接入Gemini Live API的雙向流式端點實現(xiàn)了同步推理——機器人在執(zhí)行當(dāng)前動作的同時已經(jīng)在規(guī)劃后續(xù)步驟。在性能數(shù)據(jù)上ER 2交出了一份扎實的答卷任務(wù)進度分類準(zhǔn)確率達57.4%幫助機器人在不重啟整個工作流的情況下修正失敗步驟關(guān)鍵時刻定位準(zhǔn)確率達91.3%平均時間誤差僅0.96秒——比如判斷“何時停止向杯中倒咖啡”執(zhí)行速度是ER 1.6的4倍滿足現(xiàn)實機器人安全運行所需的亞秒級延遲要求128,000 Token的上下文窗口足以處理數(shù)分鐘連續(xù)視頻流更值得注意的是ER 2可以原生調(diào)用Google Search或開發(fā)者自定義函數(shù)。這意味著機器人遇到不確定的情況時可以直接“上網(wǎng)查”——這是具身智能走向?qū)嵱没年P(guān)鍵一步。三、多機器人協(xié)作第一次讓不同的“身體”共享同一個“大腦”Gemini Robotics ER 2首次引入了多機器人協(xié)作機制。在官方演示中Apptronik公司的Apollo 2人形機器人與Franka F3 Duo機械臂平臺成功展示了跨設(shè)備協(xié)同作業(yè)。不同類型的機器人借助ER 2提供的共享語義理解可以實時溝通、分工配合、交接任務(wù)完成單臺設(shè)備無法獨立完成的復(fù)雜工作流。這一能力的意義遠超技術(shù)演示本身。它揭示了一個趨勢未來的機器人生態(tài)可能不是“一個機器人干所有事”而是“一群各有所長的機器人共享同一個智能系統(tǒng)協(xié)同作戰(zhàn)”。而谷歌想要的正是這個“共享的智能系統(tǒng)”。四、安全從“可選項”到“必答題”當(dāng)AI模型開始控制物理世界中的人形機器人時安全不再是錦上添花而是生死攸關(guān)。谷歌在ER 2上采取了多層次安全防護策略。ER 2被官方稱為“迄今為止最安全的機器人模型”——它能更好地檢測人類是否靠近觸發(fā)安全工具調(diào)用并在有人過于接近時將機器人帶至安全停止?fàn)顟B(tài)。谷歌還推出了名為ASIMOV-Agentic的安全評測基準(zhǔn)專門測試推理模型作為“編排者”時是否安全——能否拒絕不安全的工具調(diào)用、判斷物理可行性、在不確定時尋求人類幫助。不過谷歌在模型卡中明確禁止開發(fā)者將機器人模型用于醫(yī)療和交通運輸?shù)劝踩P(guān)鍵領(lǐng)域。這說明即便技術(shù)突飛猛進“物理AGI”距離真正進入高風(fēng)險場景仍有距離。五、行業(yè)變局谷歌押注“Android時刻”Gemini Robotics ER 2的發(fā)布本質(zhì)上是谷歌對整個機器人行業(yè)的一次戰(zhàn)略卡位。當(dāng)前人形機器人賽道的主流玩家——特斯拉、Figure AI——走的是垂直整合路線自研模型、自研執(zhí)行器、自建工廠。而谷歌的選擇截然相反做一個開放的、適用于任何機器人的智能層。DeepMind負(fù)責(zé)人Demis Hassabis曾表示他希望為機器人構(gòu)建一個類似Android的操作系統(tǒng)。如果這一愿景實現(xiàn)任何機器人硬件廠商都可以搭載谷歌的“大腦”就像任何手機廠商都可以搭載Android一樣。谷歌不參與機器人本體的制造競賽卻可能成為所有機器人背后的平臺級贏家。在商業(yè)落地層面ER 2已通過Gemini API和Google AI Studio向開發(fā)者公開提供并在Gemini企業(yè)智能體平臺開啟私密預(yù)覽。首批合作伙伴包括Apptronik、Agile Robots SE、Boston Dynamics等。第一波應(yīng)用場景將集中在倉庫分揀、設(shè)施巡檢、實驗室任務(wù)等風(fēng)險相對可控的領(lǐng)域。 結(jié)語Gemini Robotics ER 2的發(fā)布標(biāo)志著具身智能從“實驗室玩具”向“可部署系統(tǒng)”邁出了實質(zhì)性的一步。連續(xù)視頻理解、同步推理、多機器人協(xié)作、工具調(diào)用——這些能力疊加在一起正在將一個曾經(jīng)只存在于科幻中的概念變成現(xiàn)實一個能看、能想、能規(guī)劃、能協(xié)作的機器人“大腦”。谷歌不造機器人但谷歌想成為所有機器人的“大腦”。這條路能否走通尚需時間檢驗但有一點已經(jīng)清晰物理世界與AI的交匯正在以前所未有的速度加速。而當(dāng)這場加速發(fā)生時誰掌握了“大腦”誰就掌握了主動權(quán)。