谷歌近期推出新一代機器人專用多模態 AI 系統 Gemini Robotics 2,這套 Vision-Language-Action 一體化模型能夠同步處理視覺畫面、自然語言指令並輸出全身運動控制信號,為各類人形、工業機械臂搭建通用智能底層,大幅提升機器人自主理解環境、完成複雜任務的能力。
整套體系由三款定位互補的模型構成,覆蓋規劃、動作控制與本地部署全流程。基礎執行模型 Gemini Robotics 2 主打全身協同操控,可統一調度機器人腿腳、手臂、指尖完成連貫動作,適配人形機器人與雙臂設備,支持精細抓取、物料搬運等操作;Gemini Robotics ER 2 承擔頂層推理任務,兼具人機對話、環境感知能力,能夠拆解長流程任務並分步規劃執行方案,本次更新新增多台機器人協同調度能力。

全新上線的 Gemini Robotics On-Device 2 支持離線本地運行,無需依賴雲端網路,僅需數小時調試即可適配全新機型的傳感器與硬體結構,降低企業落地部署門檻。
官方實測影片展示了多款機器人的實操表現:搭載 22 自由度五指機械手的 Apollo 2 人形機器人,可完整完成步行、轉運收納、繫繩、密封包裝袋等精細化複合任務;Franka Duo 兩指機械臂也能流暢完成物品規整、工具分類等工作。整套系統可以順暢執行 「將灑水壺收納至綠色箱體」 這類多層級口語指令,動作銜接自然連貫。
安全層面,谷歌升級 Gemini Robotics ER 2 的人體感應機制,一旦檢測到人員靠近作業區域,機器人會立刻啟動制動、避讓等保護動作,規避碰撞風險。
谷歌表示,Gemini Robotics 2 系列是機器人從單一自動化操作邁向通用具身智能
的關鍵產品,依託統一的感知、推理、執行框架,未來能夠適配工廠運維、倉儲分揀、家政服務等多元真實場景,大幅拓寬機器人可處理任務的複雜程度。






