谷歌旗下DeepMind於近期釋出了Gemini Robotics 2系列智慧套件,旨在為各類機器人提供通用的“智慧層”。該套件由三款AI模型組成,能夠跨機型快速適配不同硬體軀體,僅需數小時的資料訓練即可讓模型適應全新機身。這一特性被視為其核心價值:若仿人機器人未來普及度達到筆記型電腦水平,誰能提供可在不同機身間順暢遷移的通用“大腦”,誰就可能掌握整個行業的核心話語權。

三款模型各司其職

Gemini Robotics 2系列包含三款模型:Gemini Robotics 2是一款視覺-語言-動作模型(VLA),可將視覺資訊與指令轉化為運動指令,驅動完整仿人機器人實現從足部到指尖的動作,同時適配常規雙臂機器人系統;Gemini Robotics ER2是具身推理模型,能夠規劃持續數分鐘的多步驟任務,在操作失敗後自主恢復,並支援多機器人分工完成整套作業流程;Gemini Robotics On-Device 2則是輕量化版本,可直接在機器人硬體本地執行,適用於網路雲連線不穩定或無法聯網的場景。

演示與效能表現

當地時間7月30日,DeepMind公開演示了用同一引數模型控制三台硬體結構互不相同的機器人,包括搭載兩套不同機械手的Apptronik Apollo 2機器人,以及一台配備夾爪的獨立雙臂裝置。與2025年推出的初代Gemini Robotics(僅能控制上半身)相比,新版實現了全肢體動作控制,支援仿人機器人同步完成行走、下蹲、彎腰、伸展等動作。演示中,一台Apollo 2機器人走向灑水壺,並將其放置於低層貨架。

不過,業內指出該模型效果仍不穩定:在Apollo 2的全身拾取測試中,機器人從桌面拾取物體準確率約68%,貨架取物準確率76%,地面取物準確率僅46%。多指靈巧操作仍是尚未攻克的難題,簡易夾爪的表現依舊優於結構複雜的仿人機械手。同時,機器人運動速度與穩定性也有待提升。

開放程度與安全性

目前,三款模型的開放程度不盡相同:具身推理模型Gemini Robotics ER2已經開放;但真正實現全身控制的Gemini Robotics 2模型本體,以及輕量化的On-Device 2版本,目前仍處於早期內測階段,短期內無法大規模投入實際使用。DeepMind表示,基於遵守安全約束、主動避讓人類等評測指標,Gemini ER2是公司迄今安全性最高的機器人模型。

行業競爭格局

業內指出,Alphabet輝達,以及一批中國科技企業,都在爭相搶佔“物理AI”技術棧的主導權,即建立一套可用於不同廠商機器人的通用軟硬體平台,進而掌握行業標準。這一佈局邏輯與當初移動作業系統創造巨大產業價值的思路一致。典型代表是安卓:谷歌並未大規模自產手機硬體,而是將安卓系統開放給三星、小米等眾多廠商;海量使用者與開發者持續湧入形成網路效應,平台藉此掌握應用分發渠道、使用者流量入口與增值服務體系,不靠銷售硬體盈利,長期從整個移動產業持續獲取生態收益。

市場含義

從產業視角看,Gemini Robotics 2的釋出標誌著機器人“大腦”正從專用走向通用,類似安卓在手機生態中的角色。若這一趨勢確立,掌握通用智慧層的公司可能成為機器人時代的“安卓”,而硬體廠商則可能淪為“手機品牌”。然而,當前模型在複雜操作、穩定性和速度上的短板,以及開放程度有限,意味著距離大規模商業化仍有距離。對於關注AI與機器人賽道的投資者而言,這場圍繞“物理AI”標準制定權的競爭,其進展值得持續跟蹤。