谷歌DeepMind於7月31日釋出Gemini Robotics 2,稱其為迄今最先進的視覺-語言-動作(VLA)模型。VLA模型結合影像識別、語言處理與動作控制,使機器人能在物理環境中自主操作。DeepMind表示,該模型可控制從桌面機械臂到全身人形機器人的各類系統,並稱其為新一代自適應機器人的“智慧層”。據DeepMind介紹,Gemini Robotics 2能夠管理全身運動、執行精細操作任務,並協調多台機器人協同工作。開發者可通過候補名單申請早期訪問許可權。

同時,谷歌DeepMind還發布了Gemini Robotics ER 2,這是一款專為“具身推理”設計的模型。具身推理指理解物理世界並據此決定採取何種行動。ER 2作為機器人的更高層控制系統,取代了4月釋出的Gemini Robotics ER 1.6。新模型已在Google AI Studio中提供。

此次釋出正值全球科技巨頭競相佈局具身智慧領域。特斯拉、輝達等公司也在開發各自的機器人基礎模型。谷歌DeepMind的VLA模型路線強調通用性,旨在讓單一模型適配多種機器人形態,這可能降低機器人開發的門檻,加速行業應用落地。

分析人士認為,Gemini Robotics 2的推出表明谷歌正試圖在機器人AI領域建立技術優勢,但實際效果仍需在真實場景中驗證。目前,該模型尚處於早期訪問階段,其效能表現和商業化前景有待觀察。對於關注機器人產業和AI技術發展的投資者而言,這一進展值得持續跟蹤。