谷歌DeepMind于7月31日发布Gemini Robotics 2,称其为迄今最先进的视觉-语言-动作(VLA)模型。VLA模型结合图像识别、语言处理与动作控制,使机器人能在物理环境中自主操作。DeepMind表示,该模型可控制从桌面机械臂到全身人形机器人的各类系统,并称其为新一代自适应机器人的“智能层”。据DeepMind介绍,Gemini Robotics 2能够管理全身运动、执行精细操作任务,并协调多台机器人协同工作。开发者可通过候补名单申请早期访问权限。
同时,谷歌DeepMind还发布了Gemini Robotics ER 2,这是一款专为“具身推理”设计的模型。具身推理指理解物理世界并据此决定采取何种行动。ER 2作为机器人的更高层控制系统,取代了4月发布的Gemini Robotics ER 1.6。新模型已在Google AI Studio中提供。
此次发布正值全球科技巨头竞相布局具身智能领域。特斯拉、英伟达等公司也在开发各自的机器人基础模型。谷歌DeepMind的VLA模型路线强调通用性,旨在让单一模型适配多种机器人形态,这可能降低机器人开发的门槛,加速行业应用落地。
分析人士认为,Gemini Robotics 2的推出表明谷歌正试图在机器人AI领域建立技术优势,但实际效果仍需在真实场景中验证。目前,该模型尚处于早期访问阶段,其性能表现和商业化前景有待观察。对于关注机器人产业和AI技术发展的投资者而言,这一进展值得持续跟踪。