谷歌旗下DeepMind于近期发布了Gemini Robotics 2系列智能套件,旨在为各类机器人提供通用的“智能层”。该套件由三款AI模型组成,能够跨机型快速适配不同硬件躯体,仅需数小时的数据训练即可让模型适应全新机身。这一特性被视为其核心价值:若仿人机器人未来普及度达到笔记本电脑水平,谁能提供可在不同机身间顺畅迁移的通用“大脑”,谁就可能掌握整个行业的核心话语权。

三款模型各司其职

Gemini Robotics 2系列包含三款模型:Gemini Robotics 2是一款视觉-语言-动作模型(VLA),可将视觉信息与指令转化为运动指令,驱动完整仿人机器人实现从足部到指尖的动作,同时适配常规双臂机器人系统;Gemini Robotics ER2是具身推理模型,能够规划持续数分钟的多步骤任务,在操作失败后自主恢复,并支持多机器人分工完成整套作业流程;Gemini Robotics On-Device 2则是轻量化版本,可直接在机器人硬件本地运行,适用于网络云连接不稳定或无法联网的场景。

演示与性能表现

当地时间7月30日,DeepMind公开演示了用同一参数模型控制三台硬件结构互不相同的机器人,包括搭载两套不同机械手的Apptronik Apollo 2机器人,以及一台配备夹爪的独立双臂设备。与2025年推出的初代Gemini Robotics(仅能控制上半身)相比,新版实现了全肢体动作控制,支持仿人机器人同步完成行走、下蹲、弯腰、伸展等动作。演示中,一台Apollo 2机器人走向洒水壶,并将其放置于低层货架。

不过,业内指出该模型效果仍不稳定:在Apollo 2的全身拾取测试中,机器人从桌面拾取物体准确率约68%,货架取物准确率76%,地面取物准确率仅46%。多指灵巧操作仍是尚未攻克的难题,简易夹爪的表现依旧优于结构复杂的仿人机械手。同时,机器人运动速度与稳定性也有待提升。

开放程度与安全性

目前,三款模型的开放程度不尽相同:具身推理模型Gemini Robotics ER2已经开放;但真正实现全身控制的Gemini Robotics 2模型本体,以及轻量化的On-Device 2版本,目前仍处于早期内测阶段,短期内无法大规模投入实际使用。DeepMind表示,基于遵守安全约束、主动避让人类等评测指标,Gemini ER2是公司迄今安全性最高的机器人模型。

行业竞争格局

业内指出,Alphabet英伟达,以及一批中国科技企业,都在争相抢占“物理AI”技术栈的主导权,即建立一套可用于不同厂商机器人的通用软硬件平台,进而掌握行业标准。这一布局逻辑与当初移动操作系统创造巨大产业价值的思路一致。典型代表是安卓:谷歌并未大规模自产手机硬件,而是将安卓系统开放给三星、小米等众多厂商;海量用户与开发者持续涌入形成网络效应,平台借此掌握应用分发渠道、用户流量入口与增值服务体系,不靠销售硬件盈利,长期从整个移动产业持续获取生态收益。

市场含义

从产业视角看,Gemini Robotics 2的发布标志着机器人“大脑”正从专用走向通用,类似安卓在手机生态中的角色。若这一趋势确立,掌握通用智能层的公司可能成为机器人时代的“安卓”,而硬件厂商则可能沦为“手机品牌”。然而,当前模型在复杂操作、稳定性和速度上的短板,以及开放程度有限,意味着距离大规模商业化仍有距离。对于关注AI与机器人赛道的投资者而言,这场围绕“物理AI”标准制定权的竞争,其进展值得持续跟踪。