在8月最后一周于国家速滑馆“冰丝带”举行的第二届世界人形机器人运动会上,银河通用以全自主、不依赖遥操的方式,包揽了家庭、餐饮、商超三大场景赛的金牌,夺冠率100%,并在赛后的技术复核中首次即获满分。这一成绩在业内引发热议,因为它直接回应了当前具身智能领域最核心的挑战——如何在真实物理世界中实现可靠的自主决策与操作。
场景赛不同于田径项目的竞技表演,它模拟的是家庭、餐饮、商超的真实工作环境,考验的是机器人的具身大模型能力,包括“大脑”的认知决策与“小脑”的运动控制。田径项目可以通过大量仿真训练优化运动控制算法,但场景赛面对的是动态环境、柔性物体和随机干扰,对模型的泛化能力要求极高。本届比赛允许遥操,但积分规则明确鼓励全自主:自主模式权重为1.0,遥操模式仅为0.5,同分时自主队伍排名靠前。尽管如此,多数队伍仍选择遥操以规避风险,因为让AI完全掌控沉重的钢铁躯体,一旦出错可能导致机器人死机或破坏环境。银河通用却坚持全自主,并在三个流程最长、最容易翻车的项目中全部夺冠。
家庭场景是赛程最长的项目,长达30分钟,机器人需在客厅、卧室、卫生间、阳台间穿梭,完成捡拾杂物、开门、塞脏衣服进洗衣机、叠衣晾晒等任务。其中两大技术难点:一是柔性物体操作,如叠衣服,传统刚体抓取算法失效,必须依赖端到端的视觉-动作模型实时调整;二是长程任务中的随机干扰与记忆恢复,比赛中机器人突然收到“有快递送达门外”的语音指令,需暂停当前任务去取快递,再回到原位继续工作,这考验其“时空接地”与长短期记忆调度能力,任何微小偏差都可能导致“误差级联”全线崩溃。银河通用不仅顺利完成所有干扰项,还在技术复核中首次即获满分,证明了其底层模型的泛化能力。
餐饮场景则对应“莫拉维克悖论”——对人类简单的动作对AI极难。机器人需用食品夹从热食柜取餐、放入微波炉、拧动定时旋钮、加热后取出,并接饮料平稳送达。使用工具(夹子)要求模型将感知延伸至工具末端,夹轻了掉落、夹重了捏烂;拧旋钮则考验柔顺控制,刚性位置控制稍有偏差就会掰断塑料旋钮,必须像人一样带“弹簧般”柔性触碰并输出扭矩。多数队伍选择遥控器接管精细动作,而银河通用以6分55秒零失误最快完赛,说明其模型已深度穿透至底层力矩输出。
商超场景是20分钟限时高压测试,任务包括按外卖订单拣货、巡查货架、补货、归位错放商品,且货架上有外观相似的干扰项。传统机器人开发常针对特定场景“过拟合”,但商超考场是迷你“开放世界”,订单动态、缺货随机、商品五花八门。银河通用凭借多模态大模型实时感知,精准识别反光、不规则包装的袋装薯片,并自主发现纠正错放商品,最终包揽金银铜牌。
赛场上的高光表现并非特化调参的结果,而是源于真实商业场景的“降维打击”。银河通用打造的“银河太空舱”零售店,由人形机器人自主运营,已进入全国近50城、约200个点位,稳定运行超一年;美国Fox News主播Bret Baier曾探访其运营的全家超市,目睹机器人在上万种SKU中自主完成识别、巡查、补货全流程。在医疗场景,银河通用联合合作伙伴打造近百个智慧药房,首家于2024年9月落成,在不到50平米空间内7×24小时运行近两年,累计出药超百万次。这些真实交互数据持续回流至银河星脑(AstraBrain)世界动作模型,形成“真实应用—数据回流—模型进化”闭环,使赛场上的随机干扰、动态订单不过是日常训练的子集。
银河通用创始人兼CTO王鹤博士曾提出,具身智能正接近自己的“ChatGPT时刻”,标志不是背会预设动作,而是具备真正的泛化能力——人类只需自然语言或展示几遍动作,机器人就能举一反三。本次全自主夺冠印证了这一趋势,也表明人形机器人竞争的核心已从硬件同质化转向具身智能大脑。银河通用将底座押注于自研的AstraBrain世界动作模型,通过输入视频流和物理状态预测下一步关节扭矩与动作,而非为特定任务编写海量if-else代码。这一成绩向行业宣告,物理世界的智能觉醒已有明确解法,但能否在更广泛场景中低成本复制,仍需时间检验。