家庭场景被视为人形机器人最具潜力的落地市场,但也是技术挑战最大的考场。与工厂中结构化的流水线不同,家庭环境充满随机变量:桌面可能堆满杂物,地面散落玩具,从冰箱取物需侧身绕过椅子,擦桌子时需随擦拭范围不断调整站位。这些看似平常的家务,对人形机器人而言却构成巨大考验。
近日,由南洋理工大学、北京大学、香港科技大学(广州)和智源研究院联合提出的ω-0——一款隐空间预测世界动作模型,为破解这一难题提供了新思路。输入语言指令后,ω-0可同步识别环境、感知自身状态,直接输出底层控制系统可读取的精简动作特征,支撑机器人完成“边移动边操作”的全身协同任务。
研发团队对ω-0进行了全方位真机测评,选取11项高难度居家实操任务,重点考核动态协同、环境适配与自主决策能力,涵盖跨区域物品收纳、高低位杂物清理、床上衣物拾取等典型复合场景。实测结果显示,ω-0 Ego第一视角任务成功率达79.1%,ω-0 Omni全场景模式成功率高达81.8%,全面超越了ω-0.5、EgoVLA、GR00T-N1.7等主流行业基线模型。
从“先走后做”到“边走边做”,是ω-0的核心突破。过去几年,机器人的行走与操作能力各自取得长足进步,但部署到人形机器人时,多数系统采用“分步走”策略:先移动到目标附近站稳,再启动手臂操作。这种模式在简单场景尚可应付,一旦遇到连续作业的家庭任务便暴露弊端——擦大尺寸桌子时,机械臂伸到极限后必须迈步才能继续,但迈步同时还要保持抹布贴住桌面;拖地时,拖把运动直接影响身体受力,双腿必须随手臂动作不断调整重心。任何环节独立决策,都可能造成动作卡顿、接触中断甚至失去平衡。
ω-0摒弃了耗时的视频到动作(video-to-action)逆向转换,转而构建统一的查询表征(Query-based Representation)架构。在这一架构中,未来视觉特征提供任务进度和场景演变的宏观指引,动作分支则直接生成可供底层控制器执行的全身动作潜在指令。
为适配真实居家场景的复杂需求,团队搭建了三阶段递进式训练体系:第一阶段进行全身动作VLM专属预训练;第二阶段借鉴V-JEPA技术思路,融合视觉、语言、机器人本体多维数据,通过视频查询预判未来环境特征,将场景动态变化信息注入动作表征体系;第三阶段引入海量真实居家移动操作数据,进行真实场景精细化微调,让机器人自主适配各类居家场景。
同时,为支撑庞大训练需求,研究团队开源了真实世界家庭人形机器人数据集ω-HOME,包含40.3小时真实环境数据、4827条任务轨迹、24项任务,每条轨迹均含同步采集的语言指令、第一视角与第三视角、本体状态、全身运动轨迹等数据,降低了下游任务训练对示范数据的依赖。
81.8%的成功率是一个令人振奋的数字,但距离真正融入家庭、长期自主运行的机器人仍有很长的路要走。不过,ω-0为行业指明了一个方向:将机器人的全身作为一个整体来思考,而非把腿和手当作各自为政的部门。当机器人学会在移动中操作、在操作中调整姿态,才可能从“实验室演示”走向“生活化服务”。