在近期举办的顶尖学术会议RSS 2026上,佐治亚理工学院助理教授、NVIDIA研究员徐丹飞(Danfei Xu)发表主旨演讲《组合式世界模型》(Compositional World Models),直击当前具身智能领域的一个核心矛盾:高保真视频生成并不等同于真正的机器人规划能力。
徐丹飞指出,随着以Sora为代表的高保真视频生成技术走向成熟,模型已能为机器人构建出极其逼真的未来画面,让人感觉通用人工智能(AGI)似乎触手可及。然而,回到真实物理世界,令人困惑的现象出现了:即便模型能预测出完美的未来画面,机械臂在实际落地执行时依然频频失效。这暴露出行业内长期被忽视的核心矛盾——能够“生成”成功的结果,绝不等同于拥有真正的“规划能力”。面对未曾见过的长流程任务与复杂的物理约束,机器人陷入了“看得懂画面,做不出动作”的瓶颈。
为破解这一难题,徐丹飞提出了一套利用模块化与因子图(Factor Graphs)的解法。他主张让机器人像搭积木一样,在测试阶段动态拼装基础技能。当需要按顺序执行两个技能时,逻辑类似于接力赛——前一个技能终止时的状态分布,必须精准覆盖后一个技能能成功启动的起始状态区间。这个重叠的状态交集,就是技能之间能否顺畅衔接的“契约”。借助因子图,可以在时空维度上自由定义各种约束条件:空间维度上精确约束机械臂末端与目标物体之间的相对姿态;时间维度上确保物体在移动过程中与机械臂保持物理同步;多臂协同方面,过去需要专门采集大量双手协同数据,现在只需训练好单臂技能,在测试时通过因子图将两个单臂模型进行约束组合即可。在这种机制下,机器人能顺利完成单臂难以应对的复杂任务,例如双手协同抬起沉重的双耳锅并旋转角度,或者左手递出锤子、右手精准接住并敲击钉子。
徐丹飞还首次深刻剖析了视频预测与真实控制之间的“视频-动作跨越断层(Video-Action Gap)”。他解释,目前的视频大模型吸收了全网极高量级的视觉数据,具备极强的泛化能力;而机器人底层的动作数据却极其匮乏,导致视频生成模型已成功泛化到新场景,但动作控制模型出现泛化滞后。为量化这一断层,他提出了时间注意力比例(Temporal Ratio)这一新测量指标,用以诊断模型在实时控制过程中,究竟将注意力权重分配给了“预测的未来”还是“眼前的当下”。通过这一指标,他们发现:当机器人处于接近目标阶段时,它高度依赖对未来的轨迹预测,时间注意力比例显著偏高;而一旦进入物理接触与抓取阶段,其注意力会瞬间回归到“当前帧”,转而由实时的触觉与视觉微调主导。基于此,可以在测试期引入策略引导,在接近目标时强化模型对未来的前瞻注意力,在接触物体的瞬间拉回注意力关注当下,显著提升了模型在面对分布外复杂任务时的真实执行成功率。
在演讲后的问答环节,徐丹飞还就训练数据中的失败样本、世界模型与策略模型是否应融合等议题分享了见解。他认为,一旦构建出能深刻理解物理约束的规划算法,预测“某种动作会导致失败”的价值绝不亚于预测成功;同时,他倾向于保持世界模型与策略模型的分立与独立性,因为两者对数据利用方式的本质差异——策略模型偏好高质量的成功数据,而世界模型需要吞下海量失败与异常数据才能完整构建对物理世界全貌的认知。