在机器人顶级学术会议RSS 2026现场,来自Google实验室和纽约大学(NYU)的助理教授Sherry Yang展示了一项可能改变具身智能研发范式的研究。她提出的World Gym框架,核心是利用可控的视频生成模型作为真实世界的数字替身,让机器人在云端虚拟场景中完成无限次低成本演练,从而绕过物理世界中高昂的真机试错成本。
当前,具身智能领域面临的核心困境是:虽然深度神经网络已具备高容量,但现实世界中每一次真机交互都伴随着时间损耗、设备磨损和安全风险。相比之下,游戏和代码等虚拟领域的交互成本几乎为零,这正是AlphaGo和大语言模型能快速进化的关键。Sherry Yang认为,如果能将物理代理的交互成本降下来,机器人也能像大模型一样利用海量数据自我进化。
World Gym正是这一思路的产物。该模型采用可扩展的Diffusion Transformer(DiT)架构,通过接收前序图像和当前控制指令,持续生成未来的视频画面。值得关注的是,研究团队仅用两张A100 GPU就在Bridge数据集下训练出泛化能力出色的模型,打破了“世界模型研究只能由资源垄断的超级大厂进行”的刻板印象。该模型在包含22种机器人形态的多样化数据集上训练,生成的视频与真机执行动作画面高度一致。
World Gym首先被用作标准化评估层。研究团队将业内主流策略模型(如Octo、OpenVLA、RT-1)放入其中进行滚动测试。在一个“把茄子放进锅里”的任务中,OpenVLA表现完美,Octo动作未完全完成,而老模型RT-1因输出动作完全超出分布(OOD),甚至“带崩”了世界模型——但这恰恰体现了世界模型的价值:它提前预警了真机运行可能导致的损坏。此外,通过图像编辑,研究人员可以定制任意长尾场景进行安全测试,例如在场景中加一张电脑屏幕并命令策略“去把胡萝卜拔出来”,结果策略模型竟冲向屏幕。数据显示,世界模型得出的评估结果与真机实测成功率呈强烈正相关性。
在提升策略方面,团队推出了World Gymnast项目,让机器人代理在世界模型中通过强化学习(RL)进行演练。与当前多数依赖人类遥控数据做监督微调的方法不同,World Gymnast借鉴大语言模型的发展经验(从GPT-3到ChatGPT),利用验证器和RL大规模扩增训练任务。机器人数据集中的任意画面(包括失败画面)都可作为RL起点,逼着策略模型学会从错误状态中恢复(Failure Recovery)。视觉语言模型(VLM)作为通用奖励模型,根据任务指令和世界模型生成的视频给出成功或失败反馈,并通过策略梯度对策略网络在线更新。在开门、关门、放茄子等4个全新留存任务的真机测试中,经过世界模型RL训练的模型表现显著优于监督微调,也击败了在传统物理模拟器(如Simpler)中训练的基准模型。
Sherry Yang在演讲中展望了未来方向:建立混合数据飞轮。内环是策略模型在参数化的视频世界模型中进行成千上万种虚拟任务的低成本RL进化;外环是机器人自主探索产生失败数据,这些数据可直接用于梯度更新世界模型,使其更精确。她还指出,互联网上庞大的第一视角人类交互视频是巨大宝藏,未来可通过世界模型将互联网视频的“广度”与机器人具身控制数据的“精度”桥接起来,敲开通用机器人的大门。
在问答环节,针对“策略模型不工作导致世界模型也不工作”的悖论,Sherry Yang回应称,可以利用真机自主探索产生的失败数据优先更新世界模型,拓宽其模拟边界,从而形成相互促进的飞轮。