World Labs 于 8 月 15 日发布了一款名为“Real-to-Sim-to-Real”(R2S2R)的仿真引擎,据称可将真实世界的机器人任务转化为模拟环境,用于训练和评估控制模型,从而省去昂贵的实体硬件测试。该引擎由 World Labs 于 7 月收购的初创公司 SceniX 提供技术支持。World Labs 由 AI 先驱李飞飞于 2024 年创立,专注于构建具备空间智能、能理解三维物理世界的模型。
World Labs 表示,机器人部署的主要瓶颈并非模型架构,而是机器人需要海量经验才能可靠运行。真实世界的数据成本高昂且难以控制,在线视频也无法系统覆盖所有物体、物理条件和失败状态。R2S2R 引擎通过捕捉机器人、传感器、环境和任务演示,重建一个不仅外观相似、物理行为也一致的交互式虚拟世界。其关键在于将生成式世界模型与面向任务的机器人仿真相结合,从而从单个真实任务生成数千种变体,涵盖光照、物体位置与数量、周围环境、摩擦等物理属性以及相机角度的变化。
为验证准确性,World Labs 会在仿真和现实中并行运行相同动作序列,并对比观察结果、物体运动和最终效果。展示的示例包括刚性、可移动和可变形物体,如电缆布线、将弹性电缆端插入孔中以及双手装箱等任务。
控制模型在仿真中训练后迁移至真实机器人。测试平台之一是 ALOHA,一个来自斯坦福大学的开源双臂设计,通过两个较小的控制臂进行示教操作。该平台成本仅为商用系统的一小部分,且所有蓝图公开,已成为机器人研究领域的参考平台。据 World Labs 称,模型在另外四个机器人平台上各运行一小时,全程无需人工干预,任务包括双手将电源线缠绕在冰箱上、精确重新定位试管以及从杂乱堆中分离马克笔或铅笔等细长物体。该系统不依赖特定控制模型或机器人类型,重建一次的世界可复用于新模型和不同机器人。
World Labs 认为,机器人研发之所以落后于语言模型,很大程度上是因为评估控制模型主要依赖真实硬件测试。一个可靠的仿真并不需要达到与真实世界相同的成功率,关键在于能否回答同样的问题:模型在哪里失败、哪个版本更好、改进是否能迁移到物理机器人上。团队用 ALOHA 机器人的双手立方体交接任务进行了测试,仿真复现了机器人勉强抓住立方体边缘的临界情况以及匹配的失败尝试。在不同模型类型(包括 GR00T N1.6 和 π₀.₅)和训练阶段中,仿真与现实的模型排名基本一致,无论立方体位置已知还是未知。每个检查点使用 2,000 次模拟和 100 次真实运行进行评估。表现更好的策略在硬件上也表现更好,排名保持一致。开发团队可以在仿真中筛选出较弱的模型版本,将昂贵的硬件测试留给最有希望的候选者。
该仿真器是 World Labs 更广泛世界模型战略的核心。公司将其与自动驾驶类比,指出一些成功的 L3 和 L4 系统使用真实与模拟数据的混合训练。World Labs 的长期目标是:要扩展机器人的智能,就必须扩展它们学习的世界。然而,这些结果在更复杂环境、其他机器人类型以及更不受控的日常场景中的泛化能力仍是开放问题。
World Labs 早期系统曾从单张照片生成可步行的 3D 环境,近期又筹集了 10 亿美元风险投资,将世界模型扩展到机器人和科学领域。R2S2R 引擎是该愿景在机器人领域的首个具体应用。这项研究也引发了关于世界模型在机器人中作用的更广泛讨论。一个国际研究团队最近试图为世界模型下统一定义,明确区分世界模型与纯视频生成器。相关领域还包括“世界动作模型”,将近期预测直接与控制命令绑定,这与 World Labs 将仿真与策略分离的方法不同。另一种来自中国的方法名为 Orca,允许机器人仅通过观看视频学习任务,无需真实运动数据。