在 2026 年 RSS 大会最后一天的 workshop 圆桌讨论中,一场围绕具身智能世界模型实际落地的辩论火药味十足。五位来自学界与产业界的专家分成两派,就三个核心辩题展开正面碰撞。现场观众通过投票实时表达立场,最终结果出人意料:来自 Physical Intelligence 的 Laura Smith 在三轮辩论中均告失利,而徐丹飞等学者主导的“分开派”“动作派”和“互联网视频派”分别胜出。
第一轮辩论:世界模型和策略模型,应该合体还是分开?
主持人抛出首个问题后,现场迅速形成两大阵营。支持“合体”的 PI 科学家 Laura Smith 和英伟达 Max Li 主张将所有功能塞进一个超级模型,认为 MoE 架构已证明多专家可共存于同一网络,未来必然走向全能大模型。Max Li 补充指出,当前关键是通过表征学习将世界模型的“想象力”转化为机器人的执行力。
反对“合体”的一方——谷歌 Sherry Yang、源策未来陈立(Lee)和徐丹飞——从工程效率出发提出质疑。陈立强调机器人实时任务对响应速度的严苛要求,合体可能拖慢策略模型导致动作卡顿。Sherry Yang 指出,世界模型需要大量失败数据理解物理规律,而策略模型主要学习成功行为,合体会导致训练目标冲突。徐丹飞补充说,分开调试能快速定位故障环节,合体则形成黑箱难以追责。现场观众投票中,“分开派”略占优势。
第二轮辩论:可控性到底靠像素,还是动作?
这一轮阵营重组。支持“像素派”的 Max Li 认为视频是最自然的监督信号,高保真画面是人类调试系统的便利接口。Laura Smith 表示,视频能直观展示机器人失败时的责任归属。
反方“动作派”徐丹飞和 Sherry Yang 则指出,过度追求像素级真实性会浪费算力,机器人最终要执行可靠物理动作。Sherry Yang 分享了自己的“倒戈”经历:她曾是像素派,但实验发现单纯堆像素在精细接触任务中仍不稳定,因此更倾向引入语义信息和物理先验。徐丹飞强调,人类在黑暗中抓取物品依赖触觉和力反馈而非视觉画面,判断世界模型好坏应看其能否产出真正的动作价值。现场投票更倾向于动作派。
第三轮辩论:数据该从哪里来?
最后一轮直指根本问题。支持“互联网视频派”的徐丹飞、Sherry Yang 和 Max Li 主张人类视频数据规模巨大,能极大提升泛化能力。徐丹飞指出,纯机器人数据规模有限,难以覆盖长尾场景。Sherry 补充说,人类本身就是最强大的物理代理,人类视频可视为另一种机器人数据。
支持“具身控制派”的陈立和 Laura Smith 则认为,互联网视频对高精度具身应用帮助有限,顶多规划子目标,底层控制仍需机器人真实数据。陈立直言业界盲目崇拜互联网数据,但具体应用还得死磕具身数据。现场投票中,互联网视频派以 61% 胜出。
三轮辩论结束后,Laura Smith 三次落败引发现场小插曲。但嘉宾们达成共识:世界模型是机器人走向通用的关键,未来突破可能来自更聪明的组合机制、更平衡的数据策略以及理论与工程的紧密结合。徐丹飞在最后表示:“我们现在看到的只是冰山一角。未来几年,这个领域会非常热闹。”