7月19日,2026世界人工智能大会(WAIC)的核心分论坛“智启具身论坛2026——迎接物理AI智能涌现”在上海世博中心举行。论坛由智元与觅蜂科技联合主办,汇聚了清华大学、佐治亚理工学院、Physical Intelligence、Genesis AI、Dyna Robotics、Sunday Robotics及腾讯Robotics X等机构的代表,核心议题围绕物理AI的数据来源、模型路线、仿真训练与商业化部署展开。

智元合伙人、高级副总裁、具身业务部总裁,觅蜂科技董事长兼CEO姚卯青在主旨演讲中提出,物理AI要从“模型演示”跨向规模化作业,必须突破三堵“物理墙”:数据墙(真实交互数据稀缺、采集成本高)、表征墙(跨任务、跨环境、跨机器人的统一物理表征尚未形成)和闭环墙(真实世界试错成本高、反馈速度慢)。他将智能概括为两条主线:对世界的抽象与压缩(表征),以及智能体在环境中完成“感知、理解、决策、行动、反馈”的持续闭环。姚卯青强调,数字AI可被互联网数据喂养,但物理AI必须在真实世界中“摸爬滚打”。

关于机器人“ChatGPT时刻”——定义为机器人能够“开箱即用”、理解开放式自然语言指令并完成日常任务——姚卯青预计行业或需积累1亿小时级别的具身数据,推动常见任务的基础成功率达到70%至80%。他直言“模型决定起点,数据定义终局”。在圆桌环节,多位嘉宾给出了具体时间表:姚卯青认为2年,主要取决于数据进展;Physical Intelligence研究科学家任至意判断4至5年;佐治亚理工学院助理教授徐丹飞预期5年;Dyna Robotics联合创始人马也骋给出4年;腾讯首席科学家张正友认为3至5年;Sunday Robotics联合创始人赵子豪则看好3年以内。张正友强调,时间预测取决于数据采集、真实部署、失败恢复等系统性推进,而非单一突破。

论坛还深入讨论了数据采集与技术路线。任至意介绍,Physical Intelligence在训练π0.7模型时引入历史视频编码、细粒度语言与图像引导及数据质量评分等元数据,以增强模型对任务条件的判断能力,并实现跨本体迁移。徐丹飞提出,人类第一视角数据可能成为扩展训练数据的重要来源,其团队已积累约2万小时数据,并在部分复杂操作任务中观察到具身学习的Scaling规律,但他也强调人类数据不能直接替代真机数据。Genesis AI联合创始人王尊玄认为,具身智能是系统工程,需将人类手套数据、第一视角数据、真机数据与仿真数据结合使用。

商业化方面,可靠性成为分水岭。马也骋指出,当前不少通用模型能覆盖多任务,但单一任务成功率有限,缺乏商业价值。Dyna Robotics已积累超过20万小时预训练数据,并采用“数据金字塔”策略,尤其关注失败与恢复数据。他举例称,团队在餐巾折叠任务中实现机器人连续24小时无人干预作业,完成超过800个餐巾折叠。智元也披露了在江西南昌龙旗合作工厂的3C产线部署案例:机器人连续6天、每日超10小时全工段直播作业,累计完成近6.5万件操作,整体成功率达到99.99%。不过,这些数据为特定场景测试结果,尚不能等同于开放环境中的通用能力。

围绕VLA(视觉-语言-动作模型)与世界模型的技术路线,论坛未形成单一结论,但“融合发展”成为多数嘉宾共识。马也骋认为,在特定场景中世界动作模型(WAM)可能更高效,但复杂长程任务仍需多模型协同。张正友则表示,具身智能仍处早期,尚未出现类似Transformer的统一框架,智能体至少需要认知、感知-行动和肢体反应等多层闭环协同。硬件方面,Sunday Robotics选择三指夹爪以平衡成本与能力,而姚卯青强调全栈研发有助于系统级优化。