8月20日,在2026世界机器人大会上,自变量机器人创始人、首席执行官王潜发表演讲,明确表示物理世界的通用智能并非遥不可及,机器人广泛进入家庭和各行各业“绝对不用等五年、十年”。这一判断直接回应了当前行业对机器人普及节奏的两极化预期。

王潜本科、硕士均毕业于清华大学,后赴南加州大学攻读博士,从事机器人学习、人机交互研究。他是较早将注意力机制引入神经网络研究的学者之一。2023年12月,他在深圳创立自变量机器人,聚焦端到端通用具身智能基础模型研发,目标是构建能理解并作用于物理世界的“通用大脑”。

在演讲中,王潜围绕具身智能的底层技术逻辑、训练数据与基础设施建设、产业商业化落地三大维度展开论述。他认为,具身智能的关键任务并非跑步、跳舞或攀岩,而是精细操作(Manipulation)。全身运动控制主要对抗重力场,而抓取、使用工具等操作涉及遮挡、不确定性、三维空间结构及复杂接触过程,参数空间会迅速膨胀。即使在机器人运动能力快速提升的当下,通用抓取仍是困难任务,这决定了机器人需要端到端的基础模型。

王潜还指出,很多人认为可将多模态模型迁移到物理世界,但他认为“可能性比较低”。物理世界的性质难以通过其他模态获得,动作模态与视觉、语言模态差异显著,互联网视频也无法完整记录摩擦、受力和接触等物理信息。因此,具身模型应成为与数字世界基础模型平行的另一类基础模型。自变量的技术路线是打造完全通才的模型,联合处理动作生成、视频预测、语言、三维重建等任务,让不同模态在统一训练中建立联系,模型不仅要输出动作,还要学习物体运动、环境变化及操作结果,形成对物理规律的理解。

关于数据问题,王潜提出数据不应简单类比为“石油”。石油是相对标准化的原材料,而真正用于训练具身模型的数据更像链条长、加工复杂的工业品,“极度复杂”。生产过程覆盖任务定义、采集、质量判断、处理、训练验证和反向优化,复杂程度可能高于模型本身。自变量已搭建覆盖硬件、数据处理流水线和模型训练的数据体系,并提高非真机数据利用效率。公司还将VLA模型、世界模型、训练部署工具及部分数据和基础设施开源,以降低行业重复建设成本、培养人才、加快模型迭代。

在AI基础设施方面,王潜认为具身AI Infra并不比语言模型Infra简单,甚至更难,因为大部分机器人集成需与硬件打交道,硬件性质带来大量通信和同步问题。

家庭场景是王潜此次演讲的重点。2026年4月21日,自变量宣布搭载具身智能基础模型WALL-B的新一代机器人将在35天后进入首批真实家庭。王潜当时表示,希望机器人入户第一天就能处理大部分家务,但并非所有任务都能由AI自主完成,必要时需远程人员兜底。在本次大会上,他披露机器人已为数百户家庭提供保洁服务,除与平台合作参与钟点保洁外,也有机器人长期驻留客户家中,能与用户产生情感连接并实时获得反馈。

工业场景也被视为基础模型路线的阶段性验证。王潜称,自变量已在真实工业产线部署机器人,相关场景投资回报率达到或超过人工水平,项目从数据采集、模型训练到生产部署约用时三个月。他认为,基础模型的泛化能力正缩短单一场景开发周期,具身智能已从展示和情绪价值场景转向生产力场景。

王潜观察到,社会注意力和机器人模型发展存在“微妙的错位”:去年很多人乐观认为一年内机器人可进入家庭,今年又有很多人悲观认为需五到十年。他保持乐观,判断“五年后回过头看,已经生活在机器人进入千行百业、千家万户的世界里,或者已经基本能替代人类体力劳动的世界里”。