在2026年世界机器人大会(WRC 2026)上,星动纪元创始人兼CEO陈建宇发表演讲,提出一个关键判断:世界模型可能不仅是当前主流技术路线VLA(视觉-语言-动作模型)的增强模块,而可能成为下一代具身智能的核心范式。这一观点直指当前机器人行业最底层的技术路线之争。
陈建宇指出,过去几年机器人主要解决“如何更精准地执行动作”的问题,在工业产线上完成焊接、搬运等重复任务,但这些能力建立在环境、流程和目标都被提前定义的前提上。当机器人走向物流、服务乃至家庭等开放场景,面对从未见过的物体或任务,能否理解环境、预测变化并自主找到解决方法,成为通用机器人必须回答的问题。
大模型为机器人提供了新可能,但机器人面对的是真实物理世界而非语言世界。目前行业主流方向是VLA,它通过学习大量人类行为数据,将视觉、语言和动作统一起来。然而陈建宇认为,VLA的核心仍是模仿——模型学习人类过去如何行动,遇到从未见过的新任务时,仅靠已有动作经验难以真正泛化。相比之下,世界模型试图构建对物理世界的常识性理解,例如“水往下流”这类规律无需反复学习,天然具备更好的泛化性。
陈建宇将具身大模型的迭代归纳为三个范式:第一范式是“语言模型+机器人控制”,用语言模型增强上层推理,但下层仍是传统模块化方法,无法端到端训练;第二范式是“多模态底座上的VLA模型”,以GPT-4为代表的多模态模型出现后,将动作与环境交互融合进统一模型,典型如Google的PaLM系列、RT系列;第三范式则是世界模型,它不仅能预测未来动作,还能预测未来世界状态的演化,形成闭环。
星动纪元早在2024年就发表了全球首个融合视频预测与动作预测的世界动作模型,比英伟达类似方案早了约一年。陈建宇强调,世界模型多以视频模型为底座,直接处理原始图像、视频、音频数据,包含更丰富的物理细节,更适合面向物理世界操作的具身模型。在数据层面,星动纪元构建了大规模人类行为数据集,并加入第一人称人类操作数据训练,还与Facebook AI(FAIR)团队合作完成ControlNet相关工作,提升动作精准可控性。
陈建宇展示了世界模型的几项能力:一是建模与预测能力,生成图像与真实实拍几乎无法分辨,能精准预测毛巾褶皱、抽纸等细微物理现象;二是零样本任务泛化,在办公区随机取景、下达带逻辑推理的指令(如“把左边的拖鞋放到右边拖鞋的旁边”),模型能端到端直接预测动作;三是精细操作与跨本体能力,经过后训练可完成叠纸盒、翻袜子、脱鞋、开水等操作,还能操作灵巧手使用螺钉枪、移液器等工具。
在硬件层面,星动纪元选择全栈自研,从整机、关节模组、机械手到电机、减速器、驱动器均自主开发。其全尺寸双足机器人兼顾力量、速度、自由度和工作空间,2023年底已实现涉水行走、上下楼梯,今年春节期间还发布了舞剑演示。灵巧手方面,星动纪元最早推出全直驱灵巧手,响应速度极快,一秒可点击10次鼠标,负载达24千克,并具备良好抗冲击能力。
商业化方面,陈建宇认为具身行业已进入商业化拐点。星动纪元从物流工业起步,逐步向服务、C端和家用渗透,B端客户项目已覆盖十余个城市,在物流分拣等场景常态化运作。同时开放硬件平台、软件工具链与API,供二次开发者使用。他强调,通用机器人是持续进化的系统,大脑、本体与场景形成协同进化的飞轮,随着能力提升不断开拓新场景。
陈建宇的演讲反映了具身智能领域对技术路线的深层思考:VLA与世界的模型之争,本质上是“模仿人类”与“理解世界”两种路径的博弈。业界普遍关注,世界模型能否真正突破VLA的泛化瓶颈,以及这种路线切换对硬件、数据、算力提出的新要求。星动纪元的实践为行业提供了一个从算法到硬件再到商业化的完整样本,但其能否在激烈竞争中保持领先,仍有待市场检验。