2026 年 1 月,硅谷机器人大脑公司 Skild AI 完成 14 亿美元 C 轮融资,估值从数月前的 45 亿美元 跳升至超过 140 亿美元。这家公司没有生产过一台机器人,也没有向任何工厂交付过一台机械臂——它卖的只是一个模型。这轮融资被媒体形容为“2026 年机器人行业最早诞生的百亿美元独角兽”,理由恰恰是它什么都不造。

与此同时,国内具身智能公司智在无界(BeingBeyond)创始人卢宗青也坚持纯模型路线。卢宗青是北京大学计算机学院长聘副教授、国家级青年人才,2025 年创立智在无界,同样只做模型。在接受虎嗅采访时,他直言:“中国和美国在具身智能上本质没有差距,因为双方都没有找到一条能快速训出具身基础模型的路线;数据路线基本定了,是人类视频,但怎么把这些数据变成一个真正通用的模型,谁都还没有答案。”

智在无界并非没有硬件。去年年底,公司发布了一款桌面级灵巧手机械臂 D1,据虎嗅独家获悉,其即将发布新一款同样形态的产品,面向科研、教育平台,做具身方面的预训练。但卢宗青强调,做不做硬件是随着模型能力提升之后的一个商业选择,不是立场。

卢宗青的技术路线选择始于一次失败的验证。2023 年,他在北大牵头的多模态交互研究中心尝试让多模态模型在《荒野大镖客》等游戏里自主完成任务,结果发现连数字世界里的交互都做不好。2024 年转向真实机器人,做了 Being-0 早期尝试,模型仍远达不到预期。2023 年底,他决定押注人类第一人称视频,当时几乎没有人做这件事,直到 2025 年下半年,行业才集体转向。

智在无界的模型迭代速度惊人:从 2025 年 7 月的 H0(3000 小时数据)到 2026 年 1 月的 H0.5(3.5 万小时,支持跨本体控制 30 多种机器人),再到 4 月的 H0.7(20 万小时数据,采用 latent world action model 范式),端侧部署推理速度做到 30 赫兹,然后就是最新的 H0.8,50 万小时人类第一人称数据。卢宗青表示,H0.8 的发布代表一个重要节点,不仅是从视觉到触觉、从观察世界到理解交互的模型能力进化,更预示着一个同时具备视觉理解、触觉交互、动作生成、世界预测、跨本体泛化的具身基础模型即将诞生。

支撑这条迭代曲线的,是一套从数据管线、模型预训练、后训练、评测到端侧部署的全栈基础设施建设。卢宗青认为,最大的壁垒是把人类视频数据做成一个能卖出去的模型的整条 pipeline,包括数据 infra、模型训练 infra、端侧算力部署 infra,以及适配各种真机的模块化工程 infra。这些经验是过去两年多积累下来的。

在数据标注方面,智在无界完全实现了 AI 化。50 万小时的数据大部分是自己标注的,有自动化 pipeline 自动标注、对齐、评测。特别的是,他们的数据还有手部动作的标注,标的是手的每个关节在世界坐标系下的坐标,这样才能训练输出动作的具身模型。

关于算力,卢宗青表示他们的训练范式对算力消耗非常小,大概只有基于视频生成模型做 world action model 的百分之一。原因在于学习范式:视频生成模型要预测每一个像素,而隐式世界动作模型只需预测一个 embedding 或 latent state。推理层面,模型最终要部署在机器人上,关键在于端侧芯片的推理速度,他们现在能做到 30 赫兹,应该是全球世界模型里跑得最快的。

对于世界模型的定义,卢宗青认为现在市面上没有一个模型可以称为世界模型。当前语境下,世界模型更多是一个宽泛的概念。对具身来讲,世界模型就是一个具身的基础模型,能够驱动机器人干各种各样的事情。现在具身领域说的世界模型,更准确应该叫 world action model,和 VLA 做区分,但他们真正达到世界模型的能力了吗?其实并没有。

卢宗青还提到,目前还没有观察到类似 GPT-3.5 那样的涌现,还处在线性爬坡阶段。但他对行业前景保持乐观,认为随着人类视频数据规模的增长,具身基础模型的能力将持续进化。