据媒体报道,具身智能领域权威评测WorldArena 2.0 Track 1近日公布最新成绩,昆仑行机器人研发的昆仑世界模型GeWu以69.58分斩获图像质量(Image Quality)单项冠军,同时以65.91的综合得分获得全球榜单亚军。该模型在物理一致性(Physics Adherence)、可控性(Controllability)等多项关键能力维度上实现大幅领先,是本次77支参赛模型中唯一一个在6大评测维度中,获得其中4项前4名次的模型,展现出较强的综合能力。

WorldArena由国际顶尖高校及科研机构联合共建,作为世界模型赛道的权威评测基准,WorldArena 2.0在1.0基础上构建全面基准,从模态、功能、平台三大关键维度扩展具身世界模型评估。本次评测的Track 1赛道聚焦具身智能模型的基础核心能力,重点考核模型“看得准、猜得对、画面真实合理”的核心素养,突出模型在物理因果上的合理性。该赛道吸引了全球几乎所有顶尖世界模型研发团队同台竞技,被誉为具身世界模型的“国际竞技场和权威试金石”。

昆仑行机器人作为2026年具身智能领域的黑马玩家,在短时间内完成模型训练、优化和多次迭代。作为昆仑世界模型(Kunlun World Model)的第一代版本,GeWu初次亮相即实现全面领先,尤其在物理一致性和可控性上的优秀表现,体现出研发团队对世界模型物理因果的深刻理解和架构创新。

业内已逐渐形成共识,一个优秀的具身机器人大脑,不能只简单地模拟动作,更关键在于它能否理解真实的物理世界,尤其是严格遵循物理因果关系。在这样的背景下,“世界模型”成为当下最热门的概念。在具身领域,世界模型可以基于用户输入“渲染”出相当真实的画面,也可以基于某种转移模型“模拟”状态的变化,还可以反过来,给定当前观测和未来目标,“规划”智能体的动作。

昆仑行认为,一个真正理解物理因果的世界模型不能局限于“渲染”——即生成视觉上真实但物理上不可靠的视频——世界模型必须具备模拟器的能力:理解真实世界的物理因果,忠实地预测“如果执行某个动作,世界会如何变化”。模拟是世界模型最关键的能力,掌握了模拟,模型才有可能具备规划能力;反过来则不行。因此,基于「物理因果」的第一性原理,成为昆仑世界模型架构设计的基本原则。

有别于业内主流的按照“文本归文本、视觉归视觉、动作归动作”的模态拆分方式,昆仑世界模型将视野放在因果关系这一深层结构上。模型不按模态拆分,而是按因果图中的角色语义,拆为三座参数独立的Transformer塔(Tower):Tower 1负责Intent(目的),以自回归方式编码语言指令和场景理解,确定“要做什么”;Tower 2负责Intervention(干预),以flow matching范式建模动作序列,确定“怎么做”;Tower 3负责Consequence(响应),同样基于flow matching生成未来视频帧,呈现“做了之后会发生什么”。三座塔共享decoder基础结构,但每层拥有独立的投影矩阵、前馈网络和归一化参数。

这一拆分的关键价值体现在塔间的信息流控制上。昆仑世界模型通过联合因果注意力机制(United Causal Attention),在三塔之间施加严格的单向可见性约束:Tower 2可以看到Tower 1,但不能看到Tower 3;Tower 3可以同时看到Tower 1和Tower 2。这意味着“行动决策”可以参考“任务目的”,但不能偷看“尚未发生的视觉后果”;而“视频渲染”需要同时知道“要做什么”和“怎么做”,才能生成物理因果上合理的画面。

消融实验印证了这一设计的必要性:一旦切断其中任意一条注意力通路,模型便会迅速从“因果仿真”退化为“默写模式”——它不再依据具体动作推演物理后果,而是直接将任务描述映射到训练集中最相似的视频片段,产生违背物理规律的画面(如物体在无对应动作的情况下自行运动)。这一退化在评估模型物理合理性的核心维度交互质量(Interaction Quality)上表现得尤为明显。切断其中一条因果通路后,交互质量急剧下降,物体不能严格遵循末端夹爪的操作,接触后的行为表现不符合物理规律。昆仑世界模型在这个维度上取得了82.40分的高分,正是因果架构发挥作用的直接体现。

三塔架构还天然支持多任务的统一推理。借鉴UniDiffuser的思想——“作为条件”与“作为生成目标”不过是同一去噪过程在不同噪声水平下的两端——通过调整各塔的噪声参数,同一套架构和权重即可在世界模拟、策略推理、联合预测等多种模式之间灵活切换。当动作塔和视频塔同时处于生成状态时,昆仑世界模型采用异步调度策略,让动作塔的去噪进度始终领先于视频塔,确保视频生成看到的动作信息始终更干净、更可靠。

面对长时序视频生成的需求,昆仑行研发团队设计了Chunk-wise自回归方案:长视频被拆分为多个片段逐段生成,核心挑战在于后续片段的上下文缺失。为此,昆仑世界模型引入了仿生记忆采样策略——模仿人类记忆的衰减规律,近端帧高密度保留以维持运动连续性,远端帧稀疏采样以保留任务全局进度。配合绝对时序位置编码和帧率自适应放缩机制,模型在所有生成阶段都能准确感知物理时间位置,并灵活控制动作节奏。

最终,昆仑世界模型在WorldArena 2.0 Track 1基准测试中,以综合得分65.91获得全球亚军,并在图像质量单项上斩获冠军,在多项核心能力指标上实现全面领先。昆仑行机器人的模型研发负责人郝志会博士表示,在研发过程中反复验证了一个核心判断:世界模型的架构设计应当尊重物理世界的因果结构。目的驱动行动,行动产生结果,这条因果链不仅是人类理解物理世界的基本框架,也应当成为模型架构的第一性原理。当归纳偏置对齐问题本质时,不仅看到了指标的提升,也看到了训练效率和泛化能力的同步改善。

昆仑世界模型是昆仑行沿这一技术方向迈出的第一步。接下来,研发团队将在更复杂的任务场景中持续验证和扩展模型能力,并将昆仑世界模型应用于行为规划和仿真强化,推动世界模型从视觉渲染器进化为真正的物理智能基座。

昆仑行(Kunlunx AI)致力于打造面向物理世界的通用AI机器人,坚持“本体+大脑”双轮驱动战略,构建通用AI机器人本体、数据、小脑、大脑、智能体五位一体的全栈核心技术自研体系。公司认为物理因果是具身智能的第一性原理,不是模仿动作,而是理解世界。公司打造以物理因果为核心的昆仑世界模型(KWM),让AI机器人真正像人一样学习、理解、进化,推动物理AI从实验室走向真实场景的规模化应用。