英伟达悉尼 RSS 2026 的机器人世界模型研讨会上,发布了其最新世界基础模型 Cosmos 3。据英伟达物理 AI 专家 Max Li 现场介绍,该模型首次在同一个 Transformer 架构下打通了文本、视觉、音频与动作四种模态,旨在为具身智能提供统一的“大脑”底座。这一发布正值 AI 行业从云端算力向物理世界迁移的关键节点,被视为英伟达布局机器人生态的重要一步。

Cosmos 3 的核心设计围绕“理解世界、模拟未来、执行动作”三大能力展开。它既能像视觉语言模型(VLM)一样理解观测视频,也能生成视频、音频与动作,并通过逆动力学从视频反推底层动作,从而利用海量无标签视频数据训练策略。Max Li 强调,第一人称视角数据是获取物理交互知识的最有效途径,团队正与开源社区合作注入此类数据。

在架构上,Cosmos 3 采用混合专家(MoE) 设计,分为负责理解的“推理器”和负责跨模态生成的“生成器”。推理时使用因果自注意力,生成时使用双向注意力。为统一不同机器人形态的动作矢量,模型支持汽车、单臂、双臂及人形机器人等多种具身,并通过启发式规则在语义空间对齐动作。训练分为动力学、逆动力学和策略三种模式,并采用24 FPS 基准线对齐不同帧率视频的时间轴。

模型家族包含三个版本:Cosmos Edge(40 亿参数 MoE,适合边缘设备)、Cosmos Nano(160 亿参数)和 Cosmos Super(640 亿参数)。Max Li 特别指出,Edge 版本可在 Jetson 等端侧设备上实时推理,无需服务器级 GPU,这标志着具身智能正从数据中心向边缘侧迁移。训练数据方面,推理器预训练使用了约 2200 万个样本,生成器预训练数据折合约 1000 万小时视频,并经历预训练、中期训练(引入动作与跨域数据)和后期训练(针对策略输出)三个阶段。

Cosmos 3 完全开源,团队发布了模型、代码和详细论文,参与人数超过 100 人。Max Li 表示将手动回复 GitHub 上的所有 Issue,以支持社区应用。现场问答中,他回应了关于动作落地差距的问题,承认预训练阶段未包含控制信息,但后期训练引入控制信号后模型才真正实用。他还提到,在机器人和具身智能相关领域,引入动作显著提升了未来视觉预测的精度,但全局统计数据尚未完全验证。

业内观察认为,Cosmos 3 的发布标志着具身智能从“组装机”时代(开发者拼凑视觉、语言、控制模型)迈向“整机一体化”时代。英伟达试图通过定义标准化的“大脑与肢体”协议,让碎片化的机器人形态在统一逻辑底座上进化,其野心不仅是硬件垄断,更是成为具身智能时代的“安卓系统”。不过,传统机器人学界对物理因果的敬畏与 AI 工业界对规模效应的迷信之间的张力,仍是这一范式能否落地的关键考验。