輝達悉尼 RSS 2026 的機器人世界模型研討會上,釋出了其最新世界基礎模型 Cosmos 3。據輝達物理 AI 專家 Max Li 現場介紹,該模型首次在同一個 Transformer 架構下打通了文本、視覺、音訊與動作四種模態,旨在為具身智慧提供統一的“大腦”底座。這一發布正值 AI 行業從雲端算力向物理世界遷移的關鍵節點,被視為輝達佈局機器人生態的重要一步。

Cosmos 3 的核心設計圍繞“理解世界、模擬未來、執行動作”三大能力展開。它既能像視覺語言模型(VLM)一樣理解觀測影片,也能生成影片、音訊與動作,並通過逆動力學從影片反推底層動作,從而利用海量無標籤影片資料訓練策略。Max Li 強調,第一人稱視角資料是獲取物理互動知識的最有效途徑,團隊正與開源社群合作注入此類資料。

在架構上,Cosmos 3 採用混合專家(MoE) 設計,分為負責理解的“推理器”和負責跨模態生成的“生成器”。推理時使用因果自注意力,生成時使用雙向注意力。為統一不同機器人形態的動作向量,模型支援汽車、單臂、雙臂及人形機器人等多種具身,並通過啟發式規則在語義空間對齊動作。訓練分為動力學、逆動力學和策略三種模式,並採用24 FPS 基準線對齊不同幀率影片的時間軸。

模型家族包含三個版本:Cosmos Edge(40 億引數 MoE,適合邊緣裝置)、Cosmos Nano(160 億引數)和 Cosmos Super(640 億引數)。Max Li 特別指出,Edge 版本可在 Jetson 等端側裝置上即時推理,無需伺服器級 GPU,這標誌著具身智慧正從資料中心向邊緣側遷移。訓練資料方面,推理器預訓練使用了約 2200 萬個樣本,生成器預訓練資料摺合約 1000 萬小時影片,並經歷預訓練、中期訓練(引入動作與跨域資料)和後期訓練(針對策略輸出)三個階段。

Cosmos 3 完全開源,團隊釋出了模型、程式碼和詳細論文,參與人數超過 100 人。Max Li 表示將手動回覆 GitHub 上的所有 Issue,以支援社群應用。現場問答中,他回應了關於動作落地差距的問題,承認預訓練階段未包含控制資訊,但後期訓練引入控制訊號後模型才真正實用。他還提到,在機器人和具身智慧相關領域,引入動作顯著提升了未來視覺預測的精度,但全域性統計資料尚未完全驗證。

業內觀察認為,Cosmos 3 的釋出標誌著具身智慧從“組裝機”時代(開發者拼湊視覺、語言、控制模型)邁向“整機一體化”時代。輝達試圖通過定義標準化的“大腦與肢體”協議,讓碎片化的機器人形態在統一邏輯底座上進化,其野心不僅是硬體壟斷,更是成為具身智慧時代的“安卓系統”。不過,傳統機器人學界對物理因果的敬畏與 AI 工業界對規模效應的迷信之間的張力,仍是這一範式能否落地的關鍵考驗。