據媒體報道,具身智慧領域權威評測WorldArena 2.0 Track 1近日公佈最新成績,崑崙行機器人研發的崑崙世界模型GeWu以69.58分斬獲影像質量(Image Quality)單項冠軍,同時以65.91的綜合得分獲得全球榜單亞軍。該模型在物理一致性(Physics Adherence)、可控性(Controllability)等多項關鍵能力維度上實現大幅領先,是本次77支參賽模型中唯一一個在6大評測維度中,獲得其中4項前4名次的模型,展現出較強的綜合能力。

WorldArena由國際頂尖高校及科研機構聯合共建,作為世界模型賽道的權威評測基準,WorldArena 2.0在1.0基礎上構建全面基準,從模態、功能、平台三大關鍵維度擴充套件具身世界模型評估。本次評測的Track 1賽道聚焦具身智慧模型的基礎核心能力,重點考核模型“看得準、猜得對、畫面真實合理”的核心素養,突出模型在物理因果上的合理性。該賽道吸引了全球幾乎所有頂尖世界模型研發團隊同台競技,被譽為具身世界模型的“國際競技場和權威試金石”。

崑崙行機器人作為2026年具身智慧領域的黑馬玩家,在短時間內完成模型訓練、最佳化和多次迭代。作為崑崙世界模型(Kunlun World Model)的第一代版本,GeWu初次亮相即實現全面領先,尤其在物理一致性和可控性上的優秀表現,體現出研發團隊對世界模型物理因果的深刻理解和架構創新。

業內已逐漸形成共識,一個優秀的具身機器人大腦,不能只簡單地模擬動作,更關鍵在於它能否理解真實的物理世界,尤其是嚴格遵循物理因果關係。在這樣的背景下,“世界模型”成為當下最熱門的概念。在具身領域,世界模型可以基於使用者輸入“渲染”出相當真實的畫面,也可以基於某種轉移模型“模擬”狀態的變化,還可以反過來,給定當前觀測和未來目標,“規劃”智慧體的動作。

崑崙行認為,一個真正理解物理因果的世界模型不能侷限於“渲染”——即生成視覺上真實但物理上不可靠的影片——世界模型必須具備模擬器的能力:理解真實世界的物理因果,忠實地預測“如果執行某個動作,世界會如何變化”。模擬是世界模型最關鍵的能力,掌握了模擬,模型才有可能具備規劃能力;反過來則不行。因此,基於「物理因果」的第一性原理,成為崑崙世界模型架構設計的基本原則。

有別於業內主流的按照“文本歸文本、視覺歸視覺、動作歸動作”的模態拆分方式,崑崙世界模型將視野放在因果關係這一深層結構上。模型不按模態拆分,而是按因果圖中的角色語義,拆為三座引數獨立的Transformer塔(Tower):Tower 1負責Intent(目的),以自迴歸方式編碼語言指令和場景理解,確定“要做什麼”;Tower 2負責Intervention(干預),以flow matching範式建模動作序列,確定“怎麼做”;Tower 3負責Consequence(響應),同樣基於flow matching生成未來影片幀,呈現“做了之後會發生什麼”。三座塔共享decoder基礎結構,但每層擁有獨立的投影矩陣、前饋網路和歸一化引數。

這一拆分的關鍵價值體現在塔間的資訊流控制上。崑崙世界模型通過聯合因果注意力機制(United Causal Attention),在三塔之間施加嚴格的單向可見性約束:Tower 2可以看到Tower 1,但不能看到Tower 3;Tower 3可以同時看到Tower 1和Tower 2。這意味著“行動決策”可以參考“任務目的”,但不能偷看“尚未發生的視覺後果”;而“影片渲染”需要同時知道“要做什麼”和“怎麼做”,才能生成物理因果上合理的畫面。

消融實驗印證了這一設計的必要性:一旦切斷其中任意一條注意力通路,模型便會迅速從“因果模擬”退化為“默寫模式”——它不再依據具體動作推演物理後果,而是直接將任務描述對映到訓練集中最相似的影片片段,產生違揹物理規律的畫面(如物體在無對應動作的情況下自行運動)。這一退化在評估模型物理合理性的核心維度互動質量(Interaction Quality)上表現得尤為明顯。切斷其中一條因果通路後,互動質量急劇下降,物體不能嚴格遵循末端夾爪的操作,接觸後的行為表現不符合物理規律。崑崙世界模型在這個維度上取得了82.40分的高分,正是因果架構發揮作用的直接體現。

三塔架構還天然支援多工的統一推理。借鑑UniDiffuser的思想——“作為條件”與“作為生成目標”不過是同一去噪過程在不同噪聲水平下的兩端——通過調整各塔的噪聲引數,同一套架構和權重即可在世界模擬、策略推理、聯合預測等多種模式之間靈活切換。當動作塔和影片塔同時處於生成狀態時,崑崙世界模型採用非同步排程策略,讓動作塔的去噪進度始終領先於影片塔,確保影片生成看到的動作資訊始終更乾淨、更可靠。

面對長時序影片生成的需求,崑崙行研發團隊設計了Chunk-wise自迴歸方案:長影片被拆分為多個片段逐段生成,核心挑戰在於後續片段的上下文缺失。為此,崑崙世界模型引入了仿生記憶取樣策略——模仿人類記憶的衰減規律,近端幀高密度保留以維持運動連續性,遠端幀稀疏取樣以保留任務全域性進度。配合絕對時序位置編碼和幀率自適應放縮機制,模型在所有生成階段都能準確感知物理時間位置,並靈活控制動作節奏。

最終,崑崙世界模型在WorldArena 2.0 Track 1基準測試中,以綜合得分65.91獲得全球亞軍,並在影像質量單項上斬獲冠軍,在多項核心能力指標上實現全面領先。崑崙行機器人的模型研發負責人郝志會博士表示,在研發過程中反覆驗證了一個核心判斷:世界模型的架構設計應當尊重物理世界的因果結構。目的驅動行動,行動產生結果,這條因果鏈不僅是人類理解物理世界的基本框架,也應當成為模型架構的第一性原理。當歸納偏置對齊問題本質時,不僅看到了指標的提升,也看到了訓練效率和泛化能力的同步改善。

崑崙世界模型是崑崙行沿這一技術方向邁出的第一步。接下來,研發團隊將在更復雜的任務場景中持續驗證和擴充套件模型能力,並將崑崙世界模型應用於行為規劃和模擬強化,推動世界模型從視覺渲染器進化為真正的物理智慧基座。

崑崙行(Kunlunx AI)致力於打造面向物理世界的通用AI機器人,堅持“本體+大腦”雙輪驅動戰略,構建通用AI機器人本體、資料、小腦、大腦、智慧體五位一體的全棧核心技術自研體系。公司認為物理因果是具身智慧的第一性原理,不是模仿動作,而是理解世界。公司打造以物理因果為核心的崑崙世界模型(KWM),讓AI機器人真正像人一樣學習、理解、進化,推動物理AI從實驗室走向真實場景的規模化應用。