在近期舉辦的頂尖學術會議RSS 2026上,佐治亞理工學院助理教授、NVIDIA研究員徐丹飛(Danfei Xu)發表主旨演講《組合式世界模型》(Compositional World Models),直擊當前具身智慧領域的一個核心矛盾:高保真影片生成並不等同於真正的機器人規劃能力。
徐丹飛指出,隨著以Sora為代表的高保真影片生成技術走向成熟,模型已能為機器人構建出極其逼真的未來畫面,讓人感覺通用人工智慧(AGI)似乎觸手可及。然而,回到真實物理世界,令人困惑的現象出現了:即便模型能預測出完美的未來畫面,機械臂在實際落地執行時依然頻頻失效。這暴露出行業內長期被忽視的核心矛盾——能夠“生成”成功的結果,絕不等同於擁有真正的“規劃能力”。面對未曾見過的長流程任務與複雜的物理約束,機器人陷入了“看得懂畫面,做不出動作”的瓶頸。
為破解這一難題,徐丹飛提出了一套利用模組化與因子圖(Factor Graphs)的解法。他主張讓機器人像搭積木一樣,在測試階段動態拼裝基礎技能。當需要按順序執行兩個技能時,邏輯類似於接力賽——前一個技能終止時的狀態分佈,必須精準覆蓋後一個技能能成功啟動的起始狀態區間。這個重疊的狀態交集,就是技能之間能否順暢銜接的“契約”。藉助因子圖,可以在時空維度上自由定義各種約束條件:空間維度上精確約束機械臂末端與目標物體之間的相對姿態;時間維度上確保物體在移動過程中與機械臂保持物理同步;多臂協同方面,過去需要專門採集大量雙手協同資料,現在只需訓練好單臂技能,在測試時通過因子圖將兩個單臂模型進行約束組合即可。在這種機制下,機器人能順利完成單臂難以應對的複雜任務,例如雙手協同抬起沉重的雙耳鍋並旋轉角度,或者左手遞出錘子、右手精準接住並敲擊釘子。
徐丹飛還首次深刻剖析了影片預測與真實控制之間的“影片-動作跨越斷層(Video-Action Gap)”。他解釋,目前的影片大模型吸收了全網極高量級的視覺資料,具備極強的泛化能力;而機器人底層的動作資料卻極其匱乏,導致影片生成模型已成功泛化到新場景,但動作控制模型出現泛化滯後。為量化這一斷層,他提出了時間注意力比例(Temporal Ratio)這一新測量指標,用以診斷模型在即時控制過程中,究竟將注意力權重分配給了“預測的未來”還是“眼前的當下”。通過這一指標,他們發現:當機器人處於接近目標階段時,它高度依賴對未來的軌跡預測,時間注意力比例顯著偏高;而一旦進入物理接觸與抓取階段,其注意力會瞬間迴歸到“當前幀”,轉而由即時的觸覺與視覺微調主導。基於此,可以在測試期引入策略引導,在接近目標時強化模型對未來的前瞻注意力,在接觸物體的瞬間拉回注意力關注當下,顯著提升了模型在面對分佈外複雜任務時的真實執行成功率。
在演講後的問答環節,徐丹飛還就訓練資料中的失敗樣本、世界模型與策略模型是否應融合等議題分享了見解。他認為,一旦構建出能深刻理解物理約束的規劃演算法,預測“某種動作會導致失敗”的價值絕不亞於預測成功;同時,他傾向於保持世界模型與策略模型的分立與獨立性,因為兩者對資料利用方式的本質差異——策略模型偏好高質量的成功資料,而世界模型需要吞下海量失敗與異常資料才能完整構建對物理世界全貌的認知。