在機器人頂級學術會議RSS 2026現場,來自Google實驗室和紐約大學(NYU)的助理教授Sherry Yang展示了一項可能改變具身智慧研發範式的研究。她提出的World Gym框架,核心是利用可控的影片生成模型作為真實世界的數字替身,讓機器人在雲端虛擬場景中完成無限次低成本演練,從而繞過物理世界中高昂的真機試錯成本。

當前,具身智慧領域面臨的核心困境是:雖然深度神經網路已具備高容量,但現實世界中每一次真機互動都伴隨著時間損耗、裝置磨損和安全風險。相比之下,遊戲和程式碼等虛擬領域的互動成本幾乎為零,這正是AlphaGo和大語言模型能快速進化的關鍵。Sherry Yang認為,如果能將物理代理的互動成本降下來,機器人也能像大模型一樣利用海量資料自我進化。

World Gym正是這一思路的產物。該模型採用可擴充套件的Diffusion Transformer(DiT)架構,通過接收前序影像和當前控制指令,持續生成未來的影片畫面。值得關注的是,研究團隊僅用兩張A100 GPU就在Bridge資料集下訓練出泛化能力出色的模型,打破了“世界模型研究只能由資源壟斷的超級大廠進行”的刻板印象。該模型在包含22種機器人形態的多樣化資料集上訓練,生成的影片與真機執行動作畫面高度一致。

World Gym首先被用作標準化評估層。研究團隊將業內主流策略模型(如Octo、OpenVLA、RT-1)放入其中進行滾動測試。在一個“把茄子放進鍋裡”的任務中,OpenVLA表現完美,Octo動作未完全完成,而老模型RT-1因輸出動作完全超出分佈(OOD),甚至“帶崩”了世界模型——但這恰恰體現了世界模型的價值:它提前預警了真機執行可能導致的損壞。此外,通過影像編輯,研究人員可以定製任意長尾場景進行安全測試,例如在場景中加一張電腦螢幕並命令策略“去把胡蘿蔔拔出來”,結果策略模型竟衝向螢幕。資料顯示,世界模型得出的評估結果與真機實測成功率呈強烈正相關性

在提升策略方面,團隊推出了World Gymnast專案,讓機器人代理在世界模型中通過強化學習(RL)進行演練。與當前多數依賴人類遙控資料做監督微調的方法不同,World Gymnast借鑑大語言模型的發展經驗(從GPT-3到ChatGPT),利用驗證器和RL大規模擴增訓練任務。機器人資料集中的任意畫面(包括失敗畫面)都可作為RL起點,逼著策略模型學會從錯誤狀態中恢復(Failure Recovery)。視覺語言模型(VLM)作為通用獎勵模型,根據任務指令和世界模型生成的影片給出成功或失敗反饋,並通過策略梯度對策略網路線上更新。在開門、關門、放茄子等4個全新留存任務的真機測試中,經過世界模型RL訓練的模型表現顯著優於監督微調,也擊敗了在傳統物理模擬器(如Simpler)中訓練的基準模型。

Sherry Yang在演講中展望了未來方向:建立混合資料飛輪。內環是策略模型在引數化的影片世界模型中進行成千上萬種虛擬任務的低成本RL進化;外環是機器人自主探索產生失敗資料,這些資料可直接用於梯度更新世界模型,使其更精確。她還指出,網際網路上龐大的第一視角人類互動影片是巨大寶藏,未來可通過世界模型將網際網路影片的“廣度”與機器人具身控制資料的“精度”橋接起來,敲開通用機器人的大門。

在問答環節,針對“策略模型不工作導致世界模型也不工作”的悖論,Sherry Yang回應稱,可以利用真機自主探索產生的失敗資料優先更新世界模型,拓寬其模擬邊界,從而形成相互促進的飛輪。