在 2026 年 RSS 大會最後一天的 workshop 圓桌討論中,一場圍繞具身智慧世界模型實際落地的辯論火藥味十足。五位來自學界與產業界的專家分成兩派,就三個核心辯題展開正面碰撞。現場觀眾通過投票即時表達立場,最終結果出人意料:來自 Physical Intelligence 的 Laura Smith 在三輪辯論中均告失利,而徐丹飛等學者主導的“分開派”“動作派”和“網際網路影片派”分別勝出。

第一輪辯論:世界模型和策略模型,應該合體還是分開?

主持人丟擲首個問題後,現場迅速形成兩大陣營。支援“合體”的 PI 科學家 Laura Smith 和輝達 Max Li 主張將所有功能塞進一個超級模型,認為 MoE 架構已證明多專家可共存於同一網路,未來必然走向全能大模型。Max Li 補充指出,當前關鍵是通過表徵學習將世界模型的“想象力”轉化為機器人的執行力。

反對“合體”的一方——谷歌 Sherry Yang、源策未來陳立(Lee)和徐丹飛——從工程效率出發提出質疑。陳立強調機器人即時任務對響應速度的嚴苛要求,合體可能拖慢策略模型導致動作卡頓。Sherry Yang 指出,世界模型需要大量失敗資料理解物理規律,而策略模型主要學習成功行為,合體會導致訓練目標衝突。徐丹飛補充說,分開除錯能快速定位故障環節,合體則形成黑箱難以追責。現場觀眾投票中,“分開派”略佔優勢。

第二輪辯論:可控性到底靠畫素,還是動作?

這一輪陣營重組。支援“畫素派”的 Max Li 認為影片是最自然的監督訊號,高保真畫面是人類除錯系統的便利介面。Laura Smith 表示,影片能直觀展示機器人失敗時的責任歸屬。

反方“動作派”徐丹飛和 Sherry Yang 則指出,過度追求畫素級真實性會浪費算力,機器人最終要執行可靠物理動作。Sherry Yang 分享了自己的“倒戈”經歷:她曾是畫素派,但實驗發現單純堆畫素在精細接觸任務中仍不穩定,因此更傾向引入語義資訊和物理先驗。徐丹飛強調,人類在黑暗中抓取物品依賴觸覺和力反饋而非視覺畫面,判斷世界模型好壞應看其能否產出真正的動作價值。現場投票更傾向於動作派。

第三輪辯論:資料該從哪裡來?

最後一輪直指根本問題。支援“網際網路影片派”的徐丹飛、Sherry Yang 和 Max Li 主張人類影片資料規模巨大,能極大提升泛化能力。徐丹飛指出,純機器人資料規模有限,難以覆蓋長尾場景。Sherry 補充說,人類本身就是最強大的物理代理,人類影片可視為另一種機器人資料。

支援“具身控制派”的陳立和 Laura Smith 則認為,網際網路影片對高精度具身應用幫助有限,頂多規劃子目標,底層控制仍需機器人真實資料。陳立直言業界盲目崇拜網際網路資料,但具體應用還得死磕具身資料。現場投票中,網際網路影片派以 61% 勝出。

三輪辯論結束後,Laura Smith 三次落敗引發現場小插曲。但嘉賓們達成共識:世界模型是機器人走向通用的關鍵,未來突破可能來自更聰明的組合機制、更平衡的資料策略以及理論與工程的緊密結合。徐丹飛在最後表示:“我們現在看到的只是冰山一角。未來幾年,這個領域會非常熱鬧。”