家庭場景被視為人形機器人最具潛力的落地市場,但也是技術挑戰最大的考場。與工廠中結構化的流水線不同,家庭環境充滿隨機變數:桌面可能堆滿雜物,地面散落玩具,從冰箱取物需側身繞過椅子,擦桌子時需隨擦拭範圍不斷調整站位。這些看似平常的家務,對人形機器人而言卻構成巨大考驗。

近日,由南洋理工大學北京大學香港科技大學(廣州)智源研究院聯合提出的ω-0——一款隱空間預測世界動作模型,為破解這一難題提供了新思路。輸入語言指令後,ω-0可同步識別環境、感知自身狀態,直接輸出底層控制系統可讀取的精簡動作特徵,支撐機器人完成“邊移動邊操作”的全身協同任務。

研發團隊對ω-0進行了全方位真機測評,選取11項高難度居家實操任務,重點考核動態協同、環境適配與自主決策能力,涵蓋跨區域物品收納、高低位雜物清理、床上衣物拾取等典型複合場景。實測結果顯示,ω-0 Ego第一視角任務成功率達79.1%ω-0 Omni全場景模式成功率高達81.8%,全面超越了ω-0.5、EgoVLA、GR00T-N1.7等主流行業基線模型。

從“先走後做”到“邊走邊做”,是ω-0的核心突破。過去幾年,機器人的行走與操作能力各自取得長足進步,但部署到人形機器人時,多數系統採用“分步走”策略:先移動到目標附近站穩,再啟動手臂操作。這種模式在簡單場景尚可應付,一旦遇到連續作業的家庭任務便暴露弊端——擦大尺寸桌子時,機械臂伸到極限後必須邁步才能繼續,但邁步同時還要保持抹布貼住桌面;拖地時,拖把運動直接影響身體受力,雙腿必須隨手臂動作不斷調整重心。任何環節獨立決策,都可能造成動作卡頓、接觸中斷甚至失去平衡。

ω-0摒棄了耗時的影片到動作(video-to-action)逆向轉換,轉而構建統一的查詢表徵(Query-based Representation)架構。在這一架構中,未來視覺特徵提供任務進度和場景演變的宏觀指引,動作分支則直接生成可供底層控制器執行的全身動作潛在指令。

為適配真實居家場景的複雜需求,團隊搭建了三階段遞進式訓練體系:第一階段進行全身動作VLM專屬預訓練;第二階段借鑑V-JEPA技術思路,融合視覺、語言、機器人本體多維資料,通過影片查詢預判未來環境特徵,將場景動態變化資訊注入動作表徵體系;第三階段引入海量真實居家移動操作資料,進行真實場景精細化微調,讓機器人自主適配各類居家場景。

同時,為支撐龐大訓練需求,研究團隊開源了真實世界家庭人形機器人資料集ω-HOME,包含40.3小時真實環境資料、4827條任務軌跡24項任務,每條軌跡均含同步採集的語言指令、第一視角與第三視角、本體狀態、全身運動軌跡等資料,降低了下游任務訓練對示範資料的依賴。

81.8%的成功率是一個令人振奮的數字,但距離真正融入家庭、長期自主執行的機器人仍有很長的路要走。不過,ω-0為行業指明瞭一個方向:將機器人的全身作為一個整體來思考,而非把腿和手當作各自為政的部門。當機器人學會在移動中操作、在操作中調整姿態,才可能從“實驗室演示”走向“生活化服務”。