小米釋出了其機器人AI基礎模型 Xiaomi-Robotics-1,該模型遵循與大語言模型相似的擴充套件規律:效能隨訓練資料量的增加而提升。但與傳統大模型依賴網際網路文本資料不同,機器人AI面臨獨特的資料瓶頸——有用的機器人運動資料極其稀缺。
為突破這一瓶頸,小米在資料收集階段幾乎完全放棄了實體機器人。研究團隊使用行動式手持夾持器,配備攝像頭,由人類直接操作並錄製各種操作任務。這些任務在廚房、辦公室、商店、工廠車間和戶外空間等超過 1700 種不同環境 中完成,最終積累了 超過 10 萬小時 的運動記錄。
如此龐大的資料集帶來了新的挑戰:每條記錄都需要文本描述供模型學習。手動標註不切實際,小米轉而使用另一個AI模型自動為每個運動片段生成描述,整個資料集的標註工作在大約 兩週 內完成。隨後,小米將訓練成果遷移至實體機器人,包括輪式模型和雙臂系統,並需要處理手持夾持器與機器人手臂之間的差異。
測試結果清晰地表明:更多訓練資料帶來的效能提升遠大於增加計算量。研究人員認為,機器人AI的進步將主要取決於收集更大、更多樣化的資料集。這一發現與今年3月初關於視覺資料的研究結論一致。對於語言模型,模型規模與資料量通常需大致同步增長以最佳化固定計算預算;但當模型處理影像而非文本時,增加資料的幫助遠大於擴大模型規模。
在實體機器人測試中,隨著訓練資料量的增加,模型在陌生環境中的成功率從約 25% 提升至 75%。研究人員表示,尚未觀察到資料量增加導致效能提升停滯的跡象。在標準機器人AI基準測試中,Xiaomi-Robotics-1 取得了迄今最佳成績。在一項演示中,一個機器人據稱在無人協助下完成了整理行李箱的任務,耗時超過十分鐘,需要機器人橫跨整個房間。
該基礎模型在快速適應新任務方面表現出色。在四項測試任務中——包括包裝手機、將衣物放入洗衣機、向印表機送紙以及將物品裝入箱子——每個任務僅使用不到 10 小時 的訓練資料,模型平均成功率即達到 75%。相比之下,Physical Intelligence 的競爭模型在同一測試中僅達到 40%。小米表示,其模型在處理紙張等柔軟、可變形材料以及需要移動的任務時表現尤為突出。在 RoboCasa365 排行榜上,Xiaomi-Robotics-1 以顯著優勢領先,尤其是在未見過的複合任務上。
機器人資料問題仍是該領域研究的焦點,不同團隊正探索截然不同的解決方案。今年5月一項關於世界動作模型的調查回顧了約100項研究,發現遙操作資料精確但成本高昂且侷限於少數場景。小米的手持夾持器正是為應對這些限制而設計。與此同時,輝達、卡內基梅隆大學和加州大學伯克利分校通過 ENPIRE 專案,讓AI編碼代理自主訓練一支由八台機器人組成的隊伍學習抓取物體;輝達還計劃通過生成合成訓練資料,將機器人資料問題轉化為計算問題。中國北京智源人工智慧研究院(BAAI) 則採取相反路線,其 Orca 世界模型從 12.5萬小時 無動作標籤的影片中學習,在五項操作任務上仍能與專門的 pi0.5 模型匹敵。小米的做法是自動化標註並大規模應用,而 Orca 則試圖完全消除標籤。Physical Intelligence 在這兩種方案中均作為參照點,該公司今年4月因 pi0.7 模型聲稱能泛化但可能只是回憶相似訓練資料而受到批評。
小米的發現表明,在機器人AI領域,資料量的擴充套件比模型規模的擴大更具決定性,但絕對成功率仍然較低,意味著該領域仍有巨大的提升空間。