8月20日,在2026世界機器人大會上,自變數機器人創始人、執行長王潛發表演講,明確表示物理世界的通用智慧並非遙不可及,機器人廣泛進入家庭和各行各業“絕對不用等五年、十年”。這一判斷直接回應了當前行業對機器人普及節奏的兩極化預期。
王潛本科、碩士均畢業於清華大學,後赴南加州大學攻讀博士,從事機器人學習、人機互動研究。他是較早將注意力機制引入神經網路研究的學者之一。2023年12月,他在深圳創立自變數機器人,聚焦端到端通用具身智慧基礎模型研發,目標是構建能理解並作用於物理世界的“通用大腦”。
在演講中,王潛圍繞具身智慧的底層技術邏輯、訓練資料與基礎設施建設、產業商業化落地三大維度展開論述。他認為,具身智慧的關鍵任務並非跑步、跳舞或攀巖,而是精細操作(Manipulation)。全身運動控制主要對抗重力場,而抓取、使用工具等操作涉及遮擋、不確定性、三維空間結構及複雜接觸過程,引數空間會迅速膨脹。即使在機器人運動能力快速提升的當下,通用抓取仍是困難任務,這決定了機器人需要端到端的基礎模型。
王潛還指出,很多人認為可將多模態模型遷移到物理世界,但他認為“可能性比較低”。物理世界的性質難以通過其他模態獲得,動作模態與視覺、語言模態差異顯著,網際網路影片也無法完整記錄摩擦、受力和接觸等物理資訊。因此,具身模型應成為與數字世界基礎模型平行的另一類基礎模型。自變數的技術路線是打造完全通才的模型,聯合處理動作生成、影片預測、語言、三維重建等任務,讓不同模態在統一訓練中建立聯絡,模型不僅要輸出動作,還要學習物體運動、環境變化及操作結果,形成對物理規律的理解。
關於資料問題,王潛提出資料不應簡單類比為“石油”。石油是相對標準化的原材料,而真正用於訓練具身模型的資料更像鏈條長、加工複雜的工業品,“極度複雜”。生產過程覆蓋任務定義、採集、質量判斷、處理、訓練驗證和反向最佳化,複雜程度可能高於模型本身。自變數已搭建覆蓋硬體、資料處理流水線和模型訓練的資料體系,並提高非真機資料利用效率。公司還將VLA模型、世界模型、訓練部署工具及部分資料和基礎設施開源,以降低行業重複建設成本、培養人才、加快模型迭代。
在AI基礎設施方面,王潛認為具身AI Infra並不比語言模型Infra簡單,甚至更難,因為大部分機器人整合需與硬體打交道,硬體性質帶來大量通訊和同步問題。
家庭場景是王潛此次演講的重點。2026年4月21日,自變數宣佈搭載具身智慧基礎模型WALL-B的新一代機器人將在35天后進入首批真實家庭。王潛當時表示,希望機器人入戶第一天就能處理大部分家務,但並非所有任務都能由AI自主完成,必要時需遠端人員兜底。在本次大會上,他披露機器人已為數百戶家庭提供保潔服務,除與平台合作參與鐘點保潔外,也有機器人長期駐留客戶家中,能與使用者產生情感連線並即時獲得反饋。
工業場景也被視為基礎模型路線的階段性驗證。王潛稱,自變數已在真實工業產線部署機器人,相關場景投資回報率達到或超過人工水平,專案從資料採集、模型訓練到生產部署約用時三個月。他認為,基礎模型的泛化能力正縮短單一場景開發週期,具身智慧已從展示和情緒價值場景轉向生產力場景。
王潛觀察到,社會注意力和機器人模型發展存在“微妙的錯位”:去年很多人樂觀認為一年內機器人可進入家庭,今年又有很多人悲觀認為需五到十年。他保持樂觀,判斷“五年後回過頭看,已經生活在機器人進入千行百業、千家萬戶的世界裡,或者已經基本能替代人類體力勞動的世界裡”。