OpenAI 釋出新一代模型 GPT-6 Astra 後,其影響已從語言與多模態領域蔓延到具身智慧。社交平台上出現不少網友測試用 Astra 控制機械臂的影片,隨之而來的是「具身智慧要被通用語言大模型降維打擊」的討論。9 月 10 日,在 2026 外灘大會「物理智慧」論壇上,自變數機器人創始人兼執行長 王潛 對這一話題給出了自己的判斷。
王潛認為,「降維打擊」說法背後真正的擔憂,是基礎模型能否憑藉在其他領域積累的通用智慧,直接泛化到具身智慧上。他的觀點是,目前這種可能性不大。他解釋說,GPT 本身已經升級為多模態模型,OpenAI 此前曾大量採購機器人資料,Astra 版本的訓練中已加入機器人資料,因此它能控制機械臂並不令人意外。
在他看來,智慧的本體存在於資料與評估之中。訓練階段,模型更多扮演「蒸餾器」的角色,而部署階段則更像一個「容器」。他由此提出,今天要打造前沿 AI 系統,模型本身發揮的作用已經變小;語言模型的進步,一部分來自模型規模擴大,但更多還是源於資料質量的提升——投入在資料生產、篩選、驗證、標註等環節的工作,才是推動 AI 系統發展的關鍵。
王潛還以語言模型的演進路徑作類比。他指出,由於程式碼資料最容易生成和驗證,程式碼能力最先被攻克,之後才是 3D 與影片生成。他據此推演,如果 OpenAI 要做具身智慧,一系列問題會隨之而來:是否要像具身智慧企業那樣依賴資料與驗證的基礎設施、是否要自研硬體等。這些事情的難度並不會因為基礎模型的優勢而降低,反而具身智慧公司可能握有實質性優勢。
他補充說,即便當前影片生成模型已經表現不錯,這種能力也沒有直接轉化為機器人在動作控制上的優勢。不過,王潛也認為,GPT-6 操控機器人的表現反而給具身智慧行業帶來啟示,例如通用資料預訓練確實有效。他判斷,最後可能出現的情況是,OpenAI 把資料融入通用大模型,但仍無法在機器人上以合理速度完成推理與部署;行業裡依然需要專門的具身大模型來承擔這一任務。
從行業視角看,這場討論的實質是兩條路線的分工問題:通用大模型擅長語義理解與多模態生成,而具身智慧需要在真實物理環境中完成感知、決策與執行的閉環,對即時性、資料採集與硬體適配的要求截然不同。王潛的表態代表了具身智慧創業公司的一種典型立場——通用模型的進步可以成為基礎設施,但難以直接替代垂直領域的工程積累。這一判斷是否成立,仍有待後續產品與落地資料檢驗。