7月19日,2026世界人工智慧大會(WAIC)的核心分論壇“智啟具身論壇2026——迎接物理AI智慧湧現”在上海世博中心舉行。論壇由智元與覓蜂科技聯合主辦,匯聚了清華大學、佐治亞理工學院、Physical Intelligence、Genesis AI、Dyna Robotics、Sunday Robotics及騰訊Robotics X等機構的代表,核心議題圍繞物理AI的資料來源、模型路線、模擬訓練與商業化部署展開。

智元合夥人、高階副總裁、具身業務部總裁,覓蜂科技董事長兼CEO姚卯青在主旨演講中提出,物理AI要從“模型演示”跨向規模化作業,必須突破三堵“物理牆”:資料牆(真實互動資料稀缺、採集成本高)、表徵牆(跨任務、跨環境、跨機器人的統一物理表徵尚未形成)和閉環牆(真實世界試錯成本高、反饋速度慢)。他將智慧概括為兩條主線:對世界的抽象與壓縮(表徵),以及智慧體在環境中完成“感知、理解、決策、行動、反饋”的持續閉環。姚卯青強調,數字AI可被網際網路資料餵養,但物理AI必須在真實世界中“摸爬滾打”。

關於機器人“ChatGPT時刻”——定義為機器人能夠“開箱即用”、理解開放式自然語言指令並完成日常任務——姚卯青預計行業或需積累1億小時級別的具身資料,推動常見任務的基礎成功率達到70%至80%。他直言“模型決定起點,資料定義終局”。在圓桌環節,多位嘉賓給出了具體時間表:姚卯青認為2年,主要取決於資料進展;Physical Intelligence研究科學家任至意判斷4至5年;佐治亞理工學院助理教授徐丹飛預期5年;Dyna Robotics聯合創始人馬也騁給出4年;騰訊首席科學家張正友認為3至5年;Sunday Robotics聯合創始人趙子豪則看好3年以內。張正友強調,時間預測取決於資料採集、真實部署、失敗恢復等系統性推進,而非單一突破。

論壇還深入討論了資料採集與技術路線。任至意介紹,Physical Intelligence在訓練π0.7模型時引入歷史影片編碼、細粒度語言與影像引導及資料質量評分等後設資料,以增強模型對任務條件的判斷能力,並實現跨本體遷移。徐丹飛提出,人類第一視角資料可能成為擴充套件訓練資料的重要來源,其團隊已積累約2萬小時資料,並在部分複雜操作任務中觀察到具身學習的Scaling規律,但他也強調人類資料不能直接替代真機資料。Genesis AI聯合創始人王尊玄認為,具身智慧是系統工程,需將人類手套資料、第一視角資料、真機資料與模擬資料結合使用。

商業化方面,可靠性成為分水嶺。馬也騁指出,當前不少通用模型能覆蓋多工,但單一任務成功率有限,缺乏商業價值。Dyna Robotics已積累超過20萬小時預訓練資料,並採用“資料金字塔”策略,尤其關注失敗與恢復資料。他舉例稱,團隊在餐巾摺疊任務中實現機器人連續24小時無人干預作業,完成超過800個餐巾摺疊。智元也披露了在江西南昌龍旗合作工廠的3C產線部署案例:機器人連續6天、每日超10小時全工段直播作業,累計完成近6.5萬件操作,整體成功率達到99.99%。不過,這些資料為特定場景測試結果,尚不能等同於開放環境中的通用能力。

圍繞VLA(視覺-語言-動作模型)與世界模型的技術路線,論壇未形成單一結論,但“融合發展”成為多數嘉賓共識。馬也騁認為,在特定場景中世界動作模型(WAM)可能更高效,但複雜長程任務仍需多模型協同。張正友則表示,具身智慧仍處早期,尚未出現類似Transformer的統一框架,智慧體至少需要認知、感知-行動和肢體反應等多層閉環協同。硬體方面,Sunday Robotics選擇三指夾爪以平衡成本與能力,而姚卯青強調全棧研發有助於系統級最佳化。