8月22日,第二屆世界人形機器人運動會百米大型組預賽中,宇樹機器人跑出12.41秒、小組墊底,而一年前該賽事400米冠軍正是宇樹。就在兩天前,宇樹創始人王興興在WRC主論壇上重申其對具身智慧“ChatGPT時刻”的預判:快則2到3年、慢則5到10年——屆時機器人泛化能力將使其在80%的陌生場景中,通過語音或文字指令完成約80%的任務。賽場表現的巨大落差,迅速將宇樹科技推上輿論風口浪尖,“具身智慧騙局論”再度升溫,質疑其是否配得上“領銜者”位置,以及大模型驅動路線是否可行。
本文作者陳宥文(智訊智庫)評論認為,所謂“ChatGPT時刻”被廣泛誤用。2022年11月ChatGPT釋出後,5天使用者破百萬、兩個月月活過億,成為史上增長最快的消費級AI應用。但作者指出,這一時刻並非單一技術突破,而是能力湧現、邊際成本驟降、病毒式傳播三條曲線同時觸達閾值的共振產物。GPT-3早在2020年就具備粗糙可用能力,直到兩年半後才完成共振。作者強調,具身智慧的物理互動屬性使其難度遠高於大語言模型——語言模型預測下一個詞元,離散且容錯;機器人輸出連續力矩,零容錯,錯一步就摔碎杯子。
作者將具身智慧的發展拆解為三條曲線,並逐一算賬。能力曲線卡在跨場景泛化:固定基準測試中,頭部VLA模型(如OpenVLA-OFT、智元GO-2、Being-H0.5)在LIBERO等任務上成功率已達97%-99%,但換場景後指標明顯下滑——GO-2在VLABench得分僅47.4,Being-H0.5在RoboCasa成功率53.9%。更極端的測試顯示,模型學會“A→B”和“A→C”後,重組為“B→C”的成功率驟降至0%-15%。作者認為,會執行與會在陌生條件下組織執行之間,隔著一層真正的具身推理能力。
成本曲線卡在真機閉環。作者引用DROID專案為例,為產出7.6萬條成功軌跡,動用18台機器人、50名採集者、13家機構,跨三大洲耗時12個月。雖然合成數據可大幅降低成本——輝達11小時生成78萬條合成軌跡,RoboDream實驗顯示無實物遙操作比傳統方式快2.2倍——但將100條異域DROID軌跡直接搬到目標環境,成功率竟為0%。作者強調,生成模型無法自動消除本體、視角、物體等域差異,真機校準與驗證仍是剛性成本。
擴散曲線卡在跨客戶複製。作者稱,上半年行業出貨量同比增長近300%,但生產級場景佔比不足兩成,可跨廠複製的標準化任務包尚未形成。作者認為,具身智慧的“ChatGPT時刻”不會是單點爆發,而會分層落地:先形成開發者層的基座模型標準,再出現客戶層的可複製任務包,最後才是公眾層面的通用途徑,整體是漸進式滲透而非一夜奇觀。
作者還指出,9月3日OpenAI釋出GPT-6 Astra,在ARC-AGI-3測試取得99.9%成績,但並未帶來第二個“ChatGPT時刻”,說明能力躍升不足以單獨構成產業時刻。文章最後提示,具身智慧處於技術驗證向規模化落地的早期階段,跨場景泛化、交付經濟性、商用複製成熟度可能不及預期,但長期產業邏輯具備支撐,實際節奏需綜合多重變數判斷。