螞蟻靈波CEO朱興和首席科學家沈宇軍在近期溝通會上,對當前機器人大腦的發展階段給出了冷靜評估。他們判斷,行業尚未迎來真正的智慧湧現,可能還沒有走到GPT-1時刻,技術路線也遠未收斂。這一表態為過去一年VLA、世界模型等概念輪番登場的熱潮,潑了一盆冷水。

螞蟻靈波此次一口氣釋出了6款模型,但其核心意圖並非堆砌數量,而是試圖回答一個更根本的問題:在數字世界裡訓練出來的大模型,能否直接裝進機器人的身體?靈波的答案是,物理世界需要一套從感知、預測到行動都重新設計的模型體系。

沈宇軍用一個“開門見貓”的例子解釋了其中關鍵。一扇不透明的玻璃門後有只貓,普通視覺模型能識別並描述畫面,但機器人若想靠近貓,僅“看見”遠遠不夠。它必須理解玻璃門構成了物理阻隔,在門開啟前,貓處於機械臂無法觸及的空間。數字模型關注畫面內容,機器人還需判斷距離、遮擋、接觸關係和可達性。語義識別正確,只是物理任務的第一步。

服務於內容創作的影片模型,可以花更多算力換取畫質和連續性,但機器人面對的時間只能向前流動。它抓取杯子時,無法預知下一秒是否有人碰桌子或杯子滑動,模型只能根據當前狀態預測下一步,並在感測器返回新資訊後修正動作。畫面是否漂亮不重要,預測需要合理、快速,並能轉化為動作。靈波將這條路線稱為“具身原生”,並從頭訓練LingBot-VA 2.0。公開技術論文顯示,該模型採用因果預訓練、稀疏MoE和非同步推理等設計,服務於高頻、閉環的機器人控制。這種取捨甚至允許預測畫面出現一定變形,只要動作方向正確,感測器會持續提供真實畫面進行校準。

選擇具身原生路線,立刻面臨資料難題。朱興直言,千萬小時資料可能也不夠。自動駕駛面對相對明確的交通規則和單一任務,而通用機器人需進入工廠、倉庫和家庭,接觸不同材質物體,適配不同身體,處理無法預先定義的失敗狀態,資料分佈遠比駕駛任務複雜。公開論文顯示,LingBot-VLA 2.0的預訓練資料已從第一代的約2萬小時增至6萬小時,包括5萬小時機器人軌跡和1萬小時第一視角人類影片,覆蓋17家廠商20種機器人構型,動作空間也從雙臂擴充套件到頭部、腰部、移動底盤和靈巧手。但6萬小時仍只是起點,團隊更看重資料閉環的速度與質量,未來還需補充觸覺、力覺等模態,並與第一視角影片對齊。

在商業化層面,朱興把成功率放在速度之前。現場有媒體提到,人工用叉車搬運一次可能只需30秒,機器人卻要花1分鐘甚至更久,遇到新情況還可能停下來重新判斷。朱興認為,機器人動作再快,若連續失敗幾次,企業仍需安排人員接管,部署便難以產生經濟價值。只有成功率穩定後,企業才會進一步計算節拍、推理效率和單位成本。他將預訓練比作培養一名基礎素質良好的大學生,進入銀行做會計仍需職業訓練。具身基礎模型抬高能力上限,後訓練則把模型變成生產工具。基礎模型越聰明、見過的構型和任務越多,後訓練需要補的課就越少。通用機器人大腦的商業價值,在於降低每個場景單獨開發模型的投入。

螞蟻為靈波提供了資金、人才、訓練基礎設施、資料處理能力和場景生態等核心資源。靈波在此基礎上搭建從空間感知、影片生成、互動世界模型到VLA、VA的全棧模型體系。這套佈局反映了螞蟻對產業格局的判斷:具身智慧仍處於類似“百模大戰”的早期階段,未來可能收斂為少數幾家通用基礎模型提供商。機器人距離大規模進入家庭仍有很長距離,現在類比Windows或Android為時過早。

觀察螞蟻靈波2.0,模型引數和榜單只是其中一部分。更關鍵的指標是,它能否持續提高跨任務、跨場景和跨構型的成功率,能否把後訓練成本降到客戶願意支付的水平。數字世界的Agent在基礎模型能力上升後迅速普及,具身智慧也可能經歷類似的能力外溢,只是物理世界多了一層無法迴避的約束——模型做出的每一個判斷,最終都要由一副真實的身體完成。螞蟻靈波選擇提前重做這顆大腦,路線能走多遠,最終還要看機器人能不能真正幹活。