2026 年 1 月,矽谷機器人大腦公司 Skild AI 完成 14 億美元 C 輪融資,估值從數月前的 45 億美元 跳升至超過 140 億美元。這家公司沒有生產過一台機器人,也沒有向任何工廠交付過一台機械臂——它賣的只是一個模型。這輪融資被媒體形容為“2026 年機器人行業最早誕生的百億美元獨角獸”,理由恰恰是它什麼都不造。
與此同時,國內具身智慧公司智在無界(BeingBeyond)創始人盧宗青也堅持純模型路線。盧宗青是北京大學計算機學院長聘副教授、國家級青年人才,2025 年創立智在無界,同樣只做模型。在接受虎嗅採訪時,他直言:“中國和美國在具身智慧上本質沒有差距,因為雙方都沒有找到一條能快速訓出具身基礎模型的路線;資料路線基本定了,是人類影片,但怎麼把這些資料變成一個真正通用的模型,誰都還沒有答案。”
智在無界並非沒有硬體。去年年底,公司釋出了一款桌面級靈巧手機械臂 D1,據虎嗅獨家獲悉,其即將釋出新一款同樣形態的產品,面向科研、教育平台,做具身方面的預訓練。但盧宗青強調,做不做硬體是隨著模型能力提升之後的一個商業選擇,不是立場。
盧宗青的技術路線選擇始於一次失敗的驗證。2023 年,他在北大牽頭的多模態互動研究中心嘗試讓多模態模型在《荒野大鏢客》等遊戲裡自主完成任務,結果發現連數字世界裡的互動都做不好。2024 年轉向真實機器人,做了 Being-0 早期嘗試,模型仍遠達不到預期。2023 年底,他決定押注人類第一人稱影片,當時幾乎沒有人做這件事,直到 2025 年下半年,行業才集體轉向。
智在無界的模型迭代速度驚人:從 2025 年 7 月的 H0(3000 小時資料)到 2026 年 1 月的 H0.5(3.5 萬小時,支援跨本體控制 30 多種機器人),再到 4 月的 H0.7(20 萬小時資料,採用 latent world action model 範式),端側部署推理速度做到 30 赫茲,然後就是最新的 H0.8,50 萬小時人類第一人稱資料。盧宗青表示,H0.8 的釋出代表一個重要節點,不僅是從視覺到觸覺、從觀察世界到理解互動的模型能力進化,更預示著一個同時具備視覺理解、觸覺互動、動作生成、世界預測、跨本體泛化的具身基礎模型即將誕生。
支撐這條迭代曲線的,是一套從資料管線、模型預訓練、後訓練、評測到端側部署的全棧基礎設施建設。盧宗青認為,最大的壁壘是把人類影片資料做成一個能賣出去的模型的整條 pipeline,包括資料 infra、模型訓練 infra、端側算力部署 infra,以及適配各種真機的模組化工程 infra。這些經驗是過去兩年多積累下來的。
在資料標註方面,智在無界完全實現了 AI 化。50 萬小時的資料大部分是自己標註的,有自動化 pipeline 自動標註、對齊、評測。特別的是,他們的資料還有手部動作的標註,標的是手的每個關節在世界座標系下的座標,這樣才能訓練輸出動作的具身模型。
關於算力,盧宗青表示他們的訓練範式對算力消耗非常小,大概只有基於影片生成模型做 world action model 的百分之一。原因在於學習範式:影片生成模型要預測每一個畫素,而隱式世界動作模型只需預測一個 embedding 或 latent state。推理層面,模型最終要部署在機器人上,關鍵在於端側晶片的推理速度,他們現在能做到 30 赫茲,應該是全球世界模型裡跑得最快的。
對於世界模型的定義,盧宗青認為現在市面上沒有一個模型可以稱為世界模型。當前語境下,世界模型更多是一個寬泛的概念。對具身來講,世界模型就是一個具身的基礎模型,能夠驅動機器人幹各種各樣的事情。現在具身領域說的世界模型,更準確應該叫 world action model,和 VLA 做區分,但他們真正達到世界模型的能力了嗎?其實並沒有。
盧宗青還提到,目前還沒有觀察到類似 GPT-3.5 那樣的湧現,還處線上性爬坡階段。但他對行業前景保持樂觀,認為隨著人類影片資料規模的增長,具身基礎模型的能力將持續進化。