在2026年世界機器人大會(WRC 2026)上,星動紀元創始人兼CEO陳建宇發表演講,提出一個關鍵判斷:世界模型可能不僅是當前主流技術路線VLA(視覺-語言-動作模型)的增強模組,而可能成為下一代具身智慧的核心範式。這一觀點直指當前機器人行業最底層的技術路線之爭。

陳建宇指出,過去幾年機器人主要解決“如何更精準地執行動作”的問題,在工業產線上完成焊接、搬運等重複任務,但這些能力建立在環境、流程和目標都被提前定義的前提上。當機器人走向物流、服務乃至家庭等開放場景,面對從未見過的物體或任務,能否理解環境、預測變化並自主找到解決方法,成為通用機器人必須回答的問題。

大模型為機器人提供了新可能,但機器人面對的是真實物理世界而非語言世界。目前行業主流方向是VLA,它通過學習大量人類行為資料,將視覺、語言和動作統一起來。然而陳建宇認為,VLA的核心仍是模仿——模型學習人類過去如何行動,遇到從未見過的新任務時,僅靠已有動作經驗難以真正泛化。相比之下,世界模型試圖構建對物理世界的常識性理解,例如“水往下流”這類規律無需反覆學習,天然具備更好的泛化性。

陳建宇將具身大模型的迭代歸納為三個範式:第一範式是“語言模型+機器人控制”,用語言模型增強上層推理,但下層仍是傳統模組化方法,無法端到端訓練;第二範式是“多模態底座上的VLA模型”,以GPT-4為代表的多模態模型出現後,將動作與環境互動融合進統一模型,典型如Google的PaLM系列、RT系列;第三範式則是世界模型,它不僅能預測未來動作,還能預測未來世界狀態的演化,形成閉環。

星動紀元早在2024年就發表了全球首個融合影片預測與動作預測的世界動作模型,比輝達類似方案早了約一年。陳建宇強調,世界模型多以影片模型為底座,直接處理原始影像、影片、音訊資料,包含更豐富的物理細節,更適合面向物理世界操作的具身模型。在資料層面,星動紀元構建了大規模人類行為資料集,並加入第一人稱人類操作資料訓練,還與Facebook AI(FAIR)團隊合作完成ControlNet相關工作,提升動作精準可控性。

陳建宇展示了世界模型的幾項能力:一是建模與預測能力,生成影像與真實實拍幾乎無法分辨,能精準預測毛巾褶皺、抽紙等細微物理現象;二是零樣本任務泛化,在辦公區隨機取景、下達帶邏輯推理的指令(如“把左邊的拖鞋放到右邊拖鞋的旁邊”),模型能端到端直接預測動作;三是精細操作與跨本體能力,經過後訓練可完成疊紙盒、翻襪子、脫鞋、開水等操作,還能操作靈巧手使用螺釘槍、移液器等工具。

在硬體層面,星動紀元選擇全棧自研,從整機、關節模組、機械手到電機、減速器、驅動器均自主開發。其全尺寸雙足機器人兼顧力量、速度、自由度和工作空間,2023年底已實現涉水行走、上下樓梯,今年春節期間還發布了舞劍演示。靈巧手方面,星動紀元最早推出全直驅靈巧手,響應速度極快,一秒可點選10次滑鼠,負載達24千克,並具備良好抗衝擊能力。

商業化方面,陳建宇認為具身行業已進入商業化拐點。星動紀元從物流工業起步,逐步向服務、C端和家用滲透,B端客戶專案已覆蓋十餘個城市,在物流分揀等場景常態化運作。同時開放硬體平台、軟體工具鏈與API,供二次開發者使用。他強調,通用機器人是持續進化的系統,大腦、本體與場景形成協同進化的飛輪,隨著能力提升不斷開拓新場景。

陳建宇的演講反映了具身智慧領域對技術路線的深層思考:VLA與世界的模型之爭,本質上是“模仿人類”與“理解世界”兩種路徑的博弈。業界普遍關注,世界模型能否真正突破VLA的泛化瓶頸,以及這種路線切換對硬體、資料、算力提出的新要求。星動紀元的實踐為行業提供了一個從演算法到硬體再到商業化的完整樣本,但其能否在激烈競爭中保持領先,仍有待市場檢驗。