在8月最後一週於國家速滑館“冰絲帶”舉行的第二屆世界人形機器人運動會上,銀河通用以全自主、不依賴遙操的方式,包攬了家庭、餐飲、商超三大場景賽的金牌,奪冠率100%,並在賽後的技術複核中首次即獲滿分。這一成績在業內引發熱議,因為它直接回應了當前具身智慧領域最核心的挑戰——如何在真實物理世界中實現可靠的自主決策與操作。
場景賽不同於田徑專案的競技表演,它模擬的是家庭、餐飲、商超的真實工作環境,考驗的是機器人的具身大模型能力,包括“大腦”的認知決策與“小腦”的運動控制。田徑專案可以通過大量模擬訓練最佳化運動控制演算法,但場景賽面對的是動態環境、柔性物體和隨機干擾,對模型的泛化能力要求極高。本屆比賽允許遙操,但積分規則明確鼓勵全自主:自主模式權重為1.0,遙操模式僅為0.5,同分時自主隊伍排名靠前。儘管如此,多數隊伍仍選擇遙操以規避風險,因為讓AI完全掌控沉重的鋼鐵軀體,一旦出錯可能導致機器人宕機或破壞環境。銀河通用卻堅持全自主,並在三個流程最長、最容易翻車的專案中全部奪冠。
家庭場景是賽程最長的專案,長達30分鐘,機器人需在客廳、臥室、衛生間、陽台間穿梭,完成撿拾雜物、開門、塞髒衣服進洗衣機、疊衣晾曬等任務。其中兩大技術難點:一是柔性物體操作,如疊衣服,傳統剛體抓取演算法失效,必須依賴端到端的視覺-動作模型即時調整;二是長程任務中的隨機干擾與記憶恢復,比賽中機器人突然收到“有快遞送達門外”的語音指令,需暫停當前任務去取快遞,再回到原位繼續工作,這考驗其“時空接地”與長短期記憶排程能力,任何微小偏差都可能導致“誤差級聯”全線崩潰。銀河通用不僅順利完成所有干擾項,還在技術複核中首次即獲滿分,證明了其底層模型的泛化能力。
餐飲場景則對應“莫拉維克悖論”——對人類簡單的動作對AI極難。機器人需用食品夾從熱食櫃取餐、放入微波爐、擰動定時旋鈕、加熱後取出,並接飲料平穩送達。使用工具(夾子)要求模型將感知延伸至工具末端,夾輕了掉落、夾重了捏爛;擰旋鈕則考驗柔順控制,剛性位置控制稍有偏差就會掰斷塑膠旋鈕,必須像人一樣帶“彈簧般”柔性觸碰並輸出扭矩。多數隊伍選擇遙控器接管精細動作,而銀河通用以6分55秒零失誤最快完賽,說明其模型已深度穿透至底層力矩輸出。
商超場景是20分鐘限時高壓測試,任務包括按外賣訂單揀貨、巡查貨架、補貨、歸位錯放商品,且貨架上有外觀相似的干擾項。傳統機器人開發常針對特定場景“過擬合”,但商超考場是迷你“開放世界”,訂單動態、缺貨隨機、商品五花八門。銀河通用憑藉多模態大模型即時感知,精準識別反光、不規則包裝的袋裝薯片,並自主發現糾正錯放商品,最終包攬金銀銅牌。
賽場上的高光表現並非特化調參的結果,而是源於真實商業場景的“降維打擊”。銀河通用打造的“銀河太空艙”零售店,由人形機器人自主運營,已進入全國近50城、約200個點位,穩定執行超一年;美國Fox News主播Bret Baier曾探訪其運營的全家超市,目睹機器人在上萬種SKU中自主完成識別、巡查、補貨全流程。在醫療場景,銀河通用聯合合作伙伴打造近百個智慧藥房,首家於2024年9月落成,在不到50平米空間內7×24小時執行近兩年,累計出藥超百萬次。這些真實互動資料持續迴流至銀河星腦(AstraBrain)世界動作模型,形成“真實應用—資料迴流—模型進化”閉環,使賽場上的隨機干擾、動態訂單不過是日常訓練的子集。
銀河通用創始人兼CTO王鶴博士曾提出,具身智慧正接近自己的“ChatGPT時刻”,標誌不是背會預設動作,而是具備真正的泛化能力——人類只需自然語言或展示幾遍動作,機器人就能舉一反三。本次全自主奪冠印證了這一趨勢,也表明人形機器人競爭的核心已從硬體同質化轉向具身智慧大腦。銀河通用將底座押注於自研的AstraBrain世界動作模型,通過輸入影片流和物理狀態預測下一步關節扭矩與動作,而非為特定任務編寫海量if-else程式碼。這一成績向行業宣告,物理世界的智慧覺醒已有明確解法,但能否在更廣泛場景中低成本複製,仍需時間檢驗。