小鵬汽車於 8 月 27 日舉行物理 AI 分享會,正式釋出第二代 VLA(視覺-語言-動作模型)全新 6.3.0 版本。該版本的核心創新在於引入“時間維度”的駕駛能力:模型能夠記住過去 30 秒的路況資訊,並預判未來 6 秒可能發生的情況,從而做出更擬人化的駕駛決策。小鵬計劃於 9 月開始向所有 Ultra 和 Ultra SE 車型推送該版本,其中小鵬 G9L Ultra 與 Ultra SE 將首發搭載;同時,單圖靈晶片 Max 車型將在 9 月獲得第二代 VLA Lite 蒸餾版,首批推送將搭載於小鵬 G9L Max。
新版 VLA 的三大技術元件構成了其“時間流”駕駛能力。Infini-VLA 負責長時序記憶,其底層架構支援更長的歷史資訊,量產版本設定為 30 秒,使車輛能夠將過去半分鐘的路面狀況納入當前判斷。例如,在演示影片中,當前車在路中掉頭時,測試車並未因後方出現空位而立即加速,而是結合前車掉頭的完整動作,等待其完成後才前進,體現了對持續行為的理解而非單幀畫面判斷。Streaming Inference(流式自迴歸推理)則讓模型能夠邊獲取輸入、邊推理、邊輸出軌跡,無需等待完整理解歷史,據小鵬稱,這一機制使決策速度提升 300%,類似人類駕駛時眼、腦、手並行工作。X-Foresight 元件則基於歷史狀態推演未來 6 秒的多種可能軌跡,並通過 Flow Matching 擬合軌跡分佈,幫助模型選擇更合適的動作,實現“防禦性駕駛”式的預判。
小鵬此次將模型引數量擴大了 3.5 倍,以應對現實道路中的極端場景。在溝通會展示的影片中,測試車在輪渡碼頭無清晰車道線的情況下自主找到入口、開上輪渡並隨車流駛出;在狹窄山路上遇到懸空樹枝時,車輛主動減速並觀察樹枝與車身關係,尋找可通過空間,而非簡單將其視為障礙物或盲目穿行。小鵬強調,更大模型的目標是處理未見過的場景,而非為每個場景預設答案。訓練資料方面,小鵬稱當前單次訓練的資料吞吐量已達 1 億個影片片段,並建立了向量化資料檢索系統,可針對使用者上報或測試問題快速找出語義相似的場景,形成“錯題集”。模擬系統則通過變化車型、天氣、光照和視角反覆驗證模型,小鵬資料顯示,從今年 6 月到溝通會前兩週,每日模擬驗證的新模型數量提升了 290%。小鵬稱,新版本在模擬和測試中的綜合安全能力提升超過 20 倍。
小鵬還重構了車端大腦,推出 Omni 全模態模型和 Master Agent 架構。Omni 模型結合語言、環境和上下文理解使用者意圖,Master Agent 則將意圖分解為車輛可執行的任務,並能記住整段對話,理解多個指令的共同目標。例如,當用戶說“找個地方靠邊停車”,系統會先變道至最右側,觀察護欄、公交站和道路環境,排除不合適的區域,再找到可停位置,實現從座艙到駕駛域的連續決策。
在 Robotaxi 方面,小鵬計劃將同一套架構和模型同時用於 L2 駕駛輔助與 L4 Robotaxi。據小鵬最新口徑,其 Robotaxi 內測已完成超過 2000 單,搭載第二代 VLA 的 Robotaxi 近日獲得廣州市智慧網聯汽車遠端測試資質,可在相關測試道路開展主駕無安全員道路測試。此外,小鵬在分享會現場展示了機器人影片,稱車輛與機器人使用同一套基座模型,體現“汽車即機器人”的理念,小鵬將自己定義為“物理 AI 企業”。
小鵬的“汽車即機器人”路線並非行業獨有。特斯拉早已將汽車、Robotaxi、Optimus 機器人和 AI 訓練納入同一藍圖,理想汽車也將定位從智慧汽車轉變為“具身智慧企業”。車企們的共識是,造車即是製造能在物理世界中行動的機器人。隨著“新造車”從充滿想象力的新物種變為比拼價格、配置、渠道與交付的紅海,“物理 AI 公司”的身份或許更具吸引力,模型、晶片、Robotaxi 和機器人能組成更誘人的資本故事。然而,從無休止的價格戰轉向前沿開發,需要持續投入、反覆驗證和一次次量產兌現。小鵬為 VLA 補上了過去 30 秒與未來 6 秒,但“物理 AI 公司”的新身份能否成立,還需看 9 月上車的新版本能否讓車主真正感受到“記得更多、判斷更早、反應更快”。