7月21日,小鵬集團正式釋出TuringViT高效視覺編碼器,這是一款面向VLM(視覺語言模型)與VLA(視覺語言動作模型)應用場景的視覺基礎模型。小鵬方面表示,該編碼器將從架構設計、資料範式與訓練流程三個維度進行系統性重構,並計劃用於智慧駕駛、智慧座艙及IRON人形機器人三大業務場景。
在VLM/VLA系統中,視覺編碼器通常被視為物理AI的“感知入口”,負責將影像或影片轉化為供後續語言、動作模組處理的視覺特徵。隨著VLM/VLA技術向真實場景落地,高解析度影像、多視角輸入和連續影片幀對視覺編碼器的效率與時序處理能力提出了更高要求。小鵬方面認為,行業普遍採用的“複用開源通用ViT”方案,難以同時滿足智慧駕駛、具身機器人等場景對效能、延遲與定製化的需求。
小鵬將TuringViT的設計歸納為三個維度。架構方面,TuringViT以Turing線性注意力(TLA)為主,並保留少量標準多頭注意力,構成混合Turing Block架構;在高解析度輸入下,計算複雜度由二次方縮放轉為近線性。據小鵬公佈的測試資料,在1536×1536解析度下,TuringViT-18L的推理吞吐量達到Seed1.5-ViT的3.04倍。該編碼器提供兩個規格版本:TuringViT-18L包含3組Turing Block,面向動態解析度下的部署;TuringViT-24L包含4組Turing Block,側重提升表徵能力。
資料方面,TuringViT採用VISTA-Curation多模態資料治理流水線。據小鵬方面介紹,該流水線對圖文和影片資料進行多階段篩選、重新描述和評分,以提高單個樣本的監督資訊量。TuringViT使用0.85B圖文對進行預訓練,約為SigLIP2-L訓練資料規模的10%。在包括ImageNet-1K在內的六項零樣本分類基準上,TuringViT-24L的平均準確率為83.6%。
訓練方面,TuringViT採用四階段漸進式原生動態解析度訓練方案,從預訓練階段即適配下游VLM/VLA的輸入特性,配合二維旋轉位置編碼,支援不同尺寸和長寬比的輸入。小鵬方面表示,這一設計減少了對“固定解析度預訓練+事後適配”路徑的依賴。
小鵬方面稱,TuringViT將用於三類業務場景。在智慧駕駛領域,TuringViT是第二代VLA模型的核心視覺編碼器,負責處理多路環視攝像頭的高解析度影像和多幀動態道路場景輸入,為預測式世界模型提供視覺token。在智慧座艙場景中,TuringViT的VLM原生特性用於對齊視覺特徵與語言模型,並支援不同畫幅和比例的視覺輸入。在小鵬IRON人形機器人的技術體系中,小鵬將TuringViT定位為基礎視覺模組,承擔物體識別、空間關係理解、可操作區域檢測和動態環境追蹤等功能。何小鵬在3月20日業績會上稱,小鵬IRON人形機器人計劃於2026年底量產,年底月產能目標為上千台,並將優先在小鵬門店落地商用。
小鵬方面表示,TuringViT的架構設計與訓練流程不依賴特定硬體平台,可為行業提供一條可復現的視覺大模型訓練路徑。從技術佈局看,TuringViT補上了小鵬物理AI技術體系中的視覺編碼器一環。此前,小鵬已陸續披露多視角生成式世界模型X-World、世界模型推理加速引擎X-Cache、預測式世界模型X-Foresight及X-Mind技術框架。TuringViT則位於這套物理AI技術體系的感知輸入端。
不過,視覺編碼器從技術釋出到實際場景的規模化落地,仍要經過工程適配、算力部署與場景驗證。TuringViT能否在車端、座艙和機器人三個差異化的物理環境中穩定執行,尚需持續觀察。小鵬方面表示,未來將持續擴大高質量圖文影片資料規模,深化時序建模與具身視覺方向的技術探索。