7月21日,小鹏集团正式发布TuringViT高效视觉编码器,这是一款面向VLM(视觉语言模型)与VLA(视觉语言动作模型)应用场景的视觉基础模型。小鹏方面表示,该编码器将从架构设计、数据范式与训练流程三个维度进行系统性重构,并计划用于智能驾驶、智能座舱及IRON人形机器人三大业务场景。

在VLM/VLA系统中,视觉编码器通常被视为物理AI的“感知入口”,负责将图像或视频转化为供后续语言、动作模块处理的视觉特征。随着VLM/VLA技术向真实场景落地,高分辨率图像、多视角输入和连续视频帧对视觉编码器的效率与时序处理能力提出了更高要求。小鹏方面认为,行业普遍采用的“复用开源通用ViT”方案,难以同时满足智能驾驶、具身机器人等场景对性能、延迟与定制化的需求。

小鹏将TuringViT的设计归纳为三个维度。架构方面,TuringViT以Turing线性注意力(TLA)为主,并保留少量标准多头注意力,构成混合Turing Block架构;在高分辨率输入下,计算复杂度由二次方缩放转为近线性。据小鹏公布的测试数据,在1536×1536分辨率下,TuringViT-18L的推理吞吐量达到Seed1.5-ViT的3.04倍。该编码器提供两个规格版本:TuringViT-18L包含3组Turing Block,面向动态分辨率下的部署;TuringViT-24L包含4组Turing Block,侧重提升表征能力。

数据方面,TuringViT采用VISTA-Curation多模态数据治理流水线。据小鹏方面介绍,该流水线对图文和视频数据进行多阶段筛选、重新描述和评分,以提高单个样本的监督信息量。TuringViT使用0.85B图文对进行预训练,约为SigLIP2-L训练数据规模的10%。在包括ImageNet-1K在内的六项零样本分类基准上,TuringViT-24L的平均准确率为83.6%

训练方面,TuringViT采用四阶段渐进式原生动态分辨率训练方案,从预训练阶段即适配下游VLM/VLA的输入特性,配合二维旋转位置编码,支持不同尺寸和长宽比的输入。小鹏方面表示,这一设计减少了对“固定分辨率预训练+事后适配”路径的依赖。

小鹏方面称,TuringViT将用于三类业务场景。在智能驾驶领域,TuringViT是第二代VLA模型的核心视觉编码器,负责处理多路环视摄像头的高分辨率图像和多帧动态道路场景输入,为预测式世界模型提供视觉token。在智能座舱场景中,TuringViT的VLM原生特性用于对齐视觉特征与语言模型,并支持不同画幅和比例的视觉输入。在小鹏IRON人形机器人的技术体系中,小鹏将TuringViT定位为基础视觉模块,承担物体识别、空间关系理解、可操作区域检测和动态环境追踪等功能。何小鹏在3月20日业绩会上称,小鹏IRON人形机器人计划于2026年底量产,年底月产能目标为上千台,并将优先在小鹏门店落地商用。

小鹏方面表示,TuringViT的架构设计与训练流程不依赖特定硬件平台,可为行业提供一条可复现的视觉大模型训练路径。从技术布局看,TuringViT补上了小鹏物理AI技术体系中的视觉编码器一环。此前,小鹏已陆续披露多视角生成式世界模型X-World、世界模型推理加速引擎X-Cache、预测式世界模型X-ForesightX-Mind技术框架。TuringViT则位于这套物理AI技术体系的感知输入端。

不过,视觉编码器从技术发布到实际场景的规模化落地,仍要经过工程适配、算力部署与场景验证。TuringViT能否在车端、座舱和机器人三个差异化的物理环境中稳定运行,尚需持续观察。小鹏方面表示,未来将持续扩大高质量图文视频数据规模,深化时序建模与具身视觉方向的技术探索。