盖世汽车获悉 近日,小鹏汽车正式发布 TuringViT 高效视觉编码器。该系统针对 VLM/VLA 时代视觉编码器的架构设计、数据范式与训练流程进行了系统性重构,将支撑智能驾驶、智能座舱及 IRON 人形机器人三大业务场景。
图片来源:小鹏汽车
当前行业普遍采用的复用开源通用 ViT 方案,在高分辨率、多视角、连续视频帧等真实场景下面临算力成本、数据效率与场景适配三重瓶颈。TuringViT 从架构、数据、训练三个维度同步推进,提出了相应的技术路径。
架构方面,TuringViT 采用 Turing 线性注意力作为核心计算单元,构建了混合 Turing Block 架构,以线性注意力承担主要全局上下文聚合工作,计算复杂度从二次方降至近线性。实测显示,1536 × 1536 分辨率下,TuringViT-18L 推理吞吐量达到 Seed1.5-ViT 的 3.04 倍。该系统提供 18L 和 24L 两个规格版本。
数据方面,TuringViT 打造了 VISTA-Curation 多模态数据治理流水线,通过图文和视频数据的多阶段筛选与标注优化,提升单样本监督价值。该系统仅使用 0.85B 图文对完成训练,约为 SigLIP2-L 训练数据规模的 10%,在 ImageNet-1K 等六项零样本分类基准上取得 83.6% 的平均准确率。
训练方面,TuringViT 采用四阶段渐进式原生动态分辨率训练范式,从预训练阶段即适配下游 VLM/VLA 的输入特性,配合二维旋转位置编码,支持不同尺寸与长宽比的输入。
应用层面,TuringViT 将作为小鹏第二代 VLA 模型的核心视觉编码器,负责处理多路环视摄像头输入;在智能座舱场景中支撑视觉与语言模型的对齐;同时为 IRON 人形机器人提供物体识别、空间关系理解等基础感知能力。小鹏表示,该系统的架构设计与训练流程不依赖特定硬件平台,可为行业提供可复现的视觉大模型训练路径。


登录后才可以发布评论哦
打开小程序可以发布评论哦