【CNMO 科技消息】今年上半年,小鹏集团密集发布物理 AI 技术报告,继多视角生成式世界模型 X-World、世界模型推理加速引擎 X-Cache、预测式世界模型 X-Foresight 及 X-Mind 技术框架之后,近日,小鹏正式发布 TuringViT 高效视觉编码器,面向 VLM/VLA 时代系统性重构视觉编码器的架构设计、数据范式与训练流程。

小鹏
据 CNMO 科技了解,针对 softmax 注意力在长序列下的算力困境,TuringViT 创新性地提出 Turing 线性注意力(TLA)作为核心计算单元,构建 "5 层线性注意力 +1 层标准多头注意力 " 的混合 Turing Block 架构。
该设计让线性注意力承担主要的全局上下文聚合工作,将计算复杂度从二次方降至近线性;仅周期性插入少量标准注意力层保障 token 级交互精度,同时搭配序列长度感知归一化与输入依赖门控机制,在高效全局建模的同时保留局部细节与高频视觉特征,避免线性注意力常见的细节平滑问题。

TuringViT 的块架构和模型配置
TuringViT 共推出两个规格版本:TuringViT-18L 包含 3 组 Turing Block(共 15 层 TLA+3 层 MHA),主打动态分辨率下的高效部署;TuringViT-24L 包含 4 组 Turing Block(共 20 层 TLA+4 层 MHA),在保持线性计算主导的前提下进一步提升表征能力。
实测数据显示,随着输入分辨率提升,TuringViT 的延迟增长曲线远平缓于标准 softmax ViT,高分辨率下的效率优势愈发显著。在 1536 × 1536 分辨率下,TuringViT-18L 的推理吞吐量达到 Seed1.5-ViT 的 3.04 倍,相比 SigLIP2-ViT-L 提升 2.16 倍,为高分辨率感知、多摄像头输入、长时序视频处理的端侧部署扫清了核心障碍。
不同于行业 " 堆数据规模 " 的粗放路线,TuringViT 打造了 VISTA-Curation 多模态数据治理流水线,通过提升单样本的监督价值实现数据效率的量级提升,从 " 用更多数据 " 转向 " 用更优质的监督 "。
TuringViT 采用四阶段渐进式原生动态分辨率训练范式,从预训练之初就适配下游 VLM/VLA 的输入特性,彻底告别 " 固定分辨率预训练 + 事后适配 " 的传统模式。
随着 TuringViT 的发布,小鹏全栈自研的物理 AI 底层技术能力逐步完善和丰富。小鹏的物理 AI 底层技术能力,也不仅仅服务于智能辅助驾驶,更将赋能更多物理 AI 业务场景。
版权所有,未经许可不得转载


登录后才可以发布评论哦
打开小程序可以发布评论哦