手机中国 23小时前
小鹏集团发布TuringViT 打造物理AI统一感知底座
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_font3.html

 

【CNMO 科技消息】今年上半年,小鹏集团密集发布物理 AI 技术报告,继多视角生成式世界模型 X-World、世界模型推理加速引擎 X-Cache、预测式世界模型 X-Foresight 及 X-Mind 技术框架之后,近日,小鹏正式发布 TuringViT 高效视觉编码器,面向 VLM/VLA 时代系统性重构视觉编码器的架构设计、数据范式与训练流程。

小鹏

据 CNMO 科技了解,针对 softmax 注意力在长序列下的算力困境,TuringViT 创新性地提出 Turing 线性注意力(TLA)作为核心计算单元,构建 "5 层线性注意力 +1 层标准多头注意力 " 的混合 Turing Block 架构。

该设计让线性注意力承担主要的全局上下文聚合工作,将计算复杂度从二次方降至近线性;仅周期性插入少量标准注意力层保障 token 级交互精度,同时搭配序列长度感知归一化与输入依赖门控机制,在高效全局建模的同时保留局部细节与高频视觉特征,避免线性注意力常见的细节平滑问题。

TuringViT 的块架构和模型配置

TuringViT 共推出两个规格版本:TuringViT-18L 包含 3 组 Turing Block(共 15 层 TLA+3 层 MHA),主打动态分辨率下的高效部署;TuringViT-24L 包含 4 组 Turing Block(共 20 层 TLA+4 层 MHA),在保持线性计算主导的前提下进一步提升表征能力。

实测数据显示,随着输入分辨率提升,TuringViT 的延迟增长曲线远平缓于标准 softmax ViT,高分辨率下的效率优势愈发显著。在 1536 × 1536 分辨率下,TuringViT-18L 的推理吞吐量达到 Seed1.5-ViT 的 3.04 倍,相比 SigLIP2-ViT-L 提升 2.16 倍,为高分辨率感知、多摄像头输入、长时序视频处理的端侧部署扫清了核心障碍。

不同于行业 " 堆数据规模 " 的粗放路线,TuringViT 打造了 VISTA-Curation 多模态数据治理流水线,通过提升单样本的监督价值实现数据效率的量级提升,从 " 用更多数据 " 转向 " 用更优质的监督 "。

TuringViT 采用四阶段渐进式原生动态分辨率训练范式,从预训练之初就适配下游 VLM/VLA 的输入特性,彻底告别 " 固定分辨率预训练 + 事后适配 " 的传统模式。

随着 TuringViT 的发布,小鹏全栈自研的物理 AI 底层技术能力逐步完善和丰富。小鹏的物理 AI 底层技术能力,也不仅仅服务于智能辅助驾驶,更将赋能更多物理 AI 业务场景。

版权所有,未经许可不得转载

宙世代

宙世代

ZAKER旗下Web3.0元宇宙平台

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

ai 小鹏 物理 分辨率 数据治理
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论