小鹏发布TuringViT视觉编码器,欲打破大模型"算力垄断"
视觉大模型领域长期存在一道隐形门槛:想要达到顶尖效果,必须先囤积海量数据和算力资源。这使得先进视觉能力成为少数头部团队的"专属玩具"。7月21日,小鹏集团发布TuringViT高效视觉编码器,声称从架构、数据范式到训练流程进行了系统性重构,为行业提供了一条可复现、低成本的SOTA级视觉Transformer训练路径。
TuringViT的定位明确:面向VLM(视觉语言模型)与VLA(视觉语言动作模型)时代,支撑智能驾驶、智能座舱和IRON人形机器人三大业务场景。该技术从架构、数据、训练三个维度同步突破,构建了线性注意力主导、高质量数据治理、原生动态分辨率三位一体的技术体系。
架构方面,TuringViT推出两个规格版本。TuringViT-18L包含3组Turing Block,合计15层TLA加3层MHA,主打动态分辨率下的高效部署;TuringViT-24L包含4组Turing Block,合计20层TLA加4层MHA,在保持线性计算主导的前提下进一步提升表征能力。实测数据显示,随着输入分辨率升高,TuringViT的延迟增长曲线远比标准softmax ViT平缓。在1536×1536分辨率下,TuringViT-18L的推理吞吐量达到Seed1.5-ViT的3.04倍,相比SigLIP2-ViT-L提升2.16倍。
与行业堆砌数据规模的路线不同,TuringViT的重点在于数据治理。其打造的VISTA-Curation多模态数据治理流水线,通过提升单样本的监督价值实现数据效率跃升。针对图文数据,该流水线分三步筛选:过滤低质量图片;用多模型、多提示词生成候选字幕并交叉验证视觉一致性;按图文对齐度、文本信息量与歧义度综合打分,筛选优质标注。针对视频数据,流水线将长视频切分为连续短片段,通过语义一致性与运动一致性双重过滤保留有效片段,再融合局部帧级细节字幕与全局时序语义字幕,生成具备变换感知能力的视频标注。
数据效率的提升直接反映在成绩上。TuringViT仅用0.85B图文对,约为SigLIP2-L训练数据规模的十分之一,却在ImageNet-1K等六项零样本分类基准上取得83.6%的平均准确率,超越使用10B数据训练的主流开源基线;在COCO与Flickr30K图文检索任务上同样表现突出。
训练流程方面,TuringViT采用四阶段渐进式原生动态分辨率训练范式,从预训练第一天起就适配下游VLM与VLA的输入特性,告别了固定分辨率预训练再加事后适配的传统模式。
目前,该编码器已在小鹏技术体系内明确落地。在智能驾驶领域,它是第二代VLA模型的核心视觉编码器,负责处理多路环视摄像头的高分辨率、多帧动态道路场景输入;面向智能座舱,其VLM原生特性让视觉特征与语言模型实现更高效对齐;在小鹏IRON人形机器人体系中,它提供物体细粒度识别、空间关系理解、可操作区域检测和动态环境追踪等基础感知能力。项目主页已上线 https://turingvit.github.io/。