「打响AI视觉技术独立第一枪」目录01 小鹏为何非要自研02 拆解TuringViT (一) 算力减负靠“51”混合架构03 拆解TuringViT (二) VISTA数据流水线以少胜多的“胜负手”04 拆解TuringViT (三) 原生动态分辨率为“上车”而生05 实验数据零样本分类与检索冻结密集预测迁移下游VLM对比缩放律06 写在最后近日小鹏正式发布自研视觉基础模型TuringViT。最震撼的结果是仅使用0.85B8.5亿图文对数据就在六项零样本分类任务上以83.6%的平均分反超了使用近10B100亿数据训练的谷歌SOTA模型SigLIP2-L。用不到十分之一的数据实现性能反超图 | 各视觉Transformer编码器的零样本性能、训练数据规模与1K分辨率吞吐量对比。TuringViT仅用10%的训练数据即实现了更强的准确率-效率权衡TuringViT的发布不仅补上了小鹏“物理AI”全栈布局中最关键的感知入口更重要的是它向全行业证明顶尖的视觉模型不再是谷歌等巨头靠无限资源堆砌的专利。这背后是一套从架构、数据到训练全链路优化的“降本增效”方法论。01 小鹏为何非要自研在TuringViT之前几乎所有车企和AI公司都在走“拿来主义”路线——直接复用谷歌SigLIP、OpenAI CLIP等现成的ViT模型作为视觉编码器。这条路好走但对小鹏而言正面临三道致命的“枷锁”不打破就无法掌握自己的AI命运。算力枷锁标准ViT的注意力计算量随像素的二次方暴涨在2K、4K高清图像成为常态的今天这是一条算力死胡同。对于需要同时处理多路高清摄像头、连续视频帧的自动驾驶和机器人来说复用现有模型意味着无法承受的训练和推理成本。数据枷锁SigLIP2用10B数据其他开源模型动辄几十亿。这种“数据霸权”为科技巨头构筑了难以逾越的护城河中小玩家连复现的入场券都拿不到。更关键的是单纯堆砌网络爬取的“脏数据”边际效益递减无法满足特定场景如驾驶的精细化需求。应用枷锁绝大多数ViT在固定的低分辨率如224x224上预训练而实际应用智驾、座舱需要处理各种动态分辨率和长宽比的图像。这种“训练-应用”的错配就像穿着不合脚的鞋跑步每次适配都要付出额外成本且效果打折。TuringViT的诞生就是为了砸开这三把锁。为小鹏的智驾、座舱、人形机器人三大业务打造一个成本可控、场景可控、性能领先的统一视觉底座。02 拆解TuringViT (一)算力减负靠“51”混合架构要降低算力最直接的办法是用计算量呈线性的“线性注意力”替代二次方复杂度的“标准注意力”。但纯线性注意力会过度平滑图像细节导致精度下降。TuringViT没有走极端而是选择了一条极为务实的“51”混合架构用5层计算高效的线性注意力TLA作为主力负责全局信息建模再穿插1层精度有保障的标准注意力MHA负责精准的局部细节交互。这种设计如同大兵团作战线性注意力是负责大范围覆盖和推进的“主力部队”而标准注意力则是进行关键目标“精准点射”的“狙击手”。图 | TuringViT块架构与模型配置。左主干由重复Turing Block构成TLA聚合全局上下文序列长度感知归一化与输入依赖门控稳定可变token训练并保持高频局部细节。右TuringViT-18L3组Block15层TLA3层MHA与TuringViT-24L4组Block20层TLA4层MHA的配置为了让这支“混合部队”不出乱子TuringViT还设计了两个“稳定器”序列长度感知归一化确保输入不同分辨率的图片时模型内部的数值稳定性。输入依赖的门控机制给线性注意力开了一条“后门”把可能被平滑掉的局部高频信息再补回来。结果如何在1536x1536的高分辨率下TuringViT的推理吞吐量是谷歌SigLIP2-L的2.16倍。这意味着在车端、机器人端等算力受限的场景TuringViT能以更低的延迟处理更高清的图像这是“能用”和“好用”的本质区别。图 | 推理延迟随输入分辨率和视觉token数量的缩放曲线。延迟在RTX 3080 Ti上用FP16 TensorRT测量TuringViT的高分辨率延迟缩放远平缓于标准ViT基线03 拆解TuringViT (二)VISTA数据流水线以少胜多的“胜负手”如果说混合架构解决了“训得起”的问题那么VISTA-Curation数据治理流水线则直接回答了“如何用10%的数据训得更好”的核心问题。这正是TuringViT以少胜多的“胜负手”。VISTA的核心思想是从“数据大锅饭”转向“营养定制餐”让每一条数据都提供更密集的监督信号。它分为图文和视频两条线图文线三步精炼优中选优过滤先筛掉低分辨率、模糊、低纹理的“垃圾图片”。生成与验证用多个大模型为一张图生成多个候选标题再交叉验证标题与画面的匹配度。对比排序把所有候选标题放入一个“对比池”不仅要选和图片最配的还要选最有区分度的避免选出“一只狗在草地上”这种放之四海而皆准的废话描述。图 | 图文数据治理引擎总览。流水线过滤低质量图片生成并验证多样化候选字幕在统一对比池中排序选出视觉贴合、语义丰富且具有区分度的字幕用于CLIP式预训练视频线时序感知去粗取精切分与采样将长视频按内容变化切成短片提取关键帧。双重过滤通过语义一致性画面内容是否连贯和运动一致性光流变化是否合理过滤掉静止、冗余的片段。融合标注结合单帧画面的描述和整个视频片段的摘要生成包含时间变化信息的标注。图 | 视频语言数据治理流水线总览。原始视频被分解为时序连续的短视频经语义-运动一致性过滤后局部帧级字幕与全局视频级字幕融合验证产出简洁且时序贴合的视频-语言对消融实验显示仅“重标注”一步就让模型性能暴涨11.3%。这证明了VISTA的巨大价值高质量的数据治理其效果远胜于盲目堆砌十倍的原始数据。图 | TuringViT-18L预训练策略消融实验。平均分基于ImageNet-1K、ObjectNet、ImageNet-v2、ImageNet-A、ImageNet-R、ImageNet-Sketch六项零样本分类04 拆解TuringViT (三)原生动态分辨率为“上车”而生传统ViT“低分预训练、高分微调”的范式对于小鹏来说无法接受。TuringViT从设计之初就贯彻“为真实应用而生”的理念采用四阶段渐进式训练让模型天生就能适应多变的输入。阶段一视觉初始化先用MIM蒸馏的方式让模型快速学习到丰富的底层视觉特征。阶段二低分可变训练在256-512的较低分辨率范围内让模型初步适应可变长度的输入成本可控。阶段三高分原生精调放开分辨率限制让模型在真实世界的分辨率上进行训练。阶段四视频数据注入加入经过VISTA治理的视频数据让模型从静态理解升级到动态时序理解。这种“原生支持”的设计彻底消除了预训练和下游应用之间的鸿沟无需任何额外的插值或适配操作模型就能即插即用性能和效率都达到最优。图 | 四阶段渐进式ViT预训练配置。H800 GPU-hours表示总训练成本H800数量×挂钟训练时长此表对应TuringViT-24L的预训练设置05 实验数据零样本分类与检索TuringViT-24L六项零样本分类平均83.6%略超SigLIP2-L的83.4%COCO和Flickr30K检索平均78.9%同样领先。图 | 零样本分类与检索基准性能。所有数值为百分比越高越好最优结果加粗0.2pp的优势在高方差评测中不构成统计显著差距。真正有说服力的是用10%的数据达到同等水平说明数据治理确实在起作用而非模型架构本身更强。冻结密集预测迁移冻结视觉编码器只训轻量任务头测深度估计、语义分割和零样本目标跟踪。TuringViT-24L在ADE20K语义分割mIoU 43.5%SigLIP2-L 42.3%DAVIS-2017零样本跟踪JF 50.3%SigLIP2-L 32.4%。图 | 冻结密集视觉表征评估。冻结各编码器后在单目深度估计、语义分割和零样本视频目标跟踪上评测迁移能力跟踪任务18pp的领先值得关注——这和第四阶段视频训练直接相关说明视频数据治理带来的时序表征提升可以迁移到下游密集预测。下游VLM对比在统一VLM训练流水线下Qwen2.5-1.5B作LLM骨干TuringViT-24L在目标定位RefCOCO 90.4 vs 88.9、OCROCRBench V1 798 vs 781、通用VQAMMVet 49.1 vs 47.0上均优于SigLIP2-L。图 | 统一VLM训练流水线下不同视觉编码器的下游多模态性能对比最优结果加粗但在多模态推理MMMU、MathVista和长视频理解LongVideoBench上优势不明显甚至略输。这是合理的——这些任务的瓶颈在LLM推理能力和时序聚合策略视觉编码器的贡献被稀释。缩放律从20M到850M数据规模零样本性能沿幂律持续上升850M处未出现饱和迹象。图 | TuringViT-18L训练数据缩放结果。预训练数据从20M增至850M图文对时的零样本性能所有模型用相同配方训练10个epoch这意味着如果继续扩大治理后的数据规模性能还有提升空间。但缩放律曲线的斜率决定了收益的性价比——从20M到850M提升约27pp后续每增加一个量级的边际收益会递减是否值得投入需要看具体任务需求。06 写在最后TuringViT的发布对小鹏而言意味着智驾、座舱、机器人三大核心业务终于有了统一、高效、自主可控的“眼睛”。这是从依赖外部“输血”到实现内部“造血”的关键一步。但其更深远的意义在于它向整个AI行业尤其是非巨头玩家提供了一条清晰且可复现的技术路径顶尖的AI基础模型并不一定需要“无限算力 海量数据”的暴力美学。通过对架构、数据、训练流程的系统性、精细化设计中型团队同样可以在可控的成本内打造出SOTA级别的定制化模型。83.6%的零样本分数不是终点0.2pp的领先也不构成壁垒。TuringViT真正的贡献是它所代表的方法论和精神——一种敢于挑战巨头、追求极致效率、回归工程本质的务实精神。Ref论文TuringViT: Making SOTA Vision Transformers Accessible to All论文地址https://arxiv.org/abs/2606.24253项目主页https://turingvit.github.io/
小鹏自研视觉基础模型发布!只用10%数据,“干翻”谷歌百亿模型
「打响AI视觉技术独立第一枪」目录01 小鹏为何非要自研02 拆解TuringViT (一) 算力减负靠“51”混合架构03 拆解TuringViT (二) VISTA数据流水线以少胜多的“胜负手”04 拆解TuringViT (三) 原生动态分辨率为“上车”而生05 实验数据零样本分类与检索冻结密集预测迁移下游VLM对比缩放律06 写在最后近日小鹏正式发布自研视觉基础模型TuringViT。最震撼的结果是仅使用0.85B8.5亿图文对数据就在六项零样本分类任务上以83.6%的平均分反超了使用近10B100亿数据训练的谷歌SOTA模型SigLIP2-L。用不到十分之一的数据实现性能反超图 | 各视觉Transformer编码器的零样本性能、训练数据规模与1K分辨率吞吐量对比。TuringViT仅用10%的训练数据即实现了更强的准确率-效率权衡TuringViT的发布不仅补上了小鹏“物理AI”全栈布局中最关键的感知入口更重要的是它向全行业证明顶尖的视觉模型不再是谷歌等巨头靠无限资源堆砌的专利。这背后是一套从架构、数据到训练全链路优化的“降本增效”方法论。01 小鹏为何非要自研在TuringViT之前几乎所有车企和AI公司都在走“拿来主义”路线——直接复用谷歌SigLIP、OpenAI CLIP等现成的ViT模型作为视觉编码器。这条路好走但对小鹏而言正面临三道致命的“枷锁”不打破就无法掌握自己的AI命运。算力枷锁标准ViT的注意力计算量随像素的二次方暴涨在2K、4K高清图像成为常态的今天这是一条算力死胡同。对于需要同时处理多路高清摄像头、连续视频帧的自动驾驶和机器人来说复用现有模型意味着无法承受的训练和推理成本。数据枷锁SigLIP2用10B数据其他开源模型动辄几十亿。这种“数据霸权”为科技巨头构筑了难以逾越的护城河中小玩家连复现的入场券都拿不到。更关键的是单纯堆砌网络爬取的“脏数据”边际效益递减无法满足特定场景如驾驶的精细化需求。应用枷锁绝大多数ViT在固定的低分辨率如224x224上预训练而实际应用智驾、座舱需要处理各种动态分辨率和长宽比的图像。这种“训练-应用”的错配就像穿着不合脚的鞋跑步每次适配都要付出额外成本且效果打折。TuringViT的诞生就是为了砸开这三把锁。为小鹏的智驾、座舱、人形机器人三大业务打造一个成本可控、场景可控、性能领先的统一视觉底座。02 拆解TuringViT (一)算力减负靠“51”混合架构要降低算力最直接的办法是用计算量呈线性的“线性注意力”替代二次方复杂度的“标准注意力”。但纯线性注意力会过度平滑图像细节导致精度下降。TuringViT没有走极端而是选择了一条极为务实的“51”混合架构用5层计算高效的线性注意力TLA作为主力负责全局信息建模再穿插1层精度有保障的标准注意力MHA负责精准的局部细节交互。这种设计如同大兵团作战线性注意力是负责大范围覆盖和推进的“主力部队”而标准注意力则是进行关键目标“精准点射”的“狙击手”。图 | TuringViT块架构与模型配置。左主干由重复Turing Block构成TLA聚合全局上下文序列长度感知归一化与输入依赖门控稳定可变token训练并保持高频局部细节。右TuringViT-18L3组Block15层TLA3层MHA与TuringViT-24L4组Block20层TLA4层MHA的配置为了让这支“混合部队”不出乱子TuringViT还设计了两个“稳定器”序列长度感知归一化确保输入不同分辨率的图片时模型内部的数值稳定性。输入依赖的门控机制给线性注意力开了一条“后门”把可能被平滑掉的局部高频信息再补回来。结果如何在1536x1536的高分辨率下TuringViT的推理吞吐量是谷歌SigLIP2-L的2.16倍。这意味着在车端、机器人端等算力受限的场景TuringViT能以更低的延迟处理更高清的图像这是“能用”和“好用”的本质区别。图 | 推理延迟随输入分辨率和视觉token数量的缩放曲线。延迟在RTX 3080 Ti上用FP16 TensorRT测量TuringViT的高分辨率延迟缩放远平缓于标准ViT基线03 拆解TuringViT (二)VISTA数据流水线以少胜多的“胜负手”如果说混合架构解决了“训得起”的问题那么VISTA-Curation数据治理流水线则直接回答了“如何用10%的数据训得更好”的核心问题。这正是TuringViT以少胜多的“胜负手”。VISTA的核心思想是从“数据大锅饭”转向“营养定制餐”让每一条数据都提供更密集的监督信号。它分为图文和视频两条线图文线三步精炼优中选优过滤先筛掉低分辨率、模糊、低纹理的“垃圾图片”。生成与验证用多个大模型为一张图生成多个候选标题再交叉验证标题与画面的匹配度。对比排序把所有候选标题放入一个“对比池”不仅要选和图片最配的还要选最有区分度的避免选出“一只狗在草地上”这种放之四海而皆准的废话描述。图 | 图文数据治理引擎总览。流水线过滤低质量图片生成并验证多样化候选字幕在统一对比池中排序选出视觉贴合、语义丰富且具有区分度的字幕用于CLIP式预训练视频线时序感知去粗取精切分与采样将长视频按内容变化切成短片提取关键帧。双重过滤通过语义一致性画面内容是否连贯和运动一致性光流变化是否合理过滤掉静止、冗余的片段。融合标注结合单帧画面的描述和整个视频片段的摘要生成包含时间变化信息的标注。图 | 视频语言数据治理流水线总览。原始视频被分解为时序连续的短视频经语义-运动一致性过滤后局部帧级字幕与全局视频级字幕融合验证产出简洁且时序贴合的视频-语言对消融实验显示仅“重标注”一步就让模型性能暴涨11.3%。这证明了VISTA的巨大价值高质量的数据治理其效果远胜于盲目堆砌十倍的原始数据。图 | TuringViT-18L预训练策略消融实验。平均分基于ImageNet-1K、ObjectNet、ImageNet-v2、ImageNet-A、ImageNet-R、ImageNet-Sketch六项零样本分类04 拆解TuringViT (三)原生动态分辨率为“上车”而生传统ViT“低分预训练、高分微调”的范式对于小鹏来说无法接受。TuringViT从设计之初就贯彻“为真实应用而生”的理念采用四阶段渐进式训练让模型天生就能适应多变的输入。阶段一视觉初始化先用MIM蒸馏的方式让模型快速学习到丰富的底层视觉特征。阶段二低分可变训练在256-512的较低分辨率范围内让模型初步适应可变长度的输入成本可控。阶段三高分原生精调放开分辨率限制让模型在真实世界的分辨率上进行训练。阶段四视频数据注入加入经过VISTA治理的视频数据让模型从静态理解升级到动态时序理解。这种“原生支持”的设计彻底消除了预训练和下游应用之间的鸿沟无需任何额外的插值或适配操作模型就能即插即用性能和效率都达到最优。图 | 四阶段渐进式ViT预训练配置。H800 GPU-hours表示总训练成本H800数量×挂钟训练时长此表对应TuringViT-24L的预训练设置05 实验数据零样本分类与检索TuringViT-24L六项零样本分类平均83.6%略超SigLIP2-L的83.4%COCO和Flickr30K检索平均78.9%同样领先。图 | 零样本分类与检索基准性能。所有数值为百分比越高越好最优结果加粗0.2pp的优势在高方差评测中不构成统计显著差距。真正有说服力的是用10%的数据达到同等水平说明数据治理确实在起作用而非模型架构本身更强。冻结密集预测迁移冻结视觉编码器只训轻量任务头测深度估计、语义分割和零样本目标跟踪。TuringViT-24L在ADE20K语义分割mIoU 43.5%SigLIP2-L 42.3%DAVIS-2017零样本跟踪JF 50.3%SigLIP2-L 32.4%。图 | 冻结密集视觉表征评估。冻结各编码器后在单目深度估计、语义分割和零样本视频目标跟踪上评测迁移能力跟踪任务18pp的领先值得关注——这和第四阶段视频训练直接相关说明视频数据治理带来的时序表征提升可以迁移到下游密集预测。下游VLM对比在统一VLM训练流水线下Qwen2.5-1.5B作LLM骨干TuringViT-24L在目标定位RefCOCO 90.4 vs 88.9、OCROCRBench V1 798 vs 781、通用VQAMMVet 49.1 vs 47.0上均优于SigLIP2-L。图 | 统一VLM训练流水线下不同视觉编码器的下游多模态性能对比最优结果加粗但在多模态推理MMMU、MathVista和长视频理解LongVideoBench上优势不明显甚至略输。这是合理的——这些任务的瓶颈在LLM推理能力和时序聚合策略视觉编码器的贡献被稀释。缩放律从20M到850M数据规模零样本性能沿幂律持续上升850M处未出现饱和迹象。图 | TuringViT-18L训练数据缩放结果。预训练数据从20M增至850M图文对时的零样本性能所有模型用相同配方训练10个epoch这意味着如果继续扩大治理后的数据规模性能还有提升空间。但缩放律曲线的斜率决定了收益的性价比——从20M到850M提升约27pp后续每增加一个量级的边际收益会递减是否值得投入需要看具体任务需求。06 写在最后TuringViT的发布对小鹏而言意味着智驾、座舱、机器人三大核心业务终于有了统一、高效、自主可控的“眼睛”。这是从依赖外部“输血”到实现内部“造血”的关键一步。但其更深远的意义在于它向整个AI行业尤其是非巨头玩家提供了一条清晰且可复现的技术路径顶尖的AI基础模型并不一定需要“无限算力 海量数据”的暴力美学。通过对架构、数据、训练流程的系统性、精细化设计中型团队同样可以在可控的成本内打造出SOTA级别的定制化模型。83.6%的零样本分数不是终点0.2pp的领先也不构成壁垒。TuringViT真正的贡献是它所代表的方法论和精神——一种敢于挑战巨头、追求极致效率、回归工程本质的务实精神。Ref论文TuringViT: Making SOTA Vision Transformers Accessible to All论文地址https://arxiv.org/abs/2606.24253项目主页https://turingvit.github.io/