小鹏 TuringViT 视觉基座发布:重塑汽车 AI 感知底层逻辑
当智能汽车进入体系化智能的深水区,视觉感知正成为决定整车智能化上限的核心变量。从多摄像头环视到端到端大模型,从座舱多模态交互到具身机器人探索,每一次体验跃迁都离不开高效、精准、可扩展的视觉编码体系。近日,小鹏集团正式推出 TuringViT 高效视觉编码器,作为物理 AI 技术栈的关键拼图,这套从架构到数据范式全面重构的视觉基座,不仅为智驾、座舱、机器人三大业务线提供统一感知底座,更试图回答行业共性问题:算力与数据成本高企的当下,高性能视觉大模型如何走出 "头部专属" 困境,真正走向规模化落地。
行业三重瓶颈下的视觉编码困局
在物理 AI 体系中,世界模型负责认知与推演,视觉编码器则是整个系统的 "感知门户"。所有场景理解、状态判断、动作决策,都始于高质量的视觉特征提取,这一环节的效率与精度直接决定上层系统的天花板。
随着 VLM 与 VLA 技术加速向物理场景渗透,传统视觉编码器的架构局限日益凸显。对于汽车这类对实时性、可靠性、成本控制都有严苛要求的终端,矛盾尤为突出。

首先是算力成本的刚性约束。标准 softmax 注意力的计算复杂度随视觉 token 数量呈二次方增长,当智能驾驶处理多路高分辨率摄像头与连续视频帧时,训练与推理成本急剧攀升。端侧芯片算力预算有限,单纯堆参数、堆分辨率的路线在车端天然存在天花板。
其次是数据效率的边际递减。主流高性能视觉 Transformer 普遍依赖百亿级图文数据预训练,但互联网公开数据噪声大、标注质量参差不齐,规模扩张带来的性能提升正快速收敛。对绝大多数团队而言,复刻 SOTA 模型的训练成本高得令人却步。
第三是场景适配的结构性错配。多数通用视觉模型采用固定分辨率预训练,而智能驾驶、座舱交互、机器人感知等场景的输入分辨率、长宽比、帧速率高度动态化。"固定预训练加事后适配" 的传统模式,既增加研发复杂度,又带来不可忽视的性能损耗。
正是在这样的背景下,TuringViT 选择系统性重构的技术路线,从架构创新、数据治理到训练范式三个维度同步突破,打造真正面向物理世界场景的视觉基座。
架构创新:线性注意力破解高分辨率困局
TuringViT 的核心突破始于最底层的注意力机制。针对 softmax 注意力在长序列下的算力困境,研发团队提出 Turing 线性注意力(TLA)作为核心计算单元,构建出独特的混合 Turing Block 架构。
这套架构采用 "五层线性注意力加一层标准多头注意力" 的周期性组合。线性注意力承担主要的全局上下文聚合工作,将计算复杂度从二次方降至近线性,从根本上解决高分辨率输入下的算力爆炸问题。周期性插入的少量标准注意力层,则保障 token 级精细交互精度,避免纯线性注意力常见的细节平滑与高频信息丢失。
为进一步平衡效率与表征质量,TuringViT 引入序列长度感知归一化与输入依赖门控机制。前者让模型在不同输入长度下保持稳定的训练动态,后者根据输入内容自适应调整信息流通路径,实现高效全局建模与局部细节保留的有机统一。

目前 TuringViT 推出两个版本。18 层版本包含三组 Turing Block,主打动态分辨率下的高效部署,更适配车端等延迟敏感场景;24 层版本在保持线性计算主导的前提下提升表征能力,面向精度要求更高的复杂任务。
实测数据验证了架构设计的有效性。随着输入分辨率提升,TuringViT 的延迟增长曲线远平缓于标准 softmax ViT,分辨率越高,效率优势越显著。在 1536×1536 高分辨率下,18 层版本推理吞吐量达到主流开源基线的三倍以上。这意味着智能驾驶系统可用同等算力处理更高清的多路画面,或在同等画质下获得更低感知延迟 —— 对行驶中的车辆而言,每一毫秒的压缩都直接关联安全冗余。
数据治理:从 "堆量" 到 "提质" 的范式转换
架构创新解决了 "算得动" 的问题,数据治理体系的重构则解决了 "学得好" 的问题。TuringViT 没有走 "堆数据规模" 的粗放路线,而是打造 VISTA-Curation 多模态数据治理流水线,通过提升单样本监督价值,实现数据效率的量级跃升。
对于图文数据,流水线通过三步精细化筛选完成质量升级。第一步是图像质量过滤,自动剔除低分辨率、模糊、低纹理图片,从源头保证信息密度。第二步是字幕生成与交叉验证,通过多模型、多提示词生成多样化候选字幕,再交叉验证视觉一致性,确保标注准确。第三步是统一打分筛选,从图文对齐度、文本信息量、歧义度多维度综合评估,只保留视觉贴合度高、语义密度高的优质样本。
针对视频数据,治理流程同样严谨。长视频先切分为连续短片段并均匀采样代表帧,再通过语义一致性与运动一致性双重过滤,保留语义连贯、变化信息有效的片段。最终融合局部帧级细节字幕与全局时序语义字幕,生成具备变换感知能力的视频标注,让模型从连续画面中学习更鲁棒的视觉表征。

质量优先的策略带来惊人的效率提升。TuringViT 仅用 0.85B 图文对训练 —— 约为主流高性能模型的十分之一,便在六项零样本分类基准上取得 83.6% 的平均准确率,全面超越十倍数据量训练的开源基线。图文检索等任务优势同样显著。更重要的是,缩放律分析显示模型性能远未饱和,随着高质量数据持续扩大,性能还将稳步提升。
这种 "十分之一数据,更优效果" 的突破,对汽车行业意义深远。智能驾驶积累了海量真实路测数据,但标注成本高、长尾场景稀缺一直是行业痛点。高效的数据治理方法论,意味着车企可用更低成本构建面向自身场景的视觉感知体系,加速技术迭代。
原生动态分辨率:预训练与下游无缝衔接
TuringViT 的第三重创新,是彻底摒弃 "固定分辨率预训练加事后适配" 的传统模式,采用四阶段渐进式原生动态分辨率训练范式,从预训练之初就对齐下游 VLM/VLA 的输入特性。
四个阶段循序渐进,逐步贴近真实应用场景。第一阶段视觉初始化,通过掩码图像建模蒸馏已有模型特征,完成基础表征学习,强化几何细节与高频信息保留能力。第二阶段引入范围受限的动态分辨率训练,保留图像原始长宽比,将长边约束在可控区间,让模型在合理成本下提前适应可变长度 token 序列。
第三阶段进入原生分辨率精调,放开分辨率约束,尽可能保留原始尺寸与比例,让视觉预处理与下游多模态模型的使用习惯完全一致。第四阶段加入经过治理的视频数据,将静态图像表征拓展为具备变换感知能力的图像 - 视频统一表征,进一步提升下游任务迁移性。
配合二维旋转位置编码技术,模型天然支持不同尺寸与长宽比输入,无需额外插值或持续训练适配。这种 "VLM 原生" 设计让视觉预训练与下游多模态任务无缝衔接,大幅降低集成成本与性能损耗。在统一多模态训练流水线对比中,搭载 TuringViT 的方案在目标定位、计数、OCR 识别、文档理解、视觉问答等多数任务上,表现均优于主流视觉编码器基线。
统一感知底座:赋能汽车智能化全场景
对小鹏而言,TuringViT 的发布远不止一次技术发布,更是物理 AI 技术闭环的关键补全。随着这套统一视觉基座落地,小鹏全栈自研的底层技术能力进一步完善,深度赋能智能驾驶、智能座舱、人形机器人三大业务板块。
在智能驾驶领域,TuringViT 将成为第二代 VLA 系统的核心视觉编码器,负责处理多路环视摄像头的高分辨率、多帧动态场景输入,为预测式世界模型提供低延迟、高质量的视觉 token。其近线性延迟特性让高分辨率感知能在车端算力约束下稳定运行,直接助力窄路通行、无导航辅助驾驶、复杂路口处理、长尾参与者识别等功能升级。视觉编码效率的提升,正在释放端侧大模型的全部潜力,让驾驶决策同时拥有 "看得清" 与 "反应快" 两种能力。

在智能座舱与驾泊一体化场景中,TuringViT 的 VLM 原生特性让视觉特征与语言模型实现更高效对齐。更高的识别精度、对不同画幅比例的原生支持,为未来更丰富的座舱交互预留了技术空间。从手势识别到舱内状态感知,从多模态自然交互到增强现实显示,视觉感知的精度与灵活性直接决定座舱智能化的体验边界。
在小鹏 IRON 人形机器人体系中,TuringViT 同样扮演 "视觉视网膜" 的核心角色,为具身智能提供物体细粒度识别、空间关系理解、可操作区域检测、动态环境追踪等基础感知能力。统一基座架构让智驾场景积累的海量视觉经验快速迁移到机器人场景,大幅降低跨场景研发成本。高效的端侧部署特性,也与机器人嵌入式算力约束高度契合,加速展厅导览、工业巡检、商业服务等场景落地。
开放技术路径:推动视觉大模型普惠化
TuringViT 的价值不止于小鹏内部业务落地,更在于为行业提供了一套可复现、可迁移的 SOTA 级视觉大模型训练方法论。其核心架构、数据治理与训练范式均不依赖特定硬件平台,能够适配不同算力环境。
在高性能视觉模型训练成本居高不下的今天,这样一套经过验证、低成本可达 SOTA 效果的技术路径,具备显著的行业价值。通过可复现的数据治理、训练与部署流程,TuringViT 有望降低高性能视觉编码器的训练与定制门槛,让更多团队在可控算力条件下构建面向自身业务的视觉基础模型。
按照规划,小鹏将持续扩大高质量图文视频数据规模,深化时序建模与具身视觉方向探索,推动视觉基座与 VLM/VLA 系统更深度融合。当先进 AI 技术真正渗透到每一次出行、每一个交互场景,智能汽车将从 "带轮子的电脑" 进化为真正理解物理世界的移动智能体。而 TuringViT 这样的底层技术突破,正是支撑这场进化的基石所在。