XPeng Completes the Visual Foundation of Physical AI

华尔街见闻
2026.07.22 11:06

覆盖智驾座舱机器人全场景。

7 月 21 日,小鹏集团称,正式发布 TuringViT 高效视觉编码器,面向 VLM(视觉语言模型)/VLA(视觉语言动作模型)应用场景,从架构设计、数据范式与训练流程进行了系统性重构。小鹏方面称,该编码器将用于小鹏智能驾驶、智能座舱及 IRON 人形机器人三大业务场景。

在 VLM/VLA 系统中,视觉编码器通常被视为物理 AI 的 “感知入口”,负责将图像或视频转化为供后续语言、动作模块处理的视觉特征。

随着 VLM/VLA 技术向真实场景落地,高分辨率图像、多视角输入和连续视频帧对视觉编码器的效率与时序处理能力提出了更高要求。

小鹏方面认为,行业普遍采用的 “复用开源通用 ViT” 方案,难以同时满足智能驾驶、具身机器人等场景对性能、延迟与定制化的需求。

小鹏将 TuringViT 的设计归纳为三个维度。

架构方面,TuringViT 以 Turing 线性注意力(TLA)为主,并保留少量标准多头注意力,构成混合 Turing Block 架构;在高分辨率输入下,计算复杂度由二次方缩放转为近线性。

据小鹏公布的测试数据,在 1536×1536 分辨率下,TuringViT-18L 的推理吞吐量达到 Seed1.5-ViT 的 3.04 倍。

该编码器提供两个规格版本:TuringViT-18L 包含 3 组 Turing Block,面向动态分辨率下的部署;TuringViT-24L 包含 4 组 Turing Block,侧重提升表征能力。

数据方面,TuringViT 采用 VISTA-Curation 多模态数据治理流水线。据小鹏方面介绍,该流水线对图文和视频数据进行多阶段筛选、重新描述和评分,以提高单个样本的监督信息量。TuringViT 使用 0.85B 图文对进行预训练,约为 SigLIP2-L 训练数据规模的 10%。在包括 ImageNet-1K 在内的六项零样本分类基准上,TuringViT-24L 的平均准确率为 83.6%。

训练方面,TuringViT 采用四阶段渐进式原生动态分辨率训练方案,从预训练阶段即适配下游 VLM/VLA 的输入特性,配合二维旋转位置编码,支持不同尺寸和长宽比的输入。小鹏方面表示,这一设计减少了对 “固定分辨率预训练 + 事后适配” 路径的依赖。

小鹏方面称,TuringViT 将用于三类业务场景。

在智能驾驶领域,小鹏称 TuringViT 是第二代 VLA 模型的核心视觉编码器,负责处理多路环视摄像头的高分辨率图像和多帧动态道路场景输入,为预测式世界模型提供视觉 token。

在智能座舱场景中,TuringViT 的 VLM 原生特性用于对齐视觉特征与语言模型,并支持不同画幅和比例的视觉输入。

在小鹏 IRON 人形机器人的技术体系中,小鹏将 TuringViT 定位为基础视觉模块,承担物体识别、空间关系理解、可操作区域检测和动态环境追踪等功能。

何小鹏在 3 月 20 日业绩会上称,小鹏 IRON 人形机器人计划于 2026 年底量产,年底月产能目标为上千台,并将优先在小鹏门店落地商用。

小鹏方面表示,TuringViT 的架构设计与训练流程不依赖特定硬件平台,可为行业提供一条可复现的视觉大模型训练路径。

从技术布局看,TuringViT 补上了小鹏物理 AI 技术体系中的视觉编码器一环。

此前,小鹏已陆续披露多视角生成式世界模型 X-World、世界模型推理加速引擎 X-Cache、预测式世界模型 X-Foresight 及 X-Mind 技术框架。TuringViT 则位于这套物理 AI 技术体系的感知输入端。

不过,视觉编码器从技术发布到实际场景的规模化落地,仍要经过工程适配、算力部署与场景验证。

TuringViT 能否在车端、座舱和机器人三个差异化的物理环境中稳定运行,尚需持续观察。小鹏方面表示,未来将持续扩大高质量图文视频数据规模,深化时序建模与具身视觉方向的技术探索。