当前位置: 首页 » 资讯 » 科技头条 » 正文

小鹏发布TuringViT:打造物理AI统一感知底座 为智能驾驶等三大业务提供支撑

IP属地 中国·北京 编辑:周琳 凤凰网科技 时间:2026-07-21 14:11:47

7月21日,小鹏集团正式发布TuringViT高效视觉编码器,面向VLM/VLA时代系统性重构了视觉编码器的架构设计、数据范式与训练流程。该编码器将全面支撑小鹏智能驾驶、智能座舱及IRON人形机器人三大业务场景。

TuringViT的核心技术创新包括三个方面:

Turing线性注意力架构:采用“5层线性注意力+1层标准多头注意力”的混合Turing Block架构,将计算复杂度从二次方降至近线性。实测显示,在1536×1536分辨率下,TuringViT-18L推理吞吐量达到Seed1.5-ViT的3.04倍,为高分辨率感知、多摄像头输入的端侧部署扫清了算力障碍。

VISTA-Curation数据治理:通过三步精细化筛选(质量过滤、多样化字幕生成与交叉验证、综合评分排序),仅用0.85B图文对(约SigLIP2-L训练数据的10%),便在ImageNet-1K等零样本分类基准上取得83.6%平均准确率,超越使用10B数据训练的主流开源基线。

原生动态分辨率训练:采用四阶段渐进式训练范式(视觉初始化→范围受限动态分辨率→原生分辨率精调→图文视频混合训练),从预训练阶段就适配下游VLM/VLA的输入特性,无需事后适配。

小鹏表示,TuringViT的价值在于为行业提供了一条可复现、低成本训练SOTA级视觉Transformer的技术路径,推动先进视觉大模型从“头部团队专属”走向“行业普惠”。相关论文及代码已同步公开。

标签: 小鹏 分辨率 视觉编码 视觉 智能 注意力 范式 线性 部署 原生 摄像头 行业 动态 质量 评分 人形 字幕 交叉 论文 专属 场景 时代 头部 团队 样本 基准 机器人 普惠 分类 数据 端侧

免责声明:本网信息来自于互联网,目的在于传递更多信息,并不代表本网赞同其观点。其内容真实性、完整性不作任何保证或承诺。如若本网有任何内容侵犯您的权益,请及时联系我们,本站将会在24小时内处理完毕。