小鹏发布高效视觉编码器TuringViT,称以十分之一数据超越主流基线

7月21日,小鹏集团发布高效视觉编码器TuringViT,面向VLM与VLA应用,支撑智能驾驶、智能座舱及IRON人形机器人。该模型采用线性注意力架构、VISTA-Curation多模态数据治理流水线和四阶段原生动态分辨率训练范式,提供18L、24L两个版本。小鹏称,TuringViT仅使用0.85B图文对训练,约为SigLIP2-L数据规模的十分之一,在六项零样本分类基准平均准确率达83.6%;在1536×1536分辨率下,TuringViT-18L推理吞吐量为Seed1.5-ViT的3.04倍。

上一篇:

下一篇:

发表回复

登录后才能评论