TuringViT: Making SOTA Vision Transformers Accessible to All
TuringViT:让最先进的视觉Transformer人人可用
机构 * Foundation Model Team, Xpeng Inc.(小鹏汽车基础模型团队)
AI总结 提出TuringViT,通过图灵线性注意力、VISTA-Curation数据构建和原生动态分辨率预训练,仅用10%数据即可超越开源ViT基线,并显著提升下游VLM性能和高分辨率延迟。
大厂专区
TuringViT:让最先进的视觉Transformer人人可用
机构 * Foundation Model Team, Xpeng Inc.(小鹏汽车基础模型团队)
AI总结 提出TuringViT,通过图灵线性注意力、VISTA-Curation数据构建和原生动态分辨率预训练,仅用10%数据即可超越开源ViT基线,并显著提升下游VLM性能和高分辨率延迟。