On the Limits of Token Reduction for Efficient Unified Vision Language Training
论高效统一视觉语言训练中令牌缩减的极限
机构 * University of Michigan(密歇根大学) ; Sony AI(索尼人工智能)
专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV、cs.AI
AI总结 本文通过分析层注意力分配,发现视觉理解与视觉生成在令牌冗余上存在不对称性,设计任务特定加速器,但统一训练中任务特定令牌丢弃导致协同损失,表明高效统一建模需保留共享跨任务结构。