DeltaV: Thinking with Visual State Updates in Unified Large Multimodal Models
DeltaV:在统一大型多模态模型中通过视觉状态更新进行思考
机构 * Huazhong University of Science and Technology(华中科技大学) ; Xiaomi Inc.(小米公司)
专题命中 其他图像生成 :image generation(abstract);分类 cs.CV
AI总结 研究针对统一大型多模态模型全图像生成范式的问题,提出DeltaV模型,通过视觉更新避免冗余,引入TSIM路由器匹配令牌预算,构建StructCoT数据集,实验证明该范式能减少视觉令牌、提升推理能力,DeltaV - 2B性能优异。