Latent Visual States for Efficient Multimodal Reasoning
用于高效多模态推理的潜在视觉状态
机构 * Sun Yat-sen University(中山大学) ; The Hong Kong Polytechnic University(香港理工大学) ; MBZUAI(穆罕默德·本·扎耶德人工智能大学) ; Huawei Noah’s Ark Lab(华为诺亚方舟实验室) ; Yinwang Intelligent Technology Co. Ltd(银旺智能科技有限公司)
专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV
AI总结 提出EVA框架,通过生成连续潜在视觉表示(Latent_slot tokens)作为中间推理思考,并设计D-GSPO解决优化策略偏差,构建EVA-230K数据集,在多个基准上提升性能与推理效率。