AIM-CoT: Active Information-driven Multimodal Chain-of-Thought for Vision-Language Reasoning
AIM-CoT:基于主动信息的多模态链式推理用于视觉-语言推理
机构 * The Chinese University of Hong Kong(香港中文大学) ; Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳))
AI总结 本文提出AIM-CoT框架,通过上下文增强注意力图生成、主动视觉探测和动态注意力转移触发,改进视觉语言模型的证据选择与插入触发,提升视觉-语言推理性能。
Comments Accepted by ACL 2026 Main Conference. 30 pages, 6 figures