Evidence Recomposition and Predictive Context Residualization for Visual Attribution in Multimodal Large Language Models
多模态大语言模型中用于视觉归因的证据重组与预测上下文残差化
机构 * Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区) ; Zhongguancun Academy(中关村学院) ; University of Chinese Academy of Sciences(中国科学院大学) ; Nanyang Technological University(南洋理工大学) ; Department of Mechanical Engineering, Imperial College London(伦敦帝国理工学院机械工程系)
专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.AI
AI总结 研究多模态大语言模型token级视觉证据难检查问题,提出基于证据重组和预测上下文残差化的ERCR框架,经实验验证该框架能改善目标token视觉证据、减轻上下文干扰,为视觉证据检查提供实用改进。