Bridging the Missing-Modality Gap: Improving Text-Only Calibration of Vision Language Models
弥合缺失模态的差距:改进纯文本校准的视觉语言模型
机构 * Graduate School of AI, KAIST(人工智能研究生院,韩国科学技术院)
专题命中 幻觉与鲁棒性 :vision language model(title);VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV、cs.AI
AI总结 本文提出Latent Imagination Module,通过预测文本输入的潜在嵌入来提升纯文本环境下视觉语言模型的准确性和校准性能。
Comments 9 pages, 16 figures. Accepted at the ICLR 2026 Workshop on Principled Design for Trustworthy AI: Interpretability, Robustness, and Safety across Modalities