Learning to Decode Against Compositional Hallucination in Video Multimodal Large Language Models
在视频多模态大语言模型中学习对抗组合性幻觉
机构 * Sun Yat-sen University(中山大学) ; Huaqiao University(华侨大学) ; Shenzhen University(深圳大学) ; Guangming Laboratory(光明实验室) ; Shanghai Jiao Tong University(上海交通大学)
专题命中 幻觉与鲁棒性 :multimodal large language model(title,abstract);分类 cs.CV、cs.AI
AI总结 针对视频多模态大语言模型中的组合性幻觉问题,提出TriCD框架,通过对比解码和三路径校准机制提升模型在对抗幻觉时的准确率。