"I See What You Did There": Can Large Vision-Language Models Understand Multimodal Puns?
我看出你在那儿:大型视觉-语言模型能否理解多模态双关语?
机构 * Zhejiang University(浙江大学) ; Beihang University(北京航空航天大学) ; Palo Alto Networks ; Hangzhou Dianzi University(杭州电子科技大学) ; Ningbo Global Innovation Center, Zhejiang University(浙江大学宁波全球创新中心) ; OPPO Research Institute(OPPO研究院) ; Qilu University of Technology(齐鲁工业大学)
AI总结 本文研究了大型视觉-语言模型理解多模态双关语的能力,提出多模态双关语生成流程和MultiPun数据集,通过评估发现模型在区分真实双关语与干扰项上表现不足,并提出提示级和模型级策略提升理解性能。
Comments ACL 2026 Main