arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-05-08 至 2026-05-08 共收录 4 信号源:cs.CV, cs.AI, cs.LG

1. 幻觉与鲁棒性 4 篇

2605.05594 2026-05-08 cs.CL cs.CV cs.LG 73%

The Cost of Context: Mitigating Textual Bias in Multimodal Retrieval-Augmented Generation

上下文的成本:减轻多模态检索增强生成中的文本偏差

Hoin Jung, Xiaoqian Wang

机构 * Elmore Family School of Electrical and Computer Engineering(埃尔莫夫家族电气与计算机工程学院)

专题命中 幻觉与鲁棒性 :grounding(abstract);multimodal large language model(abstract);分类 cs.CV、cs.LG

AI总结 本文探讨了多模态大语言模型在整合检索增强生成时出现的文本偏差问题,提出BAIR方法通过恢复视觉显著性并施加位置感知惩罚来提升多模态接地和诊断可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05709 2026-05-08 cs.AI 70%

Conceal, Reconstruct, Jailbreak: Exploiting the Reconstruction-Concealment Tradeoff in MLLMs

隐藏、重建、突破:在大规模语言模型中利用重建-隐藏权衡

Md Farhamdur Reza, Richeng Jin, Tianfu Wu, Huaiyu Dai

机构 * NC State University(北卡罗来纳州立大学) Zhejiang University(浙江大学)

专题命中 幻觉与鲁棒性 :multimodal large language model(abstract);MLLM(abstract_cn);分类 cs.AI

AI总结 本文探讨了在多模态大语言模型中利用重建与隐藏的权衡进行意图混淆攻击,提出了一种基于字符移除的变体构造方法,并引入关键词相关的干扰图像以提高攻击效果。

Comments 39 pages, including appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06096 2026-05-08 cs.CL cs.CV 57%

Uncovering Entity Identity Confusion in Multimodal Knowledge Editing

揭示多模态知识编辑中的实体身份混淆

Shu Wu, Xiaotian Ye, Xinyu Mou, Dongsheng Liu, Xiaohan Wang, Mengqi Zhang

机构 * New Laboratory of Pattern Recognition (NLPR)(模式识别新实验室) State Key Laboratory of Multimodal Artificial Intelligence Systems (MAIS)(多模态人工智能系统国家重点实验室) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Beijing University of Posts and Telecommunications(北京邮电大学) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences(中国科学院大学先进交叉学科学院) Huazhong University of Science and Technology(华中科技大学) Shandong University(山东大学)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV

AI总结 本文研究多模态知识编辑中实体身份混淆问题,发现现有方法无法区分图像-实体绑定与实体-实体关系,导致模型错误关联。通过构建EC-Bench基准测试,提出约束编辑阶段以提升绑定准确性,从而减少混淆。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05810 2026-05-08 cs.CV 57%

CXR-ContraBench: Benchmarking Negated-Option Attraction in Medical VLMs

CXR-ContraBench:医疗视觉语言模型中否定选项吸引力的基准测试

Zhengru Fang, Yanan Ma, Yu Guo, Senkang Hu, Yixian Zhang, Hangcheng Cao, Wenbo Ding, Yuguang Fang

机构 * City University of Hong Kong(香港城市大学) Tsinghua Shenzhen International Graduate School(清华大学深圳国际研究生院)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV

AI总结 研究医疗视觉语言模型在否定选项吸引力问题上的表现,通过CXR-ContraBench基准测试发现模型在面对矛盾图像和问题时易产生极性反转,提出QCCV-Neg方法有效修复极性混淆问题。

详情

展开后加载摘要…

URL PDF HTML 收藏