arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-05-13 至 2026-05-13 共收录 12 信号源:cs.CV, cs.AI, cs.LG

1. 幻觉与鲁棒性 12 篇

2605.12258 2026-05-13 cs.LG 85%

Instruction Lens Score: Your Instruction Contributes a Powerful Object Hallucination Detector for Multimodal Large Language Models

指令透镜分数:您的指令为多模态大语言模型提供了一个强大的对象幻觉检测器

Runhe Lai, Xinhua Lu, Yanqi Wu, Jinlun Ye, Weijiang Yu, Ruixuan Wang

机构 * School of Computer Science and Engineering, Sun Yat-sen University, Guangzhou, China(中山大学计算机科学与工程学院,广州,中国) Peng Cheng Laboratory, Shenzhen, China(鹏城实验室,深圳,中国) Key Laboratory of Machine Intelligence and Advanced Computing, MOE, Guangzhou, China(机器智能与高级计算关键实验室,教育部,广州,中国)

专题命中 幻觉与鲁棒性 :multimodal large language model(title,abstract);MLLM(abstract,abstract_cn);分类 cs.LG

AI总结 本文提出InsLen,通过结合校准局部分数和上下文一致性分数,有效检测多模态大语言模型中的对象幻觉,无需额外训练或辅助模型。

Comments Accepted by ICML-2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12332 2026-05-13 cs.AI 84%

Towards Automated Air Traffic Safety Assessment Around Non-Towered Airports Using Large Language Models

基于大语言模型的非塔台机场飞行安全评估自动化方法研究

Torsten Darrell, Mahyar Ghazanfari, Jordan Kam, Alexandre Bayen, Amin Tabrizian, Peng Wei

机构 * Research Intern, Department of Mechanical and Aerospace Engineering, George Washington University(乔治华盛顿大学机械与航空航天工程系研究实习生) Ph.D. Student, Department of Mechanical and Aerospace Engineering, George Washington University(乔治华盛顿大学机械与航空航天工程系博士生) Undergraduate Student, Aerospace Program, University of California, Berkeley(加州大学伯克利分校航空航天项目本科生) Full Professor, Department of Electrical Engineering and Computer Science, University of California, Berkeley(加州大学伯克利分校电气工程与计算机科学系教授) Ph.D. Student, Department of Computer Science, George Washington University(乔治华盛顿大学计算机科学系博士生) Associate Professor, Department of Mechanical and Aerospace Engineering, George Washington University(乔治华盛顿大学机械与航空航天工程系副教授)

专题命中 幻觉与鲁棒性 :VLM(summary_cn,abstract);vision-language model(abstract);分类 cs.AI

AI总结 本文提出利用视觉语言模型分析非塔台机场CTAF通讯、气象数据和飞行轨迹,通过实证研究和合成数据验证,展示框架在识别飞行冲突中的有效性,表明VLM在非塔台机场安全评估中的潜力。

Comments 25 pages, 17 figures, 5 tables, Accepted to AIAA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11107 2026-05-13 cs.CV cs.AI 79%

Birds of a Feather Flock Together: Background-Invariant Representations via Linear Structure in VLMs

同鸟同群:通过VLMs中的线性结构实现背景不变表示

Youssef Zaazou, Mark Thomas

机构 * Independent Researcher(独立研究者)

专题命中 幻觉与鲁棒性 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本文通过VLMs嵌入空间的高线性可加性,提出一种利用合成数据构建背景不变表示的方法,实现了Waterbirds数据集上90%以上的最差组准确率,并展示了良好的仿真到现实迁移能力。

Comments 36 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11218 2026-05-13 cs.AI 77%

Don't Look at the Numbers: Visual Anchoring Bias and Layer-wise Representation in VLMs

不要看数字:视觉锚定偏差与视觉语言模型中的分层表示

M. Shalankin

机构 * M. Shalankin

专题命中 幻觉与鲁棒性 :VLM(summary_cn);vision-language model(abstract);分类 cs.AI

AI总结 研究揭示视觉锚定对VLM性能评估的系统性偏差,通过分层分析发现不同层的表示差异及架构依赖的融合机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11559 2026-05-13 cs.CV cs.AI 73%

When Looking Is Not Enough: Visual Attention Structure Reveals Hallucination in MLLMs

当观察不足时:视觉注意结构揭示大语言模型中的幻觉

Fanpu Cao, Xin Zou, Xuming Hu, Hui Xiong

机构 * Thrust of Artificial Intelligence, HKUST (Guangzhou)(人工智能前沿 thrust,香港科技大学(广州)) Department of Computer Science and Engineering, HKUST(计算机科学与工程系,香港科技大学)

专题命中 幻觉与鲁棒性 :visual reasoning(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 本文通过分析视觉注意的高频结构揭示大语言模型中的幻觉现象,提出LaSCD解码策略,有效减少幻觉并保持模型能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12181 2026-05-13 cs.AI 57%

MolDeTox: Evaluating Language Model's Stepwise Fragment Editing for Molecular Detoxification

MolDeTox:评估语言模型的逐步片段编辑用于分子去毒化

Jueon Park, Wonjune Jang, Jiwoo Lee, Yein Park, Jaewoo Kang

机构 * Korea University(韩国大学) Myongji University(明知大学) AIGEN Sciences(AIGEN科技公司)

专题命中 幻觉与鲁棒性 :vision language model(abstract);分类 cs.AI

AI总结 本文提出MolDeTox基准,用于评估语言模型在分子去毒化中的逐步片段编辑能力,通过细粒度评估提升分子结构有效性与生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12154 2026-05-13 cs.AI 57%

MM-OptBench: A Solver-Grounded Benchmark for Multimodal Optimization Modeling

MM-OptBench:一种面向多模态优化建模的求解器导向基准

Zhong Li, Qi Huang, Yuxuan Zhu, Mohammad Mohammadi Amiri, Niki van Stein, Thomas Bäck, Matthijs van Leeuwen, Zaiwen Wen, Lincen Yang

机构 * Great Bay University(大湾大学) Leiden University(莱顿大学) Rensselaer Polytechnic Institute(伦塞拉尔理工学院) Peking University(北京大学)

专题命中 幻觉与鲁棒性 :multimodal large language model(abstract);分类 cs.AI

AI总结 本文提出MM-OptBench,一个基于求解器的多模态优化建模基准,通过文本和视觉信息生成数学模型和求解器代码,评估9种多模态大语言模型在不同难度实例上的表现,结果显示任务仍远未解决。

Comments Paper under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11687 2026-05-13 cs.AI 57%

Persistent and Conversational Multi-Method Explainability for Trustworthy Financial AI

持久且可对话的多方法可解释性用于可信金融AI

Georgios Makridis, Georgios Fatouros, John Soldatos, George Katsis, Dimosthenis Kyriazis

机构 * University of Piraeus, Greece(希腊比雷埃克斯大学) ExpertAI-Lux S.à r.l(ExpertAI-Lux公司)

专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.AI

AI总结 本文提出一种用于金融情感分析的以人为中心的可解释AI架构,结合持久化存储、多方法解释三角验证和自动化评估,提升金融AI的可信度和可解释性。

Comments 5 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11591 2026-05-13 cs.CV 57%

Logit-Attention Divergence: Mitigating Position Bias in Multi-Image Retrieval via Attention-Guided Calibration

Logit-Attention Divergence:通过注意力引导的校准缓解多图像检索中的位置偏差

Mingtao Xian, Yifeng Yang, Qinying Gu, Xinbing Wang, Nanyang Ye

机构 * Zhiyuan College, Shanghai Jiao Tong University, Shanghai, China(上海交通大学紫阳学院) Shanghai Jiao Tong University, Shanghai, China(上海交通大学) Shanghai Artificial Intelligence Laboratory, Shanghai, China(上海人工智能实验室) Shanghai Innovation Institute, Shanghai, China(上海创新研究院)

专题命中 幻觉与鲁棒性 :multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出一种无需训练的注意力引导去偏框架,通过利用内在注意力信号在推理时进行实例级校正,显著提升排列不变性并取得最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11237 2026-05-13 cs.LG 57%

DeconDTN-Toolkit: A Library for Evaluation and Enhancement of Robustness to Provenance Shift

DeconDTN-Toolkit:一个用于评估和增强对溯源转移鲁棒性的工具包

Yongsen Tan, Zhecheng Sheng, Xiruo Ding, Serguei V. S. Pakhomov, Trevor Cohen

机构 * University of Washington(华盛顿大学) University of Minnesota(明尼苏达大学)

专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.LG

AI总结 本文提出DeconDTN-Toolkit,通过模拟不同程度的溯源转移,评估和增强模型对溯源转移的鲁棒性,揭示经验风险最小化方法的脆弱性,并提供理论和实用工具以应对溯源混淆问题。

Comments Accepted to CHIL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10815 2026-05-13 cs.AI eess.AS 57%

Probing Cross-modal Information Hubs in Audio-Visual LLMs

探测音频-视觉大语言模型中的跨模态信息枢纽

Jihoo Jung, Chaeyoung Jung, Ji-Hoon Kim, Joon Son Chung

机构 * Department of Electrical Engineering, Korea Advanced Institute of Science The Graduate School of Advanced Imaging Science, Multimedia \& Film, Chung-Ang University, Seoul, Republic of Korea

专题命中 幻觉与鲁棒性 :vision language model(abstract);分类 cs.AI

AI总结 本文研究了音频-视觉大语言模型中音频与视觉模态间的跨模态信息流动,发现信息主要存储在sink tokens中,并提出一种无需训练的hallucination缓解方法。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11769 2026-05-13 cs.CL 50%

Safety-Oriented Evaluation of Language Understanding Systems for Air Traffic Control

面向安全的语言理解系统在空交通管制中的评估

Yujing Chang, Yash Guleria, Duc-Thinh Pham, Nhut-Huy Pham, Ningli Wang, Vu N. Duong, Sameer Alam

机构 * ATMRI, Nanyang Technological University (NTU), Singapore(航空交通管理研究所,南洋理工大学(NTU),新加坡) School of Management, Indian Institute of Technology Mandi, India(管理学院,印度理工学院曼迪分校,印度) Centre of AI Research, VinUniversity, Vietnam(人工智能研究中心,文大学,越南)

专题命中 幻觉与鲁棒性 :grounding(abstract)

AI总结 本文提出面向安全的评估框架,揭示现有LLM在空交通管制中的可靠性不足,指出需建立后果意识的评估协议以确保AI辅助系统的安全部署。

详情

展开后加载摘要…

URL PDF HTML 收藏