arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-05-29 至 2026-05-29 共收录 9 信号源:cs.CV, cs.AI, cs.LG

1. 幻觉与鲁棒性 9 篇

2605.29881 2026-05-29 cs.CV cs.AI 88%

Mitigating Hallucination in Vision-Language Models through Barrier-Regulated Adaptive Closed-form Steering

通过屏障调控自适应闭式引导缓解视觉语言模型中的幻觉

Soumyadeep Jana, Pulkit Mittal, Sanasam Ranbir Singh

机构 * Indian Institute of Technology Guwahati(印度理工学院果阿班加)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);LLaVA(abstract,abstract_cn);grounding(abstract);分类 cs.CV、cs.AI

AI总结 提出BRACS框架,通过监测视觉注意力并仅在接地退化时进行闭式修正,无需训练即可有效减少LVLM中的物体幻觉。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23853 2026-05-29 cs.AI cs.MA 85%

SCoOP: Semantic Consistent Opinion Pooling for Uncertainty Quantification in Multiple Vision-Language Model Systems

SCoOP: 多视觉-语言模型系统中用于不确定性量化的语义一致意见池化

Chung-En Johnny Yu, Brian Jalaian, Nathaniel D. Bastian

机构 * University of West Florida(西佛罗里达大学) United States Military Academy(美国军事学院)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);VLM(abstract,abstract_cn);分类 cs.AI

AI总结 提出SCoOP框架,通过不确定性加权的线性意见池化聚合多个视觉-语言模型的输出,实现无训练的不确定性量化,有效检测幻觉并支持高不确定性样本的弃权。

Comments Accepted to ICLR 2026 Workshop on Agentic AI in the Wild: From Hallucinations to Reliable Autonomy

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.14279 2026-05-29 cs.CV cs.CL 79%

Looking Beyond Text: Reducing Language bias in Large Vision-Language Models via Multimodal Dual-Attention and Soft-Image Guidance

超越文本:通过多模态双注意力和软图像引导减少大型视觉语言模型中的语言偏差

Haozhe Zhao, Shuzheng Si, Liang Chen, Yichi Zhang, Maosong Sun, Mingjia Zhang, Baobao Chang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Peking University(北京大学) Tsinghua University(清华大学)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV

AI总结 针对大型视觉语言模型因语言偏差导致的幻觉问题,提出LACING框架,采用多模态双注意力机制和软图像引导策略,在不增加训练资源的情况下增强视觉理解并减少幻觉。

Comments EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29956 2026-05-29 cs.IR 67%

Uncertainty Quantification for Multimodal Retrieval Augmented Generation

多模态检索增强生成的不确定性量化

Simon Binz, Heydar Soudani, Faegheh Hasibi

专题命中 幻觉与鲁棒性 :vision-language model(abstract);VLM(abstract_cn)

AI总结 提出 LeMUQ 方法,通过多模态和检索感知的概率信号建模不确定性,提升多模态 RAG 系统的可靠性,AUROC 平均提升 3.8%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30341 2026-05-29 cs.CV cs.AI 62%

GPIC: A Giant Permissive Image Corpus for Visual Generation

GPIC:用于视觉生成的大型许可图像数据集

Keshigeyan Chandrasegaran, Kyle Sargent, Suchir Agarwal, Michael Jang, Michael Poli, Juan Carlos Niebles, Justin Johnson, Jiajun Wu, Li Fei-Fei

机构 * Stanford University(斯坦福大学) Radical Numerics University of Michigan(密歇根大学) Salesforce Research(Salesforce研究)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 提出GPIC,一个约28万亿像素的大型许可图像数据集,包含1亿训练样本,通过最先进的视觉语言模型标注,用于视觉生成建模研究。

Comments 25 pages; Dataset: https://huggingface.co/datasets/stanford-vision-lab/giant-permissive-image-corpus; Project website: https://gpic.stanford.edu

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08654 2026-05-29 cs.CL cs.AI cs.LG 62%

From Rubrics to Reliable Scores: Evidence-Grounded Text Evaluation with LLM Judges

从评分标准到可靠分数:基于证据的文本评估与LLM裁判

Yihan Hong, Huaiyuan Yao, Bolin Shen, Wanpeng Xu, Hua Wei, Yushun Dong

机构 * Washington University in St. Louis(华盛顿大学圣路易斯分校) Arizona State University(亚利桑那州立大学) Florida State University(佛罗里达州立大学)

专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.AI、cs.LG

AI总结 提出Rulers框架,通过三阶段推理(任务规范、结构化执行、事后校准)解决LLM在基于评分标准的文本评估中的执行漂移、归因不可验证和人类尺度错位问题,实现更可靠的评分。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29670 2026-05-29 cs.CL cs.AI 57%

EviLink: Multi-Path Schema Linking with Uncertainty-Guided Evidence Acquisition for Large-Scale Text-to-SQL

EviLink: 面向大规模Text-to-SQL的基于不确定性引导证据获取的多路径模式链接

Huawei Zheng, Sen Yang, Zhaorui Yang, Yuhui Zhang, Haozhe Feng, Haoxuan Li, Xuan Yi, Chao Hu, Defeng Xie, Chen Hou, Danqing Huang, Wei Chen, Yingcai Wu, Peng Chen, Dazhen Deng

机构 * School of Software Technology, Zhejiang University(浙江大学软件学院) State Key Lab of CAD&CG, Zhejiang University(浙江大学CAD&CG国家重点实验室) Tencent TEG(腾讯TEG) School of Mathematical Sciences, Peking University(北京大学数学科学学院)

专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.AI

AI总结 提出EviLink方法,通过多假设模式基础与不确定性引导的证据获取,重新定义模式链接为不确定性感知的模式需求推理,以平衡模式完整性、相关性和令牌成本,提升大规模Text-to-SQL性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29579 2026-05-29 cs.CV 57%

ReactBench: A Cause-Driven Benchmark for Multimodal Hallucination via Systematic Evaluation

ReactBench:通过系统评估的多模态幻觉因果驱动基准

Shizhe Zhou, Bohan Jia, Kai Wu, Yan Shen, Tongyun Li, Yuyang Wu, Shaohui Lin

机构 * East China Normal University(华东师范大学)

专题命中 幻觉与鲁棒性 :multimodal large language model(abstract);分类 cs.CV

AI总结 提出ReactBench基准,通过对抗性图像和诱导幻觉的查询,系统评估多模态大模型在关系擦除、反事实属性、变化追踪和密集计数等任务中的因果幻觉。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28828 2026-05-29 cs.CL cs.AI 57%

Micro-Macro Retrieval: Reducing Long-Form Hallucination in Large Language Models

微宏检索:减少大语言模型中的长文本幻觉

Yujie Feng, Jian Li, Zhihan Zhou, Pengfei Xu, Yujia Zhang, Xiaoyu Li, Xiaohui Zhou, Alan Zhao, Xi Chen, Xiao-Ming Wu

机构 * Solar System of OVB, Tencent, China(OVB太阳系,腾讯,中国) The Hong Kong Polytechnic University, Hong Kong S.A.R.(香港理工大学,香港特别行政区) Jilin University, China(吉林大学,中国)

专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.AI

AI总结 提出微宏检索(M2R)框架,通过宏观检索外部粗粒度证据和微观检索推理中关键信息库,解决长文本生成中关键信息与输出距离过远导致的幻觉问题。

详情

展开后加载摘要…

URL PDF HTML 收藏