arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-05-04 至 2026-05-04 共收录 5 信号源:cs.CV, cs.AI, cs.LG

1. 幻觉与鲁棒性 5 篇

2605.00323 2026-05-04 cs.CV cs.LG 81%

Online Self-Calibration Against Hallucination in Vision-Language Models

在线对抗幻觉的视觉-语言模型自我校准

Minghui Chen, Chenxu Yang, Hengjie Zhu, Dayan Wu, Zheng Lin, Qingyi Si

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV、cs.LG

AI总结 本文提出OSCAR框架,通过蒙特卡洛树搜索和双粒度奖励机制在线校准视觉-语言模型,减少幻觉并提升多模态能力。

Comments IJCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00326 2026-05-04 cs.CL cs.CV 77%

Prompt-Induced Score Variance in Zero-Shot Binary Vision-Language Safety Classification

零样本二元视觉语言安全分类中的提示诱导分数方差

Charles Weng, Dingwen Li, Alexander Martin

机构 * Johns Hopkins University(约翰霍普金斯大学) Independent(独立)

专题命中 幻觉与鲁棒性 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV

AI总结 研究发现零样本视觉语言模型安全分类器的单提示首词概率在语义等价提示改写下不可靠,提出训练自由的均值集成方法提升模型性能,推荐提示家族评估与均值聚合作为标准无标签可靠性基准。

Comments Preprint. 19 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00474 2026-05-04 cs.CV 57%

From Local to Global to Mechanistic: An iERF-Centered Unified Framework for Interpreting Vision Models

从局部到全局到机制:一种以iERF为中心的统一框架,用于解释视觉模型

Yearim Kim, Sangyu Han, Nojun Kwak

机构 * Seoul National University(首尔国立大学)

专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.CV

AI总结 本文提出一种以iERF为中心的统一框架,通过点特征向量和实例特定的有效感受野,统一了局部、全局和机制可解释性,提高了解释的准确性和鲁棒性。

Comments Accepted to IEEE Transactions on Pattern Analysis and Machine Intelligence (TPAMI), 2026

Journal ref IEEE Transactions on Pattern Analysis and Machine Intelligence, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27209 2026-05-04 cs.SE cs.AI 57%

Theory Under Construction: Orchestrating Language Models for Research Software Where the Specification Evolves

构建中的理论:协调语言模型用于研究软件,其中规范在演变

Halley Young, Nikolaj Björner

机构 * Microsoft Research(微软研究院)

专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.AI

AI总结 本文提出Comet-H框架,通过迭代提示自动机协调语言模型在研究软件中的应用,解决规范演变中的 hallucination accumulation 和 desynchronization 问题,并通过实验证明其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27345 2026-05-04 cs.CL 50%

LLMs Capture Emotion Labels, Not Emotion Uncertainty: Distributional Analysis and Calibration of Human-LLM Judgment Gaps

大型语言模型捕捉情绪标签而非情绪不确定性:人类与LLM判断差距的分布分析与校准

Keito Inoshita, Xiaokang Zhou, Akira Kawai, Katsutoshi Yada

机构 * Faculty of Business and Commerce(商科学院) Faculty of Business Data Science(商务数据科学学院) RIKEN Center for Advanced Intelligence Project(先进智能项目研究所) Faculty of Data Science(数据科学学院) Japan Safety Society Research Center(日本安全协会研究中心)

专题命中 幻觉与鲁棒性 :grounding(abstract)

AI总结 本文通过对比人类标注与LLM在GoEmotions和EmoBank基准上的情绪判断分布,发现零样本模型与人类分布差异显著,需领域微调而非模型规模扩大以缩小差距,并提出三种轻量校准方法以提升情绪标注的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏