arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-05-14 至 2026-05-14 共收录 5 信号源:cs.CV, cs.AI, cs.LG

1. 幻觉与鲁棒性 5 篇

2605.12517 2026-05-14 cs.CL cs.AI cs.CV 86%

Bridging the Missing-Modality Gap: Improving Text-Only Calibration of Vision Language Models

弥合缺失模态的差距:改进纯文本校准的视觉语言模型

Mingyeong Kim, Jungwon Choi, Chaeyun Jang, Juho Lee

机构 * Graduate School of AI, KAIST(人工智能研究生院,韩国科学技术院)

专题命中 幻觉与鲁棒性 :vision language model(title);VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出Latent Imagination Module,通过预测文本输入的潜在嵌入来提升纯文本环境下视觉语言模型的准确性和校准性能。

Comments 9 pages, 16 figures. Accepted at the ICLR 2026 Workshop on Principled Design for Trustworthy AI: Interpretability, Robustness, and Safety across Modalities

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13156 2026-05-14 cs.CV 83%

Dual-Pathway Circuits of Object Hallucination in Vision-Language Models

视觉语言模型中物体幻觉的双路径电路

Jiaxin Liu, Ding Zhong, Yue Wang, Zhidong Yang, Zhaolu Kang, Guangyuan Dong, Qishi Zhan, Pengcheng Fang, Aofan Liu

机构 * UIUC(伊利诺伊大学香槟分校) UMich(密歇根大学) Stanford(斯坦福大学) HKUST(香港科技大学) PKU(北京大学) NUS(新加坡国立大学) Marquette(马quette大学) Southampton(南安普顿大学)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);grounding(abstract);分类 cs.CV

AI总结 研究通过双路径电路分析框架揭示视觉语言模型中物体幻觉的机制,发现视觉接地路径与幻觉路径的交互特性,并通过抑制幻觉路径组件降低幻觉发生率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12674 2026-05-14 cs.AI cs.LG cs.RO 82%

Revealing Interpretable Failure Modes of VLMs

揭示视觉语言模型的可解释性故障模式

Isha Chaudhary, Vedaant V Jain, Kavya Sachdeva, Sayan Ranu, Gagandeep Singh

机构 * UIUC(伊利诺伊大学香槟分校) Kumo AI IIT Delhi(德里印度理工学院)

专题命中 幻觉与鲁棒性 :VLM(abstract,abstract_cn);vision-language model(abstract);grounding(abstract);分类 cs.AI、cs.LG

AI总结 本文提出REVELIO框架,通过系统性探索揭示VLMs在自动驾驶和室内机器人领域中的可解释性故障模式,发现模型在空间定位和安全威胁识别上的缺陷。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22474 2026-05-14 cs.RO cs.LG 77%

When to Act, Ask, or Learn: Uncertainty-Aware Policy Steering

何时行动、提问或学习:不确定性感知的策略引导

Jessie Yuan, Yilin Wu, Andrea Bajcsy

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 幻觉与鲁棒性 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.LG

AI总结 本文提出不确定性感知策略引导框架,通过联合推理任务语义不确定性和低层动作可行性,选择执行高置信度动作、通过自然语言查询澄清任务歧义或请求动作干预修正低层策略,提升机器人部署性能。

Comments To appear in Robotics: Science and Systems 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12650 2026-05-14 cs.CV 70%

CRAFT: Clinical Reward-Aligned Finetuning for Medical Image Synthesis

CRAFT:面向医学图像合成的临床对齐微调

Yunsung Chung, Alex El Darzi, Carlo El Khoury, Han Feng, Nassir Marrouche, Jihun Hamm

机构 * Department of Computer Science, Tulane University(路易斯安那大学计算机科学系) School of Medicine, Tulane University(路易斯安那大学医学院)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出CRAFT框架,通过临床对齐评分和奖励优化提升医学图像生成质量,减少幻觉生成,提升分类性能。

详情

展开后加载摘要…

URL PDF HTML 收藏