arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-04-09 至 2026-04-09 共收录 8 信号源:cs.CV, cs.AI, cs.LG

1. 幻觉与鲁棒性 8 篇

2604.07034 2026-04-09 cs.RO cs.AI cs.CV 84%

KITE: Keyframe-Indexed Tokenized Evidence for VLM-Based Robot Failure Analysis

KITE:基于关键帧的令牌化证据用于基于视觉语言模型的机器人故障分析

Mehdi Hosseinzadeh, King Hang Wong, Feras Dayoub

机构 * Australian Institute for Machine Learning (AIML), Adelaide University(澳大利亚机器学习研究所(AIML),阿德莱德大学)

专题命中 幻觉与鲁棒性 :VLM(title,abstract);vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 KITE通过将长机器人执行视频转化为紧凑可解释的令牌化证据,提升基于VLM的机器人故障检测与分析能力,尤其在模拟故障检测中表现优异。

Comments ICRA 2026; Project page: https://m80hz.github.io/kite/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06502 2026-04-09 cs.LG 79%

VLMShield: Efficient and Robust Defense of Vision-Language Models against Malicious Prompts

VLMShield: 有效且稳健的视觉语言模型对抗恶意提示防御

Peigui Qi, Kunsheng Tang, Yanpu Yu, Jialin Wu, Yide Song, Wenbo Zhou, Zhicong Huang, Cheng Hong, Weiming Zhang, Nenghai Yu

机构 * University of Science and Technology of China(中国科学技术大学) University of Washington(华盛顿大学)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.LG

AI总结 本文提出VLMShield,通过多模态聚合特征提取框架提升视觉语言模型对恶意提示的防御能力,实验显示其在鲁棒性、效率和实用性方面表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22451 2026-04-09 cs.CV cs.AI 73%

Countering the Over-Reliance Trap: Mitigating Object Hallucination for LVLMs via a Self-Validation Framework

对抗过度依赖陷阱:通过自验证框架缓解LVLMs中的物体幻觉

Shiyu Liu, Xinyi Wen, Zhibin Lan, Ante Wang, Jinsong Su

专题命中 幻觉与鲁棒性 :vision language model(abstract);LLaVA(abstract);分类 cs.CV、cs.AI

AI总结 本文提出自验证框架,通过验证生成描述中物体存在的可信度,缓解LVLMs中的物体幻觉问题,在图像描述任务中取得显著改进。

Comments Code is available at https://github.com/Liushiyu-0709/SelfVal

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14735 2026-04-09 q-fin.CP cs.AI cs.CV 73%

PyFi: Toward Pyramid-like Financial Image Understanding for VLMs via Adversarial Agents

PyFi: 通过对抗代理实现金字塔式金融图像理解的愿景语言模型

Yuqun Zhang, Yuxuan Zhao, Sijia Chen

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Yantai Research Institute, Harbin Engineering University(哈尔滨工程大学烟台研究院)

专题命中 幻觉与鲁棒性 :vision language model(abstract);visual reasoning(abstract);分类 cs.CV、cs.AI

AI总结 PyFi通过对抗代理生成的金字塔结构数据集,提升VLM在金融图像理解中的推理能力,实验显示模型在复杂金融问题上的准确率提升19.52%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06714 2026-04-09 cs.AI cs.CL cs.CV cs.LG 67%

Steering the Verifiability of Multimodal AI Hallucinations

操控多模态AI幻觉的可验证性

Jianhong Pang, Ruoxi Cheng, Ziyi Ye, Xingjun Ma, Zuxuan Wu, Xuanjing Huang, Yu-Gang Jiang

机构 * Institute of Trustworthy Embodied AI, Fudan University(复旦大学可信具身人工智能研究所) Shanghai Key Laboratory of Multimodal Embodied AI(上海市多模态具身人工智能重点实验室)

专题命中 幻觉与鲁棒性 :multimodal large language model(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 本文研究多模态AI幻觉的可验证性差异,提出基于激活空间的干预方法,通过区分明显和隐秘幻觉,实现对模型可验证性的精细控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06728 2026-04-09 cs.CV cs.AI cs.MM 62%

URMF: Uncertainty-aware Robust Multimodal Fusion for Multimodal Sarcasm Detection

URMF:面向多模态讽刺检测的不确定性感知鲁棒多模态融合

Zhenyu Wang, Weichen Cheng, Weijia Li, Junjie Mou, Zongyou Zhao, Guoying Zhang

机构 * School of Artificial Intelligence, China University of Mining and Technology-Beijing(中国矿业大学(北京)人工智能学院)

专题命中 幻觉与鲁棒性 :MLLM(abstract);分类 cs.CV、cs.AI

AI总结 本文提出URMF框架,通过建模模态可靠性提升多模态讽刺检测的准确性和鲁棒性,采用多头交叉注意力和自注意力机制,并结合不确定性建模和联合训练目标,在公开基准上优于现有基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06277 2026-04-09 cs.AI cs.CL cs.LG 62%

Weakly Supervised Distillation of Hallucination Signals into Transformer Representations

弱监督蒸馏 hallucination 信号到 Transformer 表示

Shoaib Sadiq Salehmohamed, Jinal Prashant Thakkar, Hansika Aredla, Shaik Mohammed Omar, Shalmali Ayachit

机构 * LLM Lens

专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.AI、cs.LG

AI总结 本文提出弱监督框架,通过子串匹配、句子嵌入相似性和LLM判官信号,无需人工标注即可标注生成响应是否 grounded 或 hallucinated,并通过五种探针分类器验证 hallucination 信号可被蒸馏到 Transformer 表示中。

Comments 20 pages, 6 figures, 6 tables. Introduces a 15k-sample representation-level hallucination dataset with full transformer hidden states and multi-signal weak supervision. Evaluates 5 probing architectures and demonstrates internal hallucination detection without external inference-time signals. Includes held-out test evaluation and deployment benchmarks

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06846 2026-04-09 cs.CL cs.AI 57%

MedDialBench: Benchmarking LLM Diagnostic Robustness under Parametric Adversarial Patient Behaviors

MedDialBench:在参数对抗患者行为下评估LLM诊断鲁棒性的基准测试

Xiaotian Luo, Xun Jiang, Jiangcheng Wu

机构 * Shanda Group(盛大集团)

专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.AI

AI总结 MedDialBench通过控制患者行为维度,评估LLM在不同行为下的诊断鲁棒性,发现信息污染对准确率的影响大于信息缺失,且模型存在不同的脆弱性特征。

Comments 9 pages, 4 figures, 9 tables. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏