arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-05-25 至 2026-05-25 共收录 8 信号源:cs.CV, cs.AI, cs.LG

1. 幻觉与鲁棒性 8 篇

2512.20901 2026-05-25 cs.CV 91%

Benchmarking and Enhancing VLM for Compressed Image Understanding

基准测试与增强VLM对压缩图像的理解

Zifu Zhang, Tongda Xu, Siqi Li, Shengxi Li, Yue Zhang, Mai Xu, Yan Wang

机构 * Institute for AI Industry Research, Tsinghua University, Beijing, China(清华人工智能产业研究院) Beihang University, Beijing, China(北京航空航天大学) Beijing University of Technology, Beijing, China(北京理工大学)

专题命中 幻觉与鲁棒性 :VLM(title,title_cn);vision-language model(abstract);分类 cs.CV

AI总结 本文提出首个全面基准测试评估VLM对压缩图像的理解能力,分析性能差距来源,并设计通用适配器提升模型性能10%-30%。

Comments The paper is accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23157 2026-05-25 cs.CL 83%

Same Model, Different Weakness: How Language and Modality Reshape the Jailbreak Attack Surface in Frontier MLLMs

相同模型,不同弱点:语言与模态如何重塑前沿多模态大语言模型的越狱攻击面

Casey Ford, Madison Van Doren, Sicheng Jin, Emily Dix

机构 * Appen(Appliance)

专题命中 幻觉与鲁棒性 :MLLM(summary_cn,abstract);multimodal large language model(abstract)

AI总结 通过跨语言多模态红队测试,发现语言和模态通过不同机制影响越狱漏洞,导致安全排名跨语言不守恒,需重新设计评估框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23189 2026-05-25 cs.LG 70%

Empirical Bayes Conformal Prediction for Vision and Language Models

视觉与语言模型的经验贝叶斯共形预测

Jiapeng Zeng, Yogesh Prabhu, Zhanpeng Zeng, Michael A. Newton, Vikas Singh

机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校) University of California San Diego(加州大学圣地亚哥分校) Xiamen University(厦门大学)

专题命中 幻觉与鲁棒性 :VLM(abstract,abstract_cn);分类 cs.LG

AI总结 提出经验贝叶斯共形预测框架,利用r值将得分变异性转化为不确定性感知的非一致性得分,在保持目标覆盖的同时减少高方差假候选的包含。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23655 2026-05-25 cs.CV cs.AI cs.LG cs.MM 67%

CVSearch: Empowering Multimodal LLMs with Cognitive Visual Search for High-Resolution Image Perception

CVSearch:赋予多模态大语言模型认知视觉搜索能力以感知高分辨率图像

Liupeng Li, Haoqian Kang, Zhenyu Lu, Jinpeng Wang, Bin Chen, Ke Chen, Yaowei Wang

机构 * Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学(深圳)) Peng Cheng Laboratory, Shenzhen, China(鹏城实验室) Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences, Shenzhen, China(深圳先进技术研究院)

专题命中 幻觉与鲁棒性 :multimodal large language model(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 提出CVSearch,一种无需训练的自适应框架,通过评估-搜索工作流动态调度视觉搜索策略,解决高分辨率图像感知中覆盖与效率的权衡问题。

Comments Accepted by ICML 2026. 22 pages, 12 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23065 2026-05-25 cs.CV cs.AI cs.LG 67%

Dithering Defense: Adversarial Robustness of Vision Foundation Models via Multi-Level Floyd-Steinberg Dithering

抖动防御:通过多级 Floyd-Steinberg 抖动实现视觉基础模型的对抗鲁棒性

Yury Belousov, Brian Pulfer, Vitaliy Kinakh, Slava Voloshynovskiy

机构 * Department of Computer Science, University of Geneva, Switzerland(日内瓦大学计算机科学系)

专题命中 幻觉与鲁棒性 :visual question answering(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 本文提出多级 Floyd-Steinberg 误差扩散抖动作为轻量级、模型无关的输入变换,以破坏对抗扰动同时保留语义内容,在多个任务和模型上超越或匹配包括基于扩散的去噪在内的基线方法。

Comments Paper accepted at the IEEE International Conference on Image Processing (ICIP 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23344 2026-05-25 cs.CV cs.AI 62%

CHASD: Language Increment-Calibrated Contrastive Decoding against Hallucination in LVLMs

CHASD:面向LVLMs中幻觉的语言增量校准对比解码

Xiaoyi Huang, Kejia Zhang, Zhiming Luo

机构 * Institute of Artificial Intelligence, Xiamen University(厦门大学人工智能学院) Department of Artificial Intelligence, Xiamen University(厦门大学人工智能系)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 提出CHASD框架,通过不确定性驱动的置信门控和注意力引导的局部扰动,在推理时按需校准对比解码,减少对象幻觉并提升效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23780 2026-05-25 cs.AI 57%

Beyond Binary Edits Robust Multimodal Knowledge Editing with Adversarial Subspace Alignment

超越二元编辑:基于对抗子空间对齐的鲁棒多模态知识编辑

Haoyuan Wang, Xiaohao Liu, Jiajie Su, Jianmao Xiao, Chaochao Chen

机构 * Zhejiang University(浙江大学) National University of Singapore(新加坡国立大学) Jiangxi Normal University(江西师范大学)

专题命中 幻觉与鲁棒性 :multimodal large language model(abstract);分类 cs.AI

AI总结 针对多模态大语言模型知识编辑泛化性不足的问题,提出对抗子空间对齐方法(ASAM),通过潜在对抗鲁棒化(LAR)和秩约束子空间学习(RCSL)实现鲁棒的多模态知识编辑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19858 2026-05-25 cs.CL 50%

Benchmarking Gaslighting Attacks Against Speech Large Language Models

针对语音大语言模型的气灯攻击基准测试

Jinyang Wu, Bin Zhu, Xiandong Zou, Qiquan Zhang, Xu Fang, Pan Zhou

机构 * Singapore Management University(新加坡管理学院) Tongyi Speech Lab(通义语音实验室) Dalian University of Technology(大连理工大学)

专题命中 幻觉与鲁棒性 :vision-language model(abstract)

AI总结 提出五种气灯攻击策略(愤怒、认知干扰、讽刺、隐晦、专业否定),在5个语音和多模态大语言模型上测试,发现平均准确率下降24.3%,揭示语音模型的行为脆弱性。

Comments 5 pages, 2 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏