arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-05-12 至 2026-05-12 共收录 20 信号源:cs.CV, cs.AI, cs.LG

1. 幻觉与鲁棒性 20 篇

2605.08841 2026-05-12 cs.CV 85%

Illusion-Aware Visual Preprocessing and Anti-Illusion Prompting for Classic Illusion Understanding in Vision-Language Models

基于 illusion 意识的视觉预处理与反 illusion 提示的经典 illusion 理解在视觉-语言模型中的应用

Junli Zha, Jiahui Wang, Xinkai Lu, Jinbo Wang

机构 * SF Technology Co., Ltd.(SF技术有限公司)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);VLM(abstract,abstract_cn);分类 cs.CV

AI总结 本文提出无需训练的框架,通过图像预处理、反 illusion 提示工程和多票集成策略,解决视觉-语言模型对视觉错觉的感知与记忆冲突,实现90.48%和98.41%的准确率。

Comments Accepted at CVPR 2026 Workshop on 5th DataCV Challenge

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09902 2026-05-12 cs.CV 84%

Adversarial Attacks Against MLLMs via Progressive Resolution Processing and Adaptive Feature Alignment

通过渐进分辨率处理和自适应特征对齐对多模态大语言模型进行对抗攻击

Haobo Wang, Xiaorong Ma, Weiqi Luo, Xiaojun Jia, Jiwu Huang

机构 * Sun Yat-sen University(中山大学) Nanyang Technological University(南洋理工大学) Shenzhen MSU-BIT University(深圳MSU-BIT大学)

专题命中 幻觉与鲁棒性 :MLLM(summary_cn,abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出PRAF-Attack框架,通过多尺度语义指导和中间层局部对齐提升多模态大语言模型的对抗攻击转移性,实验表明其在多种黑盒MLLM上表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10002 2026-05-12 cs.CV 83%

Med-StepBench: A Hierarchical Reasoning Framework for Evaluating Hallucinations in Medical Vision-Language Models

Med-StepBench:一种用于评估医学视觉-语言模型幻觉的分层推理框架

Minh Khoi Nguyen, Dai Lam Le, Amir Reza Jafari, Tuan Dung Nguyen, Mai Hong Son, Mai Huy Thong, Quang Huy Nguyen, Thanh Trung Nguyen, Reza Farahbakhsh, Noel Crespi, Phi Le Nguyen

机构 * AI4LIFE, Hanoi University of Science and Technology, Vietnam(AI4LIFE,越南科学与技术大学) SAMOVAR, Télécom SudParis, Institut Polytechnique de Paris, France(SAMOVAR,法国电信南巴黎学院,巴黎理工学院) Military Central Hospital, Vietnam(越南108军中心医院)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);grounding(abstract);分类 cs.CV

AI总结 本文提出Med-StepBench,首个针对3D肿瘤PET/CT图像的分步幻觉检测基准,通过12000张图像和100万对图像-陈述数据,揭示了现有VLMs在多步临床推理中的系统性缺陷。

Comments Accepted at IJCAI-ECAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07649 2026-05-12 cs.CV cs.AI cs.RO 81%

Operating Within the Operational Design Domain: Zero-Shot Perception with Vision-Language Models

在操作设计域内运行:基于视觉-语言模型的零样本感知

Berkehan Ünal, Hauke Dierend, Dren Fazlija, Christopher Plachetka

机构 * Volkswagen Aktiengesellschaft(大众汽车股份有限公司) L3S Research Center(莱比锡大学汉诺威研究中心) Faculty of Information Technology(信息科技学院) MOIA GmbH(MOIA公司) Motor AI GmbH(Motor AI公司)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV、cs.AI

AI总结 本文探讨了视觉-语言模型在无监督条件下对操作设计域的零样本感知能力,通过实验验证了基于链式推理的提示方法在OBD感知中的有效性,并提出了可重用的提示模板。

Comments 8 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11824 2026-05-12 cs.AI cs.LG 81%

Revis: Sparse Latent Steering to Mitigate Object Hallucination in Large Vision-Language Models

Revis: 通过稀疏潜在引导缓解大视觉-语言模型中的物体幻觉

Jialin Wu, Wei Shi, Han Shen, Peigui Qi, Kunsheng Tang, Zhicong Huang, Binghao Wang, Zhou Yang

机构 * Ant Group(蚂蚁集团)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.AI、cs.LG

AI总结 Revis通过潜在空间几何学提取纯视觉信息向量,采用校准策略在抑制发生深度进行稀疏干预,有效降低物体幻觉率19%,同时保持推理能力。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10744 2026-05-12 cs.CV cs.RO 79%

C-CoT: Counterfactual Chain-of-Thought with Vision-Language Models for Safe Autonomous Driving

C-CoT:基于视觉-语言模型的反事实链式推理用于安全自动驾驶

Kefei Tian, Yuansheng Lian, Kai Yang, Xiangdong Chen, Shen Li

机构 * College of Transportation, Tongji University(同济大学交通运输学院) Department of Civil Engineering, Tsinghua University(清华大学土木工程系) School of Vehicle and Mobility, Tsinghua University(清华大学车辆与移动系统学院) Department of Civil and Environmental Engineering, National University of Singapore(新加坡国立大学土木与环境工程系)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV

AI总结 本文提出C-CoT框架,利用视觉-语言模型将驾驶决策分解为五个阶段,通过反事实推理提升自动驾驶在复杂环境中的安全性和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.04077 2026-05-12 cs.CV 79%

H-POPE: Hierarchical Polling-based Probing Evaluation of Hallucinations in Large Vision-Language Models

H-POPE:基于分层轮询的大型视觉-语言模型幻觉评估

Nhi Pham, Michael Schott

机构 * Max Planck Institute for Informatics(马克斯·普朗克信息研究所) Saarland University(萨尔兰州大学) Zuse School(祖斯学校)

专题命中 幻觉与鲁棒性 :vision-language model(title);vision language model(abstract);分类 cs.CV

AI总结 H-POPE通过文本和图像结合的方式评估大型视觉-语言模型的幻觉问题,发现模型在物体存在和细粒度属性上易出现幻觉,且依赖视觉输入生成文本。

Comments Poster at https://sites.google.com/berkeley.edu/bb-stat/home

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07399 2026-05-12 cs.CV 79%

GPO-V: Jailbreak Diffusion Vision Language Model by Global Probability Optimization

GPO-V:通过全局概率优化实现扩散视觉语言模型的突破

Yu Pan, Andi Zhang, Yi Wang, Sibei Yang, Wenjie Wang

机构 * ShanghaiTech University(上海科技大学) University of Warwick(沃里克大学) SUN YAT-SEN UNIVERSITY(中山大学)

专题命中 幻觉与鲁棒性 :vision language model(title);vision-language model(abstract);分类 cs.CV

AI总结 本文提出GPO-V,通过全局概率优化方法突破扩散视觉语言模型的安全防线,揭示了非顺序生成架构中的关键安全漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05045 2026-05-12 cs.CV cs.CL 79%

When Relations Break: Analyzing Relation Hallucination in Vision-Language Model Under Rotation and Noise

关系破裂:在旋转和噪声下的视觉语言模型关系幻觉分析

Philip Wootaek Shin, Ajay Narayanan Sridhar, Sivani Devarapalli, Rui Zhang, Jack Sampson, Vijaykrishnan Narayanan

机构 * The Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV

AI总结 研究探讨了旋转和噪声对视觉语言模型关系推理的影响,发现轻微扰动显著降低模型性能,提示需更鲁棒的几何感知模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10386 2026-05-12 cs.AI 77%

GuardAD: Safeguarding Autonomous Driving MLLMs via Markovian Safety Logic

GuardAD: 通过马尔可夫安全逻辑保障自动驾驶MLLMs

Tianyuan Zhang, Peng Yue, Zihao Peng, Jiangfan Liu, Zonghao Ying, Jiakai Wang, Tianlin Li, Jian Yang, Yaodong Yang, Aishan Liu, Xianglong Liu

机构 * Beihang University(北航大学) Zhongguancun Laboratory(中关村实验室) Peking University(北京大学)

专题命中 幻觉与鲁棒性 :MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.AI

AI总结 GuardAD通过马尔可夫逻辑形式化提升自动驾驶MLLMs的安全性,减少事故率并提升任务性能,经实验验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10676 2026-05-12 cs.CV cs.LG 73%

Not Blind but Silenced: Rebalancing Vision and Language via Adversarial Counter-Commonsense Equilibrium

非盲目而是被沉默:通过对抗性反常识平衡视觉与语言

Qingxin Xiao, Peilin Zhao, Yangyang Zhao, Lingwei Dang, Qingyao Wu

机构 * South China University of Technology(华南理工大学) Institute for Super Robotics (Huangpu)(机器人研究所(黄埔)) Shanghai Jiao Tong University(上海交通大学) Changsha University of Science and Technology(长沙理工大学)

专题命中 幻觉与鲁棒性 :MLLM(abstract,abstract_cn);分类 cs.CV、cs.LG

AI总结 本文提出ACE框架,通过对抗性反常识补丁扰动视觉上下文,动态平衡语言先验与视觉信息,提升模型可信度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.03544 2026-05-12 cs.CV cs.AI cs.CR 73%

PromptGuard: Soft Prompt-Guided Unsafe Content Moderation for Text-to-Image Models

PromptGuard: 基于软提示的文本到图像模型不安全内容审查

Lingzhi Yuan, Xinfeng Li, Chejian Xu, Guanhong Tao, Xiaojun Jia, Yihao Huang, Wei Dong, Yang Liu, Bo Li

机构 * Department of Computer Science, University of Maryland(计算机科学系,马里兰大学) College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算机科学与数据科学学院) Kahlert School of Computing, The University of Utah(犹他大学Kahlert计算学院) Siebel School of Computing and Data Science, University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校Siebel计算与数据科学学院)

专题命中 幻觉与鲁棒性 :VLM(abstract,abstract_cn);分类 cs.CV、cs.AI

AI总结 PromptGuard通过引入软提示机制,有效抑制文本到图像模型生成不安全内容,同时保持生成质量,且比现有方法快3.8倍。

Comments Accepted for publication in IEEE Transactions on Information Forensics and Security (TIFS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.20325 2026-05-12 cs.CL cs.AI cs.CV 62%

GUARD: Guideline Upholding Test through Adaptive Role-play and Jailbreak Diagnostics for LLMs

GUARD:通过自适应角色扮演和 Jailbreak 诊断进行 LLM 的指南合规性测试

Haibo Jin, Ruoxi Chen, Peiyan Zhang, Andy Zhou, Zelei Cheng, Haohan Wang

机构 * Hong Kong University of Science and Technology(香港理工大学) Lapis Labs(Lapis实验室) Capital One

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 GUARD 通过自适应角色扮演和 Jailbreak 诊断,将指南转化为具体违规问题,验证 LLM 的合规性,经八种 LLM 测试验证有效性。

Comments 56 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08896 2026-05-12 cs.CL cs.AI cs.LG 62%

FragileFlow: Spectral Control of Correct-but-Fragile Predictions for Foundation Model Robustness

FragileFlow: 对基础模型鲁棒性进行谱控制的正确但易碎预测的谱控制

Zhuoyun Li, Boxuan Wang, Jinwei Hu, Xiaowei Huang, Yi Dong

机构 * School of Computer Science and Informatics, University of Liverpool, UK(利兹大学计算机科学与信息学学院)

专题命中 幻觉与鲁棒性 :VLM(abstract_cn);分类 cs.AI、cs.LG

AI总结 本文提出FragileFlow,通过谱控制识别正确但易碎的预测,提升基础模型鲁棒性,实验显示其在多个选择LLM基准和少量样本CLIP适应中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08764 2026-05-12 cs.LG cs.CV eess.IV 62%

Anchoring the Eigengap: Cross-Modal Spectral Stabilization for Sample-Efficient Representation Learning

锚定特征间隙:跨模态谱稳定化以实现样本高效表征学习

Nikhil J. Dhinagar, Vidhi Chhatbar, Chirag Jagad, Pavithra Senthilkumar, Sophia I. Thomopoulos, Mahir H. Khan, Sook-Lei Liew, the ENIGMA-Stroke Recovery Working Group, Paul M. Thompson

机构 * Imaging Genetics Center, Mark & Mary Stevens Neuroimaging & Informatics Institute, Keck School of Medicine, University of Southern California(影像基因中心,马克与玛丽史蒂文斯神经影像与信息学研究所,凯克医学院,南加州大学) Neuroscience Graduate Program, Mark & Mary Stevens Neuroimaging & Informatics Institute, Chan Division of Occupational Science & Occupational Therapy, Biomedical Engineering, University of Southern California(神经科学研究生项目,马克与玛丽史蒂文斯神经影像与信息学研究所,查恩职业科学与职业治疗 division,生物医学工程,南加州大学)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV、cs.LG

AI总结 本文提出跨模态谱稳定化方法,通过抑制噪声主导方向并保持特征间隙,提升样本效率下的表征学习性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10622 2026-05-12 cs.MM cs.CV 57%

Vocabulary Hijacking in LVLMs: Unveiling Critical Attention Heads by Excluding Inert Tokens to Mitigate Hallucination

LVLMs中的词汇劫持:通过排除惰性标记来揭示关键注意力头以缓解幻觉

Yangneng Chen, Junlin Li, Weijun Yao, Xilai Ma, Guodong Du, Wenya Wang, Jing Li

机构 * Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) Huawei Technologies Co., Ltd.(华为技术有限公司) The Hong Kong Polytechnic University(香港理工大学) Nanyang Technological University(南洋理工大学)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV

AI总结 本文通过分析LVLMs的注意力机制,揭示了词汇劫持现象,提出HABI方法定位惰性标记,并引入NHAR指标评估其影响,最终提出HAVAE方法增强关键注意力头以减少幻觉。

Comments Accepted by ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09549 2026-05-12 cs.LG 57%

When Adaptation Fails: A Gradient-Based Diagnosis of Collapsed Gating in Vision-Language Prompt Learning

当适应失效:基于梯度的Collapsed Gating在视觉-语言提示学习中的诊断

Yunxuan Fang, Ziwei Zhang, Xinhe Wang

机构 * Beihang University(北航大学)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.LG

AI总结 本文研究了在冻结少样本提示学习中,适应性门控和提示选择模块失效的问题,通过实验发现梯度不平衡和门控退化是主要失效模式,揭示了参数高效学习中适配门控的有效条件。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.16234 2026-05-12 cs.LG 57%

Sequential Causal Discovery with Noisy Language Model Priors

具有噪声语言模型先验的顺序因果发现

Prakhar Verma, David Arbour, Sunav Choudhary, Harshita Chopra, Arno Solin, Atanu R. Sinha

机构 * ELLIS Institute Finland and Aalto University(芬兰ELLIS研究所和阿尔托大学) Adobe Research(Adobe研究) University of Washington, Seattle(华盛顿大学(西雅图))

专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.LG

AI总结 本文提出一种混合框架,通过适应性整合顺序批次数据与噪声专家知识,提升因果发现的准确性,并扩展到参数估计,展示了对语言模型噪声的鲁棒性。

Comments 32 pages, Transactions on Machine Learning Research - TMLR (04/2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09185 2026-05-12 cs.CE 50%

AutoRedTrader: Autonomous Red Teaming of Trading Agents through Synthetic Misinformation Injection

AutoRedTrader: 通过合成虚假信息注入实现交易代理的自主红队测试

Zhiwei Liu, Yangyang Yu, Yupeng Cao, Yuechen Jiang, Haohang Li, Zhuoran Lu, Yuyan Wang, Yixiang Zheng, Xiaorui Guo, Calvin Yixiang Cheng, Sophia Ananiadou

专题命中 幻觉与鲁棒性 :grounding(abstract)

AI总结 本文提出AutoRedTrader框架,通过行为偏差操控、微小文本扰动和重写策略生成金融领域虚假信息,评估其对交易代理的影响及历史市场证据的稳定性。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03677 2026-05-12 cs.CL 50%

Instruction Anchor: Dissecting the Mechanistic Dynamics of Modality Arbitration

指令锚点:解构模态仲裁的机理动态

Yu Zhang, Mufan Xu, Xuefeng Bai, Kehai Chen, Pengfei Zhang, Yang Xiang, Min Zhang

机构 * Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学(深圳)) Peng Cheng Laboratory, Shenzhen, China(鹏城实验室)

专题命中 幻觉与鲁棒性 :multimodal large language model(abstract)

AI总结 本文通过信息流视角研究模态跟随机制,揭示指令令牌作为模态仲裁的结构锚点,浅层注意力层负责多模态信息聚合,深层注意力层则根据指令意图选择性强化子空间,实验验证了注意力头的特定功能。

Comments Modality Following

详情

展开后加载摘要…

URL PDF HTML 收藏