arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 2242 信号源:cs.CV, cs.AI, cs.LG

1. 幻觉与鲁棒性 2242 篇

2509.12492 2025-09-17 cs.CV 85%

Evaluating Robustness of Vision-Language Models Under Noisy Conditions

Purushoth, Alireza

机构 * University of Nevada Reno(内华达大学拉斯维加斯分校)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);LLaVA(abstract);visual question answering(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.19794 2025-06-12 cs.CV 85%

MVTamperBench: Evaluating Robustness of Vision-Language Models

Amit Agarwal, Srikant Panda, Angeline Charles, Bhargava Kumar, Hitesh Patel, Priyaranjan Pattnayak, Taki Hasan Rafi, Tejaswini Kumar, Hansa Meghwani, Karan Gupta, Dong-Kyu Chae

机构 * Liverpool John Moores University(利物浦约翰·穆里斯大学) Birla Institute of Technology(比拉理工学院) Christ University(基督大学) Columbia University(哥伦比亚大学) New York University(纽约大学) University of Washington(华盛顿大学) Hanyang University(翰阳大学)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.09446 2025-04-09 cs.CV 85%

Double Visual Defense: Adversarial Pre-training and Instruction Tuning for Improving Vision-Language Model Robustness

Zeyu Wang, Cihang Xie, Brian Bartoldson, Bhavya Kailkhura

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);LLaVA(abstract);visual question answering(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.18930 2025-04-03 cs.CV 85%

Hallucination of Multimodal Large Language Models: A Survey

Zechen Bai, Pichao Wang, Tianjun Xiao, Tong He, Zongbo Han, Zheng Zhang, Mike Zheng Shou

专题命中 幻觉与鲁棒性 :multimodal large language model(title,abstract);vision-language model(abstract);MLLM(abstract);分类 cs.CV

Comments 228 references

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.17544 2024-12-24 cs.AI 85%

Retention Score: Quantifying Jailbreak Risks for Vision Language Models

Zaitang Li, Pin-Yu Chen, Tsung-Yi Ho

专题命中 幻觉与鲁棒性 :vision language model(title);vision-language model(abstract);VLM(abstract);LLaVA(abstract)

Comments 14 pages, 8 figures, AAAI 2025

Journal ref AAAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.15256 2024-09-24 cs.CL cs.AI 85%

Behavioral Bias of Vision-Language Models: A Behavioral Finance View

Yuhang Xiao, Yudi Lin, Ming-Chang Chiu

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);VLM(abstract);LLaVA(abstract);分类 cs.AI

Comments ICML 2024 Workshop on Large Language Models and Cognition

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.10433 2024-08-21 cs.CV 85%

CLIP-DPO: Vision-Language Models as a Source of Preference for Fixing Hallucinations in LVLMs

Yassine Ouali, Adrian Bulat, Brais Martinez, Georgios Tzimiropoulos

专题命中 幻觉与鲁棒性 :vision-language model(title);vision language model(abstract);LLaVA(abstract);grounding(abstract)

Comments Accepted at ECCV 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18325 2026-07-22 cs.CV cs.AI cs.RO 新提交 85%

Hazard or Anomaly? Evaluating VLMs for Understanding Dangers and Discrepancies

危险还是异常?评估用于理解危险和差异的视觉语言模型

Murali Indukuri, Mohammad Eskandari, Sree Nitya Kollu, Stephanie Lukin, Cynthia Matuszek

机构 * Interactive Robotics and Language Lab, University of Maryland Baltimore County(马里兰大学巴尔的摩县分校交互式机器人与语言实验室) DEVCOM Army Research Laboratory(陆军研究实验室)

专题命中 幻觉与鲁棒性 :VLM(summary_cn,abstract);vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 研究针对现代安全关键系统中VLM的评估问题,通过明确区分危险和异常,在两个数据集及多种提示策略下评估多个先进VLM,发现其常误判,明确区分能提供更具信息性评估并揭示失败模式。

Comments 8 pages, accepted to RO-MAN 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09544 2026-07-13 cs.CV cs.LG 新提交 85%

The Count Is There, but Misaligned: Understanding and Correcting Counting Failures in VLMs

计数存在但未对齐:理解和纠正视觉语言模型中的计数失败

Ahmed Oumar El-Shangiti, Abzal Nurgazy, Hilal AlQuabeh, Nikolai Rozanov, Kentaro Inui

机构 * MBZUAI(穆罕默德·本·扎耶德人工智能大学) Imperial College London(伦敦帝国学院)

专题命中 幻觉与鲁棒性 :VLM(summary_cn,abstract);vision-language model(abstract);分类 cs.CV、cs.LG

AI总结 研究视觉语言模型计数失败问题,通过对VLM激活进行探测训练及分析,发现其虽常编码正确计数但输出错误,提出探测器引导的自校正方法,在不更新参数时提高计数准确率,揭示内部知识与模型输出差距并提供改进工具。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15623 2026-06-24 cs.LG cs.AI 新提交 85%

Surprise-Guided MergeSort: Budget-Efficient Human-in-the-Loop Ranking via Adaptive Comparison Scheduling

惊喜引导的归并排序:通过自适应比较调度实现预算高效的人机协同排名

Yujin Park, Haejun Chung, Ikbeom Jang

机构 * Hanyang University(汉阳大学) Hankuk University of Foreign Studies(韩国外国语大学)

专题命中 幻觉与鲁棒性 :VLM(summary_cn,abstract);vision-language model(abstract);分类 cs.AI、cs.LG

AI总结 提出惊喜引导的归并排序(SGS)框架,利用视觉语言模型(VLM)作为问题优先级排序器,通过自适应预算分配将高模糊度比较路由给人类,在六个基准上以相同预算实现Kendall's τ×100提升6-12点。

Comments After submission, we discovered significant issues in the reference and citation information used in the manuscript. Because these issues affect the integrity of the scholarly record and require substantial revision and verification, we request withdrawal of the current submission. A corrected version may be submitted in the future after a comprehensive review

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19683 2026-07-23 cs.CR 新提交 85%

GhostPrompt: Cross-Image Adversarial Prompt for Vision-Language Models

GhostPrompt:视觉语言模型的跨图像对抗性提示

Li Zeng, Zeyu Ye, Meng Xie, Hangtao Zhang, Xianlong Wang, Yanchun Li, Zhetao Li

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);VLM(abstract,abstract_cn)

AI总结 研究视觉语言模型对抗攻击问题,提出GhostPrompt方法,通过联合优化提炼图像不变对抗特征,跨图像引导模型输出,相比现有基线攻击成功率显著提高且计算时间大幅减少。

Comments Accepted to ACM MM 2026. Code: this https://github.com/Ye-ze-yu/GhostPrompt

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10269 2026-07-14 cs.CR 新提交 85%

Devil in the Lens: Analyzing and Defending Physical Prompt Injection Against Vision-Language Models on Wearable Devices

镜头中的恶魔:分析并防御可穿戴设备上针对视觉语言模型的物理提示注入

Yaxin Li, Hao Wang, Yanda Shao, Shuhao Zhang, Yan Long

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);VLM(abstract,abstract_cn)

AI总结 研究针对可穿戴设备上视觉语言模型的物理提示注入攻击,利用真实环境照片分析出6种威胁向量及对12个模型的影响,攻击成功率高,还提出基于掩码的外部过滤器和基于语义向量的内部检测器两种防御策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25629 2026-06-26 cs.RO eess.SP 新提交 85%

Event-Adaptive Motion Planning with Distilled Vision-Language Model in Safety-Critical Situations

安全关键场景下基于蒸馏视觉语言模型的事件自适应运动规划

Zhenwei Huang, Changsheng You, Shuai Wang, Chao Zhou, Wei Xu, Yi Gong

机构 * Southern University of Science and Technology(南方科技大学) Shenzhen Institute of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院) Manifold Tech Limited(曼孚科技股份有限公司)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);VLM(abstract,abstract_cn)

AI总结 提出事件自适应运动规划(EAMP)框架,通过可配置语义事件触发器、蒸馏视觉语言模型和语义模型预测控制,在安全关键场景中实现高层推理与底层控制的协同,提升动态安全裕度并保持实时性。

Comments 8 pages, 8 figures, 4 tables. Accepted by IROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.09250 2026-06-15 cs.CV cs.AI cs.LG 版本更新 85%

MirrorCheck: Efficient Adversarial Defense for Vision-Language Models

MirrorCheck: 视觉-语言模型的高效对抗防御

Samar Fares, Klea Ziu, Toluwani Aremu, Nikita Durasov, Martin Takáč, Pascal Fua, Ivan Laptev, Karthik Nandakumar

机构 * Mohamed Bin Zayed University of Artificial Intelligence(莫扎伊德大学人工智能大学) NVIDIA École Polytechnique Fédérale de Lausanne(洛桑联邦理工学院) Michigan State University(密歇根州立大学)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);VLM(abstract_cn);分类 cs.CV、cs.AI、cs.LG

AI总结 提出MirrorCheck框架,利用文本到图像模型和随机化策略检测并防御针对视觉-语言模型的自适应对抗攻击。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22768 2026-06-05 cs.CL 85%

Seeing is Believing? Evaluating Vision-Language Model Susceptibility in Agent-to-Agent Multimodal Persuasion

见多识广?评估面向Agent-to-Agent多模态说服的视觉语言模型易受性

Haoyi Qiu, Yilun Zhou, Pranav Narayanan Venkit, Kung-Hsiang Huang, Jiaxin Zhang, Nanyun Peng, Chien-Sheng Wu

机构 * University of California, Los Angeles(加州大学洛杉矶分校) Salesforce AI Research(Salesforce AI研究)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);VLM(abstract,abstract_cn)

AI总结 本文研究了在多智能体多模态说服场景中,视觉语言模型对多模态内容的易受性,提出了MMPersuade框架和数据集,通过实验揭示了多模态输入在说服中的优势,以及说服对象的领域和格式依赖性,以及心理策略在不同上下文和模型架构下的效果差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10408 2026-05-19 cs.SE cs.RO 85%

VISOR: A Vision-Language Model-based Test Oracle for Testing Robots

VISOR:基于视觉-语言模型的机器人测试 oracle

Prasun Saurabh, Pablo Valle, Aitor Arrieta, Shaukat Ali, Paolo Arcaini

机构 * Simula Research Laboratory(Simula研究实验室) Oslo Metropolitan University(奥斯陆理工大学) Mondragon University(蒙dragon大学) National Institute of Informatics(国立信息研究所)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);VLM(abstract,abstract_cn)

AI总结 VISOR 提出基于视觉-语言模型的自动化测试 oracle 方法,解决机器人测试中任务正确性评估难题,通过两个模型在多个任务上验证,展现高召回率和高精确度,但不确定性与正确性相关性低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12430 2026-04-27 cs.CL 85%

System-Mediated Attention Imbalances Make Vision-Language Models Say Yes

系统介导的注意力失衡使视觉-语言模型倾向于说‘是’

Tsan Tsai Chan, Varsha Suresh, Anisha Saha, Michael Hahn, Vera Demberg

机构 * Saarland Informatics Campus, Saarland University, Germany(萨尔兰州信息学校区,萨尔兰州大学,德国) Max Planck Institute for Informatics, Germany(马克斯·普朗克信息研究所,德国)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);VLM(abstract,abstract_cn)

AI总结 本文研究了视觉-语言模型中系统介导的注意力失衡对‘是’偏见的影响,提出通过重新分配注意力以减少这种偏见,从而提升模型可靠性。

Comments Accepted to ACL Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19509 2026-04-22 cs.RO cs.MA 85%

Assessing VLM-Driven Semantic-Affordance Inference for Non-Humanoid Robot Morphologies

评估基于视觉语言模型的非人形机器人语义可及性推理

Jess Jones, Raul Santos-Rodriguez, Sabine Hauert

机构 * Bristol Robotics Laboratory, University of Bristol(布里斯托尔机器人实验室,布里斯托尔大学) University of Bristol(布里斯托尔大学)

专题命中 幻觉与鲁棒性 :VLM(title,abstract);vision-language model(abstract)

AI总结 本文研究了视觉语言模型在非人形机器人上的语义可及性推理能力,通过混合数据集分析发现模型在不同物体和机器人形态上表现不一,存在保守预测倾向,需结合其他方法以提高性能。

Comments AAMAS 2026 (main track), 9 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11671 2026-04-16 eess.SP cs.RO 85%

VLMaterial: Vision-Language Model-Based Camera-Radar Fusion for Physics-Grounded Material Identification

VLMaterial: 基于视觉-语言模型的相机-雷达融合用于物理基础的材料识别

Jiangyou Zhu, He Chen

机构 * Department of Inforation Engineering(信息工程系)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);VLM(abstract,abstract_cn)

AI总结 本文提出VLMaterial框架,通过融合视觉语言模型与雷达知识实现物理基础的材料识别,采用双管道架构和上下文增强生成策略,提升跨模态融合性能,实验表明其在120余次真实实验中达到96.08%的识别准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.15048 2026-03-09 cs.CV cs.AI cs.LG cs.MM 85%

Make VLM Recognize Visual Hallucination on Cartoon Character Image with Pose Information

使VLM在卡通角色图像上通过姿态信息识别视觉幻觉

Bumsoo Kim, Wonseop Shin, Kyuchul Lee, Yonghoon Jung, Sanghyun Seo

机构 * Chung-Ang University(Chung-Ang 大学) Coupang(韩国Coupang)

专题命中 幻觉与鲁棒性 :VLM(title,abstract);vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 本文提出基于姿态信息的VLM幻觉检测方法,通过上下文学习提升识别准确率,实验表明在卡通角色图像中幻觉检测效果提升50%-80%。

Comments Accepted at WACV 2025, Project page: https://gh-bumsookim.github.io/Cartoon-Hallucinations-Detection/. (Fixed typos)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.24195 2026-03-02 cs.AI cs.CL cs.CV cs.LG 85%

Uncertainty Quantification for Multimodal Large Language Models with Incoherence-adjusted Semantic Volume

多模态大语言模型的不确定性量化:基于不一致性调整的语义体积

Gregory Kang Ruey Lau, Hieu Dao, Nicole Kan Hui Lin, Bryan Kian Hsiang Low

机构 * Department of Computer Science, National University of Singapore(新加坡国立大学计算机科学系)

专题命中 幻觉与鲁棒性 :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 UMPIRE是一种无需训练的多模态大语言模型不确定性量化框架,通过内部特征有效捕捉语义多样性和响应不一致性,提升错误检测和不确定性校准性能。

Comments Earlier versions presented at ICLR 2025 QUESTION workshop and ICML 2025 R2-FM workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01747 2026-01-23 cs.CR cs.AI cs.CV cs.LG 85%

Crafting Adversarial Inputs for Large Vision-Language Models Using Black-Box Optimization

为大型视觉-语言模型设计对抗输入使用黑盒优化

Jiwei Guan, Haibo Jin, Haohan Wang

机构 * School of Computing, Macquarie University(麦考瑞大学计算机学院) School of Information Sciences, University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校信息科学学院)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);LLaVA(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 本文提出了一种基于零阶优化的黑盒劫持攻击方法,针对大型视觉-语言模型实现高成功率的对抗性攻击,揭示了当前模型安全机制的不足。

Comments EACL

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.19579 2025-09-17 cs.RO cs.AI cs.CL cs.CV cs.LG 85%

Evaluating the Robustness of Open-Source Vision-Language Models to Domain Shift in Object Captioning

Federico Tavella, Amber Drinkwater, Angelo Cangelosi

机构 * Centre for Robotic Autonomy in Demanding and Long-lasting Environments(机器人自主性在恶劣和持久环境中的研究中心) Centre for Robotics and AI(机器人与人工智能中心) University of Manchester(曼彻斯特大学) Amentum Clean Energy Ltd(Amentum清洁能源有限公司)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.14908 2025-07-18 cs.CV cs.AI cs.CL cs.LG 85%

SegSub: Evaluating Robustness to Knowledge Conflicts and Hallucinations in Vision-Language Models

Peter Carragher, Nikitha Rao, Abhinand Jha, R Raghav, Kathleen M. Carley

专题命中 幻觉与鲁棒性 :vision-language model(title);vision language model(abstract);VLM(abstract);分类 cs.CV、cs.AI、cs.LG

Journal ref MisD 2025: 1st Workshop on Misinformation Detection in the Era of LLMs

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.15734 2025-06-23 cs.AI cs.CL cs.CR cs.CV cs.LG 85%

The Safety Reminder: A Soft Prompt to Reactivate Delayed Safety Awareness in Vision-Language Models

Peiyuan Tang, Haojie Xin, Xiaodong Zhang, Jun Sun, Qin Xia, Zijiang Yang

机构 * School of Computer Science and Technology, Xi’an Jiaotong University(西安交通大学计算机科学与技术学院) School of Computer Science and Technology, University of Science and Technology of China(中国科学技术大学计算机科学与技术学院) School of Computing and Information Systems, Singapore Management University(新加坡管理学院计算与信息系统学院)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV、cs.AI、cs.LG

Comments 23 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05429 2025-06-09 cs.CV cs.AI cs.CL cs.LG 85%

Coordinated Robustness Evaluation Framework for Vision-Language Models

Ashwin Ramesh Babu, Sajad Mousavi, Vineet Gundecha, Sahand Ghorbanpour, Avisek Naug, Antonio Guillen, Ricardo Luna Gutierrez, Soumyendu Sarkar

机构 * Hewlett Packard Enterprise (Hewlett Packard Labs)(惠普企业公司(惠普实验室))

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);visual reasoning(abstract);分类 cs.CV、cs.AI、cs.LG

Comments Accepted: IEEE/CVF Conference on Computer Vision and Pattern Recognition Workshops (CVPRW) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.15211 2024-12-17 cs.CL cs.AI cs.CR cs.CV cs.LG 85%

Failures to Find Transferable Image Jailbreaks Between Vision-Language Models

Rylan Schaeffer, Dan Valentine, Luke Bailey, James Chua, Cristóbal Eyzaguirre, Zane Durante, Joe Benton, Brando Miranda, Henry Sleight, John Hughes, Rajashree Agrawal, Mrinank Sharma, Scott Emmons, Sanmi Koyejo, Ethan Perez

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV、cs.AI、cs.LG

Comments NeurIPS 2024 Workshops: RBFM (Best Paper), Frontiers in AdvML (Oral), Red Teaming GenAI (Oral), SoLaR (Spotlight), SATA

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.11242 2024-10-16 cs.CV cs.AI cs.LG 85%

Automatically Generating Visual Hallucination Test Cases for Multimodal Large Language Models

Zhongye Liu, Hongbin Liu, Yuepeng Hu, Zedian Shao, Neil Zhenqiang Gong

专题命中 幻觉与鲁棒性 :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.CV、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.15300 2024-04-24 cs.CV cs.AI cs.CL cs.LG cs.MM 85%

Seeing is Believing: Mitigating Hallucination in Large Vision-Language Models via CLIP-Guided Decoding

Ailin Deng, Zhirui Chen, Bryan Hooi

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);grounding(abstract);分类 cs.CV、cs.AI、cs.LG

Comments Code URL: https://github.com/d-ailin/CLIP-Guided-Decoding

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24440 2026-07-28 cs.CV cs.CL cs.LG 新提交 84%

Bigger or Cheaper? Scale and Quantization Effects on Uncertainty Signals in Vision-Language Models Under Image Degradation

更大还是更便宜?图像退化下视觉语言模型中尺度和量化对不确定性信号的影响

M M Asif Ferdous

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);VLM(abstract_cn,comments);分类 cs.CV、cs.LG

AI总结 研究在图像退化下视觉语言模型中尺度和量化对不确定性信号的影响,通过对Qwen2-VL系列模型的实验发现,尺度提升内部不确定性信号,4位量化对准确性影响小但对置信信号影响大,建议固定内存预算下选更大量化模型,如7B-4bit。

Comments 12 pages, 4 figures. Code and data: https://github.com/Asif-Ferdous/vlm-scale-quant

详情

展开后加载摘要…

URL PDF HTML 收藏