arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 2242 信号源:cs.CV, cs.AI, cs.LG

1. 幻觉与鲁棒性 2242 篇

2602.00559 2026-02-03 cs.CV cs.AI 81%

Learning to Decode Against Compositional Hallucination in Video Multimodal Large Language Models

在视频多模态大语言模型中学习对抗组合性幻觉

Wenbin Xing, Quanxing Zha, Lizheng Zu, Mengran Li, Ming Li, Junchi Yan

机构 * Sun Yat-sen University(中山大学) Huaqiao University(华侨大学) Shenzhen University(深圳大学) Guangming Laboratory(光明实验室) Shanghai Jiao Tong University(上海交通大学)

专题命中 幻觉与鲁棒性 :multimodal large language model(title,abstract);分类 cs.CV、cs.AI

AI总结 针对视频多模态大语言模型中的组合性幻觉问题,提出TriCD框架,通过对比解码和三路径校准机制提升模型在对抗幻觉时的准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11325 2026-02-03 cs.CV cs.AI 81%

Robust MLLM Unlearning via Visual Knowledge Distillation

通过视觉知识蒸馏实现鲁棒的多模态大语言模型去学习

Yuhang Wang, Zhenxing Niu, Haoxuan Ji, Guangyu He, Haichang Gao, Gang Hua

机构 * Xidian University, China(西安电子科技大学) XJTU University, China(西安交通大学) Amazon.com, USA(亚马逊公司)

专题命中 幻觉与鲁棒性 :MLLM(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出通过视觉知识蒸馏实现多模态大语言模型的鲁棒去学习,有效保留文本知识并提升效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.12706 2026-02-03 cs.CV cs.AI 81%

NAP-Tuning: Neural Augmented Prompt Tuning for Adversarially Robust Vision-Language Models

NAP-Tuning: 用于对抗鲁棒视觉-语言模型的神经增强提示微调

Jiaming Zhang, Xin Wang, Xingjun Ma, Lingyu Qiu, Yu-Gang Jiang, Jitao Sang

机构 * School of Computer Science and Technology, Beijing Jiaotong University(北京交通大学计算机科学与技术学院) Shanghai Key Lab of Intell. Info. Processing, School of CS, Fudan University(复旦大学计算机学院智能信息处理重点实验室) Department of Mathematics and Applications, University of Naples Federico II(那不勒斯费德里克二世大学应用数学系) State Key Laboratory of Advanced Rail Autonomous Operation, Beijing Jiaotong University(北京交通大学先进轨道交通自主运行国家重点实验室)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV、cs.AI

AI总结 NAP-Tuning通过神经增强框架提升视觉-语言模型的对抗鲁棒性,实现多模态提示微调和特征净化,显著提升模型在对抗攻击下的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00420 2026-02-03 cs.CV cs.AI cs.CR 81%

Text is All You Need for Vision-Language Model Jailbreaking

文本就是视觉-语言模型劫持所需

Yihang Chen, Zhao Xu, Youyuan Jiang, Tianle Zheng, Cho-Jui Hsieh

机构 * University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV、cs.AI

AI总结 Text-DJ通过将文本转换为图像并诱导干扰,成功绕过视觉-语言模型的安全防护,揭示了OCR能力在面对分散多模态输入时的脆弱性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00247 2026-02-03 cs.CV cs.LG 81%

CAPA: Contribution-Aware Pruning and FFN Approximation for Efficient Large Vision-Language Models

CAPA:面向高效大视觉-语言模型的贡献感知剪枝与FFN近似

Samyak Jha, Junho Kim

机构 * Indian Institute of Technology (ISM) Dhanbad, India(印度理工学院(ISM)达翰巴德分校) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV、cs.LG

AI总结 CAPA通过贡献感知剪枝和FFN近似,提升大视觉-语言模型的效率与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.01256 2026-01-29 cs.CV cs.LG 81%

NLPrompt: Noise-Label Prompt Learning for Vision-Language Models

NLPrompt: 噪声标签提示学习用于视觉-语言模型

Bikang Pan, Qun Li, Xiaoying Tang, Wei Huang, Zhen Fang, Feng Liu, Jingya Wang, Jingyi Yu, Ye Shi

机构 * ShanghaiTech University(上海科技大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) RIKEN Center for Advanced Intelligence Project(日本RIKEN高级智能项目中心) University of Technology Sydney(悉尼科技大学) University of Melbourne(墨尔本大学)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV、cs.LG

AI总结 NLPrompt通过结合PromptMAE和PromptOT,提升视觉-语言模型在噪声标签下的提示学习鲁棒性与精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15698 2026-01-23 cs.CV cs.AI 81%

Beyond Visual Safety: Jailbreaking Multimodal Large Language Models for Harmful Image Generation via Semantic-Agnostic Inputs

超越视觉安全:通过语义无关输入对多模态大语言模型进行有害图像生成的劫持

Mingyu Yu, Lana Liu, Zhehao Zhao, Wei Wang, Sujuan Qin

机构 * State Key Laboratory of Networking and Switching Technology, Beijing University of Posts and Telecommunications(网络与交换技术国家重点实验室,北京邮电大学) School of Cyberspace Security, Beijing University of Posts and Telecommunications(网络安全学院,北京邮电大学)

专题命中 幻觉与鲁棒性 :multimodal large language model(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出BVS框架,通过语义无关输入对多模态大语言模型进行有害图像生成的劫持,揭示其视觉安全边界的脆弱性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13238 2026-01-21 cs.CV cs.AI 81%

A Semantic Decoupling-Based Two-Stage Rainy-Day Attack for Revealing Weather Robustness Deficiencies in Vision-Language Models

基于语义解耦的两阶段雨天攻击:揭示视觉-语言模型在天气鲁棒性方面的缺陷

Chengyin Hu, Xiang Chen, Zhe Jia, Weiwen Shi, Fengyu Zhang, Jiujiang Guo, Yiwei Wei

机构 * Chengyin Hu(独立研究者) Xiang Chen(独立研究者) Zhe Jia(独立研究者) Weiwen Shi(独立研究者) Fengyu Zhang(独立研究者) Jiujiang Guo(独立研究者) Yiwei Wei(独立研究者)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出了一种基于语义解耦的两阶段雨天攻击框架,揭示了视觉-语言模型在天气鲁棒性方面的缺陷。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12443 2026-01-21 cs.CV cs.AI 81%

Adversarial Defense in Vision-Language Models: An Overview

视觉-语言模型中的对抗防御:概述

Xiaowei Fu, Lei Zhang

机构 * School of Microelectronics and Communication Engineering(微电子与通信工程学院) Chongqing University(重庆大学) Chongqing, China(中国重庆)

专题命中 幻觉与鲁棒性 :vision-language model(title);vision language model(abstract);分类 cs.CV、cs.AI

AI总结 本文综述了视觉-语言模型对抗防御的最新进展,探讨了三种主要防御范式及其优缺点,旨在提升模型的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08860 2026-01-15 cs.CV cs.AI 81%

Bias Detection and Rotation-Robustness Mitigation in Vision-Language Models and Generative Image Models

视觉-语言模型和生成图像模型中的偏见检测与旋转鲁棒性缓解

Tarannum Mithila

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出旋转鲁棒缓解策略,通过数据增强、表征对齐和模型正则化,提升视觉-语言和生成图像模型在旋转和分布偏移下的鲁棒性和公平性。

Comments Preprint. This work is derived from the author's Master's research. Code and supplementary materials will be released separately

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.11742 2026-01-13 cs.CV cs.AI 81%

Safe Vision-Language Models via Unsafe Weights Manipulation

通过不安全权重操作实现安全的视觉-语言模型

Moreno D'Incà, Elia Peruzzo, Xingqian Xu, Humphrey Shi, Nicu Sebe, Massimiliano Mancini

机构 * University of Trento(特伦托大学) NVIDIA(NVIDIA公司) Georgia Tech(佐治亚理工学院)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出UWM方法,通过不训练的方式提升视觉-语言模型在不安全查询上的安全性,同时在安全输入上表现更优。

Comments WACV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03500 2026-01-08 cs.CV cs.AI 81%

SDCD: Structure-Disrupted Contrastive Decoding for Mitigating Hallucinations in Large Vision-Language Models

SDCD: 结构破坏对比解码用于缓解大视觉-语言模型中的幻觉

Yuxuan Xia, Siheng Wang, Peng Li

机构 * University of California, Santa Barbara(加州大学圣巴巴拉分校)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV、cs.AI

AI总结 SDCD通过结构破坏对比解码缓解大视觉-语言模型中的幻觉问题,有效抑制纹理驱动偏见,提升多模态能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.04833 2026-01-07 cs.CV cs.AI cs.CL 81%

E$^2$AT: Multimodal Jailbreak Defense via Dynamic Joint Optimization for Multimodal Large Language Models

E$^2$AT: 通过动态联合优化实现多模态对抗防御

Liming Lu, Xiang Gu, Shuchao Pang, Siyuan Liang, Haotian Zhu, Xiyu Zeng, Xu Zheng, Yongbin Zhou

机构 * School of Cyber Science and Engineering, Nanjing University of Science and Technology, China(南京理工大学信息科学与工程学院) HKUST(GZ) and INSAIT, Sofia University St. Kliment Ohridski(香港科技大学(广州)及INSAIT,索菲亚大学圣克莱门特·奥赫里迪斯学院) College of Computing and Data Science, Nanyang Technological University, Singapore(南洋理工大学计算与数据科学学院)

专题命中 幻觉与鲁棒性 :multimodal large language model(title,abstract);分类 cs.CV、cs.AI

AI总结 E$^2$AT通过动态联合优化提升多模态大语言模型对对抗攻击的鲁棒性,实验显示其在文本和图像模态上性能优于现有方法34%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.18376 2026-01-07 cs.LG cs.CV 81%

Empowering Source-Free Domain Adaptation via MLLM-Guided Reliability-Based Curriculum Learning

通过MLLM引导的可靠性基于课程学习增强源无关领域适应

Dongjie Chen, Kartik Patwari, Zhengfeng Lai, Xiaoguang Zhu, Sen-ching Cheung, Chen-Nee Chuah

机构 * University of California, Davis(加州大学戴维斯分校) University of Kentucky(肯塔基大学)

专题命中 幻觉与鲁棒性 :MLLM(title);multimodal large language model(abstract);分类 cs.CV、cs.LG

AI总结 通过MLLM引导的可靠性基于课程学习增强源无关领域适应,提出一种新的框架,利用多个冻结的MLLMs的稳健监督蒸馏到目标模型,实现稳定且噪声感知的训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18411 2025-12-23 cs.CV cs.AI 81%

AmPLe: Supporting Vision-Language Models via Adaptive-Debiased Ensemble Multi-Prompt Learning

AmPLe: 通过自适应去偏集成多提示学习支持视觉-语言模型

Fei Song, Yi Li, Jiangmeng Li, Rui Wang, Changwen Zheng, Fanjiang Xu, Hui Xiong

机构 * National Key Laboratory of Space Integrated Information System, Institute of Software, Chinese Academy of Sciences(中国科学院空间信息集成系统国家重点实验室,软件研究所) University of Chinese Academy of Sciences(中国科学院大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV、cs.AI

AI总结 AmPLe通过自适应去偏集成多提示学习方法,解决模型-提示匹配偏差和样本-提示匹配偏差,提升视觉-语言模型在下游任务中的性能。

Comments Accepted by IJCV2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.14862 2025-12-22 cs.LG cs.CL cs.CV 81%

LatentExplainer: Explaining Latent Representations in Deep Generative Models with Multimodal Large Language Models

LatentExplainer: 通过多模态大语言模型解释深度生成模型中的潜在表示

Mengdan Zhu, Raasikh Kanjiani, Jiahui Lu, Andrew Choi, Qirui Ye, Liang Zhao

机构 * Emory University(埃默里大学) University College London(伦敦大学学院)

专题命中 幻觉与鲁棒性 :multimodal large language model(title,abstract);分类 cs.CV、cs.LG

AI总结 LatentExplainer通过多模态大语言模型为深度生成模型的潜在变量生成语义解释,提升模型可解释性。

Comments Accepted to CIKM 2025 Full Research Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11296 2025-12-15 cs.CV cs.AI cs.HC 81%

Few-Shot VLM-Based G-Code and HMI Verification in CNC Machining

少样本基于视觉语言模型的CNC加工G代码和人机界面验证

Yasaman Hashem Pour, Nazanin Mahjourian, Vinh Nguyen

机构 * Department of Mechanical and Aerospace Engineering, Michigan Technological University(机械与航空航天工程系,密歇根技术大学)

专题命中 幻觉与鲁棒性 :VLM(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出基于视觉语言模型的少样本方法,用于验证CNC加工中G代码与人机界面的错误和安全状态。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03209 2025-12-09 cs.CV cs.AI 81%

GeoShield: Safeguarding Geolocation Privacy from Vision-Language Models via Adversarial Perturbations

GeoShield: 通过对抗扰动保护视觉语言模型中的地理隐私

Xinwei Liu, Xiaojun Jia, Yuan Xun, Simeng Qin, Xiaochun Cao

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV、cs.AI

AI总结 GeoShield通过对抗扰动有效保护视觉语言模型中的地理隐私,提出三个核心模块实现稳健的隐私防护。

Comments AAAI2026 Poster

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16295 2025-12-03 cs.CV cs.AI 81%

OpenLVLM-MIA: A Controlled Benchmark Revealing the Limits of Membership Inference Attacks on Large Vision-Language Models

OpenLVLM-MIA:一个揭示大型视觉-语言模型上成员推断攻击局限性的受控基准

Ryoto Miyamoto, Xin Fan, Fuyuko Kido, Tsuneo Matsumoto, Hayato Yamana

机构 * Waseda University(早稻田大学) Hitotsubashi University(立命馆大学)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV、cs.AI

AI总结 OpenLVLM-MIA通过受控基准揭示大型视觉-语言模型上成员推断攻击的局限性,表明现有方法性能接近随机水平,为隐私保护技术发展提供基础。

Comments WACV2026 Accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12897 2025-11-26 cs.CV cs.AI 81%

Cross-Layer Vision Smoothing: Enhancing Visual Understanding via Sustained Focus on Key Objects in Large Vision-Language Models

跨层视觉平滑:通过持续聚焦关键对象增强大视觉-语言模型的视觉理解

Jianfei Zhao, Feng Zhang, Xin Sun, Chong Feng, Zhixing Tan

机构 * Beijing Institute of Technology(北京理工大学) Zhongguancun Academy(中关村学院) Tsinghua University(清华大学)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出CLVS方法,通过跨层视觉记忆平滑注意力分布,提升大视觉-语言模型对关键对象的持续聚焦能力,从而增强视觉理解性能。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.04470 2025-11-21 cs.CV cs.AI 81%

DiffuSyn Bench: Evaluating Vision-Language Models on Real-World Complexities with Diffusion-Generated Synthetic Benchmarks

DiffuSyn Bench: 评估视觉-语言模型在现实世界复杂性中的能力,通过扩散生成的合成基准

Haokun Zhou, Yipeng Hong

机构 * Imperial College London(伦敦帝国理工学院) Shanghai University(上海大学)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV、cs.AI

AI总结 DiffuSyn Bench通过扩散生成的合成基准评估视觉-语言模型在现实世界复杂性中的能力,揭示其区分AI与人类图像的性能及局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.07463 2025-11-19 cs.RO cs.AI cs.CV 81%

DepthVision: Enabling Robust Vision-Language Models with GAN-Based LiDAR-to-RGB Synthesis for Autonomous Driving

Sven Kirchner, Nils Purschke, Ross Greer, Alois C. Knoll

机构 * Chair of Robotics, Artificial Intelligence and Real-time Systems, Technical University of Munich(机器人学、人工智能与实时系统教授会,慕尼黑技术大学) Computer Science and Engineering Department, University of California Merced(计算机科学与工程系,加州大学默塞德分校)

专题命中 幻觉与鲁棒性 :vision-language model(title);VLM(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06496 2025-11-11 cs.RO cs.AI cs.CV 81%

A Low-Rank Method for Vision Language Model Hallucination Mitigation in Autonomous Driving

Keke Long, Jiacheng Guo, Tianyun Zhang, Hongkai Yu, Xiaopeng Li

专题命中 幻觉与鲁棒性 :vision language model(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.07409 2025-11-04 cs.CV cs.LG 81%

MGPATH: Vision-Language Model with Multi-Granular Prompt Learning for Few-Shot WSI Classification

Anh-Tien Nguyen, Duy Minh Ho Nguyen, Nghiem Tuong Diep, Trung Quoc Nguyen, Nhat Ho, Jacqueline Michelle Metsch, Miriam Cindy Maurer, Daniel Sonntag, Hanibal Bohnenberger, Anne-Christin Hauschild

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV、cs.LG

Comments Published in Transactions on Machine Learning Research (09/2025)

Journal ref Transactions on Machine Learning Research (09/2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24820 2025-10-30 cs.CV cs.AI 81%

SafeEditor: Unified MLLM for Efficient Post-hoc T2I Safety Editing

Ruiyang Zhang, Jiahao Luo, Xiaoru Feng, Qiufan Pang, Yaodong Yang, Juntao Dai

机构 * PKU Alignment Team, Peking University(北京大学对齐团队) LLM Safety Centre, Beijing Academy of Artificial Intelligence(北京人工智能研究院大语言模型安全中心)

专题命中 幻觉与鲁棒性 :MLLM(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06497 2025-10-30 cs.CV cs.AI 81%

Evaluation of Safety Cognition Capability in Vision-Language Models for Autonomous Driving

Enming Zhang, Peizhe Gong, Xingyuan Dai, Min Huang, Yisheng Lv, Qinghai Miao

机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所多模态人工智能系统国家重点实验室)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02896 2025-10-22 cs.CV cs.LG cs.RO 81%

FlySearch: Exploring how vision-language models explore

Adam Pardyl, Dominik Matuszek, Mateusz Przebieracz, Marek Cygan, Bartosz Zieliński, Maciej Wołczyk

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV、cs.LG

Comments NeurIPS 2025 Datasets and Benchmarks track

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09473 2025-10-20 cs.CV cs.LG 81%

D-TPT: Dimensional Entropy Maximization for Calibrating Test-Time Prompt Tuning in Vision-Language Models

Jisu Han, Wonjun Hwang

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV、cs.LG

Comments Corrected typos

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.03123 2025-10-14 cs.CV cs.CL cs.LG 81%

Investigating VLM Hallucination from a Cognitive Psychology Perspective: A First Step Toward Interpretation with Intriguing Observations

Xiangrui Liu, Man Luo, Agneet Chatterjee, Hua Wei, Chitta Baral, Yezhou Yang

机构 * Arizona State University(亚利桑那州立大学) Intel Lab(英特尔实验室)

专题命中 幻觉与鲁棒性 :VLM(title);vision-language model(abstract);分类 cs.CV、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09253 2025-10-13 cs.CV cs.LG cs.MM 81%

Zero-shot image privacy classification with Vision-Language Models

Alina Elena Baia, Alessio Xompero, Andrea Cavallaro

机构 * Idiap Research Institute(Idiap研究机构) Queen Mary University of London(伦敦女王学院) EPFL(瑞士联邦理工学院)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV、cs.LG

Comments 5 pages, 3 figures, 3 tables. This work has been submitted to the ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏