arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 2242 信号源:cs.CV, cs.AI, cs.LG

1. 幻觉与鲁棒性 2242 篇

2512.23453 2025-12-30 cs.CV cs.AI 84%

CoFi-Dec: Hallucination-Resistant Decoding via Coarse-to-Fine Generative Feedback in Large Vision-Language Models

CoFi-Dec:通过粗到细的生成反馈在大视觉-语言模型中实现抗幻觉解码

Zongsheng Cao, Yangfan He, Anran Liu, Jun Xie, Feng Chen, Zepeng Wang

机构 * Researcher(研究者)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);grounding(abstract);分类 cs.CV、cs.AI

AI总结 CoFi-Dec通过粗到细的生成反馈机制,在大视觉-语言模型中减少幻觉,提升解码的鲁棒性和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23109 2025-12-30 cs.LG cs.AI stat.ML 84%

How Much Data Is Enough? Uniform Convergence Bounds for Generative & Vision-Language Models under Low-Dimensional Structure

需要多少数据?在低维结构下生成式与视觉-语言模型的统一收敛界限

Paul M. Thompson

机构 * Stevens Institute for Neuroimaging and Informatics, University of Southern California(神经影像与信息学研究所,南加州大学)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);VLM(abstract);分类 cs.AI、cs.LG

AI总结 研究在低维结构下生成式和视觉-语言模型的统一收敛界限,探讨数据量与模型校准之间的关系。

Comments 13 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18264 2025-12-23 cs.CV cs.AI cs.CR 84%

Who Can See Through You? Adversarial Shielding Against VLM-Based Attribute Inference Attacks

谁能穿透你?基于VLM的属性推断攻击的对抗防护

Yucheng Fan, Jiawei Chen, Yu Tian, Zhaoxia Yin

机构 * East China Normal University(东华大学) Zhongguancun Academy(中关村学院) Dept. of Comp. Sci. and Tech., Institute for AI, Tsinghua University(计算机科学与技术系,人工智能研究院,清华大学)

专题命中 幻觉与鲁棒性 :VLM(title,abstract);vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出了一种基于视觉一致性约束的隐私保护方法,通过VPI-COCO基准验证,有效降低隐私泄露风险并保持视觉一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09441 2025-12-11 cs.CV cs.AI 84%

Representation Calibration and Uncertainty Guidance for Class-Incremental Learning based on Vision Language Model

基于视觉语言模型的类增量学习中的表示校准与不确定性引导

Jiantao Tan, Peixian Ma, Tong Yu, Wentao Zhang, Ruixuan Wang

机构 * Guangdong Province Key Laboratory of Machine Intelligence and Advanced Computing, Ministry of Education(广东省机器智能与先进计算重点实验室) Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) Peng Cheng Laboratory(鹏城实验室) Key Laboratory of Machine Intelligence and Advanced Computing, Ministry of Education(广东省机器智能与先进计算重点实验室)

专题命中 幻觉与鲁棒性 :vision language model(title);vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI

AI总结 本文提出了一种基于视觉语言模型的类增量学习框架,通过引入任务特定适配器和跨任务表示校准策略,提升类别区分能力,并利用预测不确定性优化图像特征选择,实现更准确的分类性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04704 2025-11-26 cs.CV cs.AI 84%

HoliSafe: Holistic Safety Benchmarking and Modeling for Vision-Language Model

HoliSafe: 视觉-语言模型的综合安全性评估与建模

Youngwan Lee, Kangsan Kim, Kwanyong Park, Ilcahe Jung, Soojin Jang, Seanie Lee, Yong-Ju Lee, Sung Ju Hwang

机构 * ETRI KAIST AI(韩国科学技术院人工智能研究所) University of Seoul(首尔大学)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV、cs.AI

AI总结 HoliSafe提出了一种模块化框架和视觉守护模块,通过综合安全性数据集提升视觉-语言模型的安全性,展现其在多个基准中的优越表现。

Comments Project page: https://youngwanlee.github.io/holisafe

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23928 2025-11-21 cs.LG cs.AI 84%

HiViS: Hiding Visual Tokens from the Drafter for Speculative Decoding in Vision-Language Models

HiViS: 为视觉语言模型中的推测解码隐藏视觉标记

Zhinan Xie, Peisong Wang, Shuang Qiu, Jian Cheng

机构 * C 2 DL, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) AIRIA City University of Hong Kong(香港城市大学)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);VLM(abstract);分类 cs.AI、cs.LG

AI总结 HiViS通过隐藏视觉标记,提升视觉语言模型在推测解码中的生成效率和速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.11050 2025-11-18 cs.CV cs.AI 84%

RAC3: Retrieval-Augmented Corner Case Comprehension for Autonomous Driving with Vision-Language Models

Yujin Wang, Quanfeng Liu, Jiaqi Fan, Jinlong Hong, Hongqing Chu, Mengjian Tian, Bingzhao Gao, Hong Chen

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);grounding(abstract);分类 cs.CV、cs.AI

Comments Accepted by IEEE Transactions on Multimedia

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22045 2025-10-28 cs.CV cs.AI 84%

VLM-SlideEval: Evaluating VLMs on Structured Comprehension and Perturbation Sensitivity in PPT

Hyeonsu Kang, Emily Bao, Anjan Goswami

专题命中 幻觉与鲁棒性 :VLM(title,abstract);vision-language model(abstract);分类 cs.CV、cs.AI

Comments 39th Conference on Neural Information Processing Systems (NeurIPS 2025) Workshop: Evaluating the Evolving LLM Lifecycle - Benchmarks, Emergent Abilities, and Scaling

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15367 2025-09-30 cs.CV cs.AI cs.CL 84%

Better Safe Than Sorry? Overreaction Problem of Vision Language Models in Visual Emergency Recognition

Dasol Choi, Seunghyun Lee, Youngsook Song

机构 * AIM Intelligence(AIM智能公司) Yonsei University(延世大学) Lablup Inc.(Lablup公司)

专题命中 幻觉与鲁棒性 :vision language model(title);vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20196 2025-09-25 cs.CV cs.LG 84%

Universal Camouflage Attack on Vision-Language Models for Autonomous Driving

Dehong Kong, Sifan Yu, Siyuan Liang, Jiawei Liang, Jianhou Gan, Aishan Liu, Wenqi Ren

机构 * School of Cyber Science and Technology, SUN YAT-SEN UNIVERSITY(中山大学计算机科学与技术学院) School of Computing, National University of Singapore(新加坡国立大学计算机学院) Key Laboratory of Education Informatization for Nationalities, Yunnan Normal University(云南师范大学民族教育信息化重点实验室) SCSE, Beihang University(北航软件学院)

专题命中 幻觉与鲁棒性 :vision-language model(title);VLM(abstract);visual language model(abstract);分类 cs.CV、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.13255 2025-09-24 cs.CL cs.AI cs.IR cs.LG cs.MM 84%

Automating Steering for Safe Multimodal Large Language Models

Lyucheng Wu, Mengru Wang, Ziwen Xu, Tri Cao, Nay Oo, Bryan Hooi, Shumin Deng

机构 * Zhejiang University(浙江大学) Zhejiang University - Ant Group Joint Lab of Knowledge Graph(浙江大学-蚂蚁集团知识图谱联合实验室) National University of Singapore, NUS-NCS Joint Lab(新加坡国立大学NUS-NCS联合实验室)

专题命中 幻觉与鲁棒性 :multimodal large language model(title,abstract);LLaVA(abstract);分类 cs.AI、cs.LG

Comments EMNLP 2025 Main Conference. 23 pages (8+ for main); 25 figures; 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.17265 2025-09-23 cs.LG cs.AI 84%

SUA: Stealthy Multimodal Large Language Model Unlearning Attack

Xianren Zhang, Hui Liu, Delvin Ce Zhang, Xianfeng Tang, Qi He, Dongwon Lee, Suhang Wang

机构 * The Pennsylvania State University(宾夕法尼亚州立大学) Amazon(亚马逊) University of Sheffield(谢菲尔德大学)

专题命中 幻觉与鲁棒性 :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.AI、cs.LG

Comments EMNLP25

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16163 2025-09-22 cs.CV cs.AI cs.CL 84%

Robust Vision-Language Models via Tensor Decomposition: A Defense Against Adversarial Attacks

Het Patel, Muzammil Allie, Qian Zhang, Jia Chen, Evangelos E. Papalexakis

机构 * University of California, Riverside(加州大学河滨分校)

专题命中 幻觉与鲁棒性 :vision-language model(title);vision language model(abstract);VLM(abstract);分类 cs.CV、cs.AI

Comments To be presented as a poster at the Workshop on Safe and Trustworthy Multimodal AI Systems (SafeMM-AI), 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11262 2025-08-18 cs.CV cs.AI 84%

Vision-Language Models display a strong gender bias

Aiswarya Konavoor, Raj Abhijit Dandekar, Rajat Dandekar, Sreedath Panat

机构 * Togo AI Labs(Togo人工智能实验室) Vizuara AI Labs(Vizuara人工智能实验室)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.06869 2025-08-15 cs.CV cs.LG 84%

CapeLLM: Support-Free Category-Agnostic Pose Estimation with Multimodal Large Language Models

Junho Kim, Hyungjin Chung, Byung-Hoon Kim

机构 * EverEx Yonsei University(延世大学)

专题命中 幻觉与鲁棒性 :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.CV、cs.LG

Comments ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.19925 2025-08-14 cs.CL cs.CV cs.LG 84%

Improving Multimodal Large Language Models Using Continual Learning

Shikhar Srivastava, Md Yousuf Harun, Robik Shrestha, Christopher Kanan

机构 * University of Rochester(罗切斯特大学) Rochester Institute of Technology(罗切斯特理工学院)

专题命中 幻觉与鲁棒性 :multimodal large language model(title);LLaVA(abstract);MLLM(abstract);分类 cs.CV、cs.LG

Comments CoLLAs 2025 and Scalable Continual Learning for Lifelong Foundation Models, NeurIPS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.05273 2025-08-07 cs.RO cs.AI cs.LG 84%

Real-World Offline Reinforcement Learning from Vision Language Model Feedback

Sreyas Venkataraman, Yufei Wang, Ziyu Wang, Navin Sriram Ravie, Zackory Erickson, David Held

机构 * Indian Institute of Technology, Kharagpur(印度理工学院,克哈格浦尔分校) IIIS, Tsinghua University(清华大学人工智能研究所) Robotics Institute, Carnegie Mellon University(卡内基梅隆大学机器人研究所)

专题命中 幻觉与鲁棒性 :vision language model(title);vision-language model(abstract);VLM(abstract);分类 cs.AI、cs.LG

Comments 7 pages. Accepted at the LangRob Workshop 2024 @ CoRL, 2024. Accepted at 2025 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01678 2025-08-05 cs.CV cs.AI 84%

Cure or Poison? Embedding Instructions Visually Alters Hallucination in Vision-Language Models

Zhaochen Wang, Yiwei Wang, Yujun Cai

机构 * The University of Queensland(昆士兰大学) University of California, Merced(加州大学默塞德分校)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);LLaVA(abstract);分类 cs.CV、cs.AI

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.23298 2025-07-22 eess.IV cs.AI cs.CV 84%

Exposing and Mitigating Calibration Biases and Demographic Unfairness in MLLM Few-Shot In-Context Learning for Medical Image Classification

Xing Shen, Justin Szeto, Mingyang Li, Hengguan Huang, Tal Arbel

机构 * Centre for Intelligent Machines, McGill University, Montreal, Canada(智能机器中心,麦吉尔大学,加拿大) Mila -- Quebec AI Institute, Montreal, Canada(魁北克人工智能研究所) Stanford University, Stanford, USA(斯坦福大学) University of Copenhagen, Copenhagen, Denmark(哥本哈根大学)

专题命中 幻觉与鲁棒性 :MLLM(title,abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI

Comments Preprint version. The peer-reviewed version of this paper has been accepted to MICCAI 2025 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.00052 2025-07-02 cs.CV cs.AI 84%

VSF-Med:A Vulnerability Scoring Framework for Medical Vision-Language Models

Binesh Sadanandan, Vahid Behzadan

机构 * SAIL Lab, University of New Haven, West Haven, CT, USA(SAIL实验室,新罕布什尔大学,西哈文,康涅狄格州,美国)

专题命中 幻觉与鲁棒性 :vision-language model(title);vision language model(abstract);VLM(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.19513 2025-06-25 cs.CV cs.LG 84%

Visual hallucination detection in large vision-language models via evidential conflict

Tao Huang, Zhekun Liu, Rui Wang, Yang Zhang, Liping Jing

机构 * Beijing Key Lab of Traffic Data Mining(北京交通数据挖掘与具身智能重点实验室) State Key Laboratory of Advanced Rail Autonomous Operation(先进轨道交通自主运行国家重点实验室) School of Computer Science and Technology(计算机科学与技术学院) Beijing Jiaotong University(北京交通大学) School of Automation and Intelligence(自动化与智能学院) School of Electronic and Information Engineering(电子与信息工程学院)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);LLaVA(abstract);分类 cs.CV、cs.LG

Journal ref International Journal of Approximate Reasoning, Volume 186, November 2025, Article 109507

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.07001 2025-06-24 cs.CV cs.LG 84%

Hallucination-Aware Multimodal Benchmark for Gastrointestinal Image Analysis with Large Vision-Language Models

Bidur Khanal, Sandesh Pokhrel, Sanjay Bhandari, Ramesh Rana, Nikesh Shrestha, Ram Bahadur Gurung, Cristian Linte, Angus Watson, Yash Raj Shrestha, Binod Bhattarai

机构 * Rochester Institute of Technology, Rochester, NY, USA(罗切斯特技术学院) Nepal Applied Mathematics and Informatics Institute for Research (NAAMII)(尼泊尔应用数学与信息技术研究所) Kathmandu University(加德满都大学) University of Lausanne(洛桑大学) University of Aberdeen(阿伯丁大学)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV、cs.LG

Comments Accepted at MICCAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.13123 2025-05-20 cs.CV cs.AI 84%

Low-hallucination Synthetic Captions for Large-Scale Vision-Language Model Pre-training

Xinsong Zhang, Yarong Zeng, Xinting Huang, Hu Hu, Runquan Xie, Han Hu, Zhanhui Kang

机构 * Tencent(腾讯)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.17671 2025-05-16 cs.CL cs.AI cs.LG 84%

Data-Driven Calibration of Prediction Sets in Large Vision-Language Models Based on Inductive Conformal Prediction

Yuanchang Ye, Weiyan Wen

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);visual question answering(abstract);分类 cs.AI、cs.LG

Comments Accepted by ICIPCA 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.16721 2025-05-05 cs.CV cs.AI 84%

Steering Away from Harm: An Adaptive Approach to Defending Vision Language Model Against Jailbreaks

Han Wang, Gang Wang, Huan Zhang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 幻觉与鲁棒性 :vision language model(title,abstract);VLM(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.00192 2025-04-08 cs.CV cs.CL cs.CY cs.LG 84%

MLLM-as-a-Judge for Image Safety without Human Labeling

Zhenting Wang, Shuming Hu, Shiyu Zhao, Xiaowen Lin, Felix Juefei-Xu, Zhuowei Li, Ligong Han, Harihar Subramanyam, Li Chen, Jianfa Chen, Nan Jiang, Lingjuan Lyu, Shiqing Ma, Dimitris N. Metaxas, Ankit Jain

专题命中 幻觉与鲁棒性 :MLLM(title,abstract);multimodal large language model(abstract);分类 cs.CV、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.01735 2025-04-03 cs.CV cs.AI 84%

AdPO: Enhancing the Adversarial Robustness of Large Vision-Language Models with Preference Optimization

Chaohu Liu, Tianyi Gui, Yu Liu, Linli Xu

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);LLaVA(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.17415 2025-03-25 cs.CV cs.AI cs.IR 84%

Enhancing Subsequent Video Retrieval via Vision-Language Models (VLMs)

Yicheng Duan, Xi Huang, Duo Chen

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10872 2025-03-25 cs.CV cs.AI 84%

TAIJI: Textual Anchoring for Immunizing Jailbreak Images in Vision Language Models

Xiangyu Yin, Yi Qi, Jinwei Hu, Zhen Chen, Yi Dong, Xingyu Zhao, Xiaowei Huang, Wenjie Ruan

专题命中 幻觉与鲁棒性 :vision language model(title,abstract);VLM(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.16585 2025-03-24 cs.CL cs.CV cs.DC cs.LG 84%

Distributed LLMs and Multimodal Large Language Models: A Survey on Advances, Challenges, and Future Directions

Hadi Amini, Md Jueal Mia, Yasaman Saadati, Ahmed Imteaj, Seyedsina Nabavirazavi, Urmish Thakker, Md Zarif Hossain, Awal Ahmed Fime, S. S. Iyengar

专题命中 幻觉与鲁棒性 :multimodal large language model(title);vision language model(abstract);MLLM(abstract);分类 cs.CV、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏