arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 2242 信号源:cs.CV, cs.AI, cs.LG

1. 幻觉与鲁棒性 2242 篇

2407.02716 2025-01-09 cs.CV cs.LG 81%

Light-weight Fine-tuning Method for Defending Adversarial Noise in Pre-trained Medical Vision-Language Models

Xu Han, Linghao Jin, Xuezhe Ma, Xiaofeng Liu

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.17821 2024-12-17 cs.CV cs.AI 81%

RITUAL: Random Image Transformations as a Universal Anti-hallucination Lever in Large Vision Language Models

Sangmin Woo, Jaehyuk Jang, Donguk Kim, Yubin Choi, Changick Kim

专题命中 幻觉与鲁棒性 :vision language model(title,abstract);分类 cs.CV、cs.AI

Comments Project: https://sangminwoo.github.io/RITUAL/

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.06775 2024-12-10 cs.CV cs.AI cs.CL 81%

Delve into Visual Contrastive Decoding for Hallucination Mitigation of Large Vision-Language Models

Yi-Lun Lee, Yi-Hsuan Tsai, Wei-Chen Chiu

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV、cs.AI

Comments Under review. Project pages: https://github.com/YiLunLee/VCD_Analysis

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.08271 2024-12-02 cs.CV cs.AI 81%

Efficient Prompt Tuning of Large Vision-Language Model for Fine-Grained Ship Classification

Long Lan, Fengxiang Wang, Xiangtao Zheng, Zengmao Wang, Xinwang Liu

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV、cs.AI

Comments It has been accepted by TGRS

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.02712 2024-11-06 cs.CV cs.AI 81%

V-DPO: Mitigating Hallucination in Large Vision Language Models via Vision-Guided Direct Preference Optimization

Yuxi Xie, Guanzhen Li, Xiao Xu, Min-Yen Kan

专题命中 幻觉与鲁棒性 :vision language model(title);vision-language model(abstract);分类 cs.CV、cs.AI

Comments EMNLP 2024 Findings; 9 pages, 6 figures, 5 tables (16 pages, 8 figures, 8 tables including references and appendices)

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.12816 2024-11-06 cs.CV cs.CL cs.LG 81%

Rethinking Misalignment in Vision-Language Model Adaptation from a Causal Perspective

Yanan Zhang, Jiangmeng Li, Lixiang Liu, Wenwen Qiang

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV、cs.LG

Comments Accepted by NeurIPS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.00997 2024-11-05 cs.CV cs.AI cs.CL cs.CY 81%

Identifying Implicit Social Biases in Vision-Language Models

Kimia Hamidieh, Haoran Zhang, Walter Gerych, Thomas Hartvigsen, Marzyeh Ghassemi

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.06007 2024-11-05 cs.LG cs.CL cs.CV cs.CY 81%

CARES: A Comprehensive Benchmark of Trustworthiness in Medical Vision Language Models

Peng Xia, Ze Chen, Juanxi Tian, Yangrui Gong, Ruibo Hou, Yue Xu, Zhenbang Wu, Zhiyuan Fan, Yiyang Zhou, Kangyu Zhu, Wenhao Zheng, Zhaoyang Wang, Xiao Wang, Xuchao Zhang, Chetan Bansal, Marc Niethammer, Junzhou Huang, Hongtu Zhu, Yun Li, Jimeng Sun, Zongyuan Ge, Gang Li, James Zou, Huaxiu Yao

专题命中 幻觉与鲁棒性 :vision language model(title,abstract);分类 cs.CV、cs.LG

Comments NeurIPS 2024 Datasets and Benchmarks Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.06192 2024-11-04 cs.CV cs.AI cs.CL 81%

Multi-Object Hallucination in Vision-Language Models

Xuweiyi Chen, Ziqiao Ma, Xuejun Zhang, Sihan Xu, Shengyi Qian, Jianing Yang, David F. Fouhey, Joyce Chai

专题命中 幻觉与鲁棒性 :vision-language model(title);vision language model(abstract);分类 cs.CV、cs.AI

Comments Accepted to NeurIPS 2024 | Project page: https://multi-object-hallucination.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.21802 2024-10-31 cs.CV cs.AI 81%

Text-Guided Attention is All You Need for Zero-Shot Robustness in Vision-Language Models

Lu Yu, Haiyang Zhang, Changsheng Xu

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV、cs.AI

Comments Accepted by NeurIPS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.14911 2024-10-22 cs.CV cs.AI cs.CL 81%

A Hybrid Defense Strategy for Boosting Adversarial Robustness in Vision-Language Models

Yuhan Liang, Yijun Li, Yumeng Niu, Qianhe Shen, Hangyu Liu

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.17894 2024-10-15 cs.CV cs.AI 81%

White-box Multimodal Jailbreaks Against Large Vision-Language Models

Ruofan Wang, Xingjun Ma, Hanxu Zhou, Chuanjun Ji, Guangnan Ye, Yu-Gang Jiang

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.05076 2024-09-10 cs.CV cs.AI 81%

PIP: Detecting Adversarial Examples in Large Vision-Language Models via Attention Patterns of Irrelevant Probe Questions

Yudong Zhang, Ruobing Xie, Jiansheng Chen, Xingwu Sun, Yu Wang

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV、cs.AI

Comments Accepted by ACM Multimedia 2024 BNI track (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.10529 2024-08-27 cs.CV cs.AI 81%

Safeguarding Vision-Language Models Against Patched Visual Prompt Injectors

Jiachen Sun, Changsheng Wang, Jiongxiao Wang, Yiwei Zhang, Chaowei Xiao

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV、cs.AI

Comments 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.11261 2024-08-20 cs.CV cs.AI 81%

Adversarial Prompt Tuning for Vision-Language Models

Jiaming Zhang, Xingjun Ma, Xin Wang, Lingyu Qiu, Jiaqi Wang, Yu-Gang Jiang, Jitao Sang

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV、cs.AI

Comments ECCV 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.00569 2024-08-06 cs.CV cs.AI cs.CL 81%

Investigating and Mitigating the Multimodal Hallucination Snowballing in Large Vision-Language Models

Weihong Zhong, Xiaocheng Feng, Liang Zhao, Qiming Li, Lei Huang, Yuxuan Gu, Weitao Ma, Yuan Xu, Bing Qin

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV、cs.AI

Comments Accepted to ACL 2024 Main Conference. 21 pages, 20 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.00550 2024-08-02 cs.CV cs.AI cs.CL 81%

Mitigating Multilingual Hallucination in Large Vision-Language Models

Xiaoye Qu, Mingyang Song, Wei Wei, Jianfeng Dong, Yu Cheng

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.06177 2024-07-09 cs.CV cs.AI cs.CL cs.CY 81%

Vision-Language Models under Cultural and Inclusive Considerations

Antonia Karamolegkou, Phillip Rust, Yong Cao, Ruixiang Cui, Anders Søgaard, Daniel Hershcovich

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV、cs.AI

Comments HuCLLM @ ACL 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.02730 2024-07-04 cs.CV cs.AI 81%

MedVH: Towards Systematic Evaluation of Hallucination for Large Vision Language Models in the Medical Context

Zishan Gu, Changchang Yin, Fenglin Liu, Ping Zhang

专题命中 幻觉与鲁棒性 :vision language model(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.07417 2024-06-17 cs.CV cs.LG 81%

An Empirical Study Into What Matters for Calibrating Vision-Language Models

Weijie Tu, Weijian Deng, Dylan Campbell, Stephen Gould, Tom Gedeon

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV、cs.LG

Comments ICML 2024 Camera Ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.20081 2024-06-03 cs.CV cs.AI 81%

NoiseBoost: Alleviating Hallucination with Noise Perturbation for Multimodal Large Language Models

Kai Wu, Boyuan Jiang, Zhengkai Jiang, Qingdong He, Donghao Luo, Shengzhi Wang, Qingwen Liu, Chengjie Wang

专题命中 幻觉与鲁棒性 :multimodal large language model(title,abstract);分类 cs.CV、cs.AI

Comments 14 pages, 5 figures with supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.00253 2024-05-07 cs.CV cs.CL cs.LG 81%

A Survey on Hallucination in Large Vision-Language Models

Hanchao Liu, Wenyuan Xue, Yifei Chen, Dapeng Chen, Xiutian Zhao, Ke Wang, Liping Hou, Rongjun Li, Wei Peng

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.09011 2024-04-16 cs.CV cs.LG 81%

PracticalDG: Perturbation Distillation on Vision-Language Models for Hybrid Domain Generalization

Zining Chen, Weiqiu Wang, Zhicheng Zhao, Fei Su, Aidong Men, Hongying Meng

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV、cs.LG

Comments Accepted to CVPR2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.00825 2024-04-11 cs.CV cs.AI 81%

SocialCounterfactuals: Probing and Mitigating Intersectional Social Biases in Vision-Language Models with Counterfactual Examples

Phillip Howard, Avinash Madasu, Tiep Le, Gustavo Lujan Moreno, Anahita Bhiwandiwalla, Vasudev Lal

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV、cs.AI

Comments Accepted to CVPR 2024. arXiv admin note: text overlap with arXiv:2310.02988

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.00754 2024-03-19 cs.LG cs.CL cs.CV 81%

Analyzing and Mitigating Object Hallucination in Large Vision-Language Models

Yiyang Zhou, Chenhang Cui, Jaehong Yoon, Linjun Zhang, Zhun Deng, Chelsea Finn, Mohit Bansal, Huaxiu Yao

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV、cs.LG

Comments Accepted by ICLR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.06599 2024-02-12 cs.CV cs.AI 81%

On the Out-Of-Distribution Generalization of Multimodal Large Language Models

Xingxuan Zhang, Jiansheng Li, Wenjing Chu, Junjia Hai, Renzhe Xu, Yuqing Yang, Shikai Guan, Jiazheng Xu, Peng Cui

专题命中 幻觉与鲁棒性 :multimodal large language model(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.09861 2024-01-19 cs.CV cs.AI 81%

Temporal Insight Enhancement: Mitigating Temporal Hallucination in Multimodal Large Language Models

Li Sun, Liuan Wang, Jun Sun, Takayuki Okatani

专题命中 幻觉与鲁棒性 :multimodal large language model(title,abstract);分类 cs.CV、cs.AI

Comments 7 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.16922 2023-11-29 cs.CV cs.AI cs.CL 81%

Mitigating Object Hallucinations in Large Vision-Language Models through Visual Contrastive Decoding

Sicong Leng, Hang Zhang, Guanzheng Chen, Xin Li, Shijian Lu, Chunyan Miao, Lidong Bing

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.02080 2023-11-21 cs.CV cs.CL cs.LG 81%

Benchmarking Robustness of Adaptation Methods on Pre-trained Vision-Language Models

Shuo Chen, Jindong Gu, Zhen Han, Yunpu Ma, Philip Torr, Volker Tresp

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV、cs.LG

Comments Accepted at NeurIPS 2023 Datasets and Benchmarks Track; 9 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.02988 2023-10-05 cs.CV cs.AI 81%

Probing Intersectional Biases in Vision-Language Models with Counterfactual Examples

Phillip Howard, Avinash Madasu, Tiep Le, Gustavo Lujan Moreno, Vasudev Lal

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏