arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 2251 信号源:cs.CV, cs.AI, cs.LG

1. 幻觉与鲁棒性 2251 篇

2505.08971 2025-05-15 cs.CV cs.CL cs.LG 62%

Prioritizing Image-Related Tokens Enhances Vision-Language Pre-Training

Yangyi Chen, Hao Peng, Tong Zhang, Heng Ji

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV、cs.LG

Comments The code will be available at https://github.com/Yangyi-Chen/PRIOR

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.09456 2025-04-15 cs.AI cs.CV 62%

Don't Deceive Me: Mitigating Gaslighting through Attention Reallocation in LMMs

Pengkun Jiao, Bin Zhu, Jingjing Chen, Chong-Wah Ngo, Yu-Gang Jiang

专题命中 幻觉与鲁棒性 :LLaVA(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.09195 2025-04-15 cs.CV cs.AI 62%

ReferGPT: Towards Zero-Shot Referring Multi-Object Tracking

Tzoulio Chamiti, Leandro Di Bella, Adrian Munteanu, Nikos Deligiannis

专题命中 幻觉与鲁棒性 :MLLM(abstract);分类 cs.CV、cs.AI

Comments Accepted CVPR 2025 Workshop on Distillation of Foundation Models for Autonomous Driving

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.08974 2025-04-15 cs.AI cs.CV 62%

Mixed Signals: Decoding VLMs' Reasoning and Underlying Bias in Vision-Language Conflict

Pouya Pezeshkpour, Moin Aminnaseri, Estevam Hruschka

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.22233 2025-04-01 cs.CV cs.AI cs.IR 62%

ContextIQ: A Multimodal Expert-Based Video Retrieval System for Contextual Advertising

Ashutosh Chaubey, Anoubhav Agarwaal, Sartaki Sinha Roy, Aayush Agrawal, Susmita Ghose

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV、cs.AI

Comments Published at WACV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.08923 2025-03-27 cs.CV cs.LG 62%

Aligning Visual Contrastive learning models via Preference Optimization

Amirabbas Afzali, Borna Khodabandeh, Ali Rasekh, Mahyar JafariNodeh, Sepehr kazemi, Simon Gottschalk

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.19900 2025-03-26 cs.CV cs.AI cs.CL 62%

CAFe: Unifying Representation and Generation with Contrastive-Autoregressive Finetuning

Hao Yu, Zhuokai Zhao, Shen Yan, Lukasz Korycki, Jianyu Wang, Baosheng He, Jiayi Liu, Lizhu Zhang, Xiangjun Fan, Hanchao Yu

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.06608 2025-03-25 cs.LG cs.AI cs.CR 62%

MF-CLIP: Leveraging CLIP as Surrogate Models for No-box Adversarial Attacks

Jiaming Zhang, Lingyu Qiu, Qi Yi, Yige Li, Jitao Sang, Changsheng Xu, Dit-Yan Yeung

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.17871 2025-03-25 cs.CV cs.AI 62%

good4cir: Generating Detailed Synthetic Captions for Composed Image Retrieval

Pranavi Kolouju, Eric Xing, Robert Pless, Nathan Jacobs, Abby Stylianou

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.16873 2025-03-24 cs.CV cs.AI 62%

Classifier-guided CLIP Distillation for Unsupervised Multi-label Classification

Dongseob Kim, Hyunjung Shim

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV、cs.AI

Comments CVPR 2025 Accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06486 2025-03-11 cs.CV cs.AI 62%

PerturboLLaVA: Reducing Multimodal Hallucinations with Perturbative Visual Training

Cong Chen, Mingyu Liu, Chenchen Jing, Yizhou Zhou, Fengyun Rao, Hao Chen, Bo Zhang, Chunhua Shen

专题命中 幻觉与鲁棒性 :multimodal large language model(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.00361 2025-03-04 cs.CV cs.AI 62%

Octopus: Alleviating Hallucination via Dynamic Contrastive Decoding

Wei Suo, Lijun Zhang, Mengyang Sun, Lin Yuanbo Wu, Peng Wang, Yanning Zhang

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.11665 2025-03-04 cs.CL cs.AI cs.CV 62%

See It from My Perspective: How Language Affects Cultural Bias in Image Understanding

Amith Ananthram, Elias Stengel-Eskin, Mohit Bansal, Kathleen McKeown

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV、cs.AI

Comments Accepted at ICLR 2025. 22 pages, 6 figures. Code/models: https://github.com/amith-ananthram/see-it-from-my-perspective

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.16602 2025-02-25 cs.CV cs.AI 62%

VidLBEval: Benchmarking and Mitigating Language Bias in Video-Involved LVLMs

Yiming Yang, Yangyang Guo, Hui Lu, Yan Wang

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.15079 2025-02-24 cs.CV cs.AI cs.CL 62%

Can Hallucination Correction Improve Video-Language Alignment?

Lingjun Zhao, Mingyang Xie, Paola Cascante-Bonilla, Hal Daumé, Kwonjoon Lee

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.11701 2025-02-24 cs.CL cs.AI cs.CV cs.MM 62%

Magnifier Prompt: Tackling Multimodal Hallucination via Extremely Simple Instructions

Yuhan Fu, Ruobing Xie, Jiazhen Liu, Bangxiang Lan, Xingwu Sun, Zhanhui Kang, Xirong Li

专题命中 幻觉与鲁棒性 :multimodal large language model(abstract);分类 cs.CV、cs.AI

Comments The proposed method does not work for up-to-date MLLMs.

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.13095 2025-02-19 cs.CV cs.CL cs.LG 62%

Understanding and Rectifying Safety Perception Distortion in VLMs

Xiaohan Zou, Jian Kang, George Kesidis, Lu Lin

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.14394 2025-02-13 cs.AI cs.CL cs.CV 62%

A Multimodal Automated Interpretability Agent

Tamar Rott Shaham, Sarah Schwettmann, Franklin Wang, Achyuta Rajaram, Evan Hernandez, Jacob Andreas, Antonio Torralba

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV、cs.AI

Comments 25 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.06529 2025-02-12 cs.AI cs.CL cs.LG 62%

Introspective Planning: Aligning Robots' Uncertainty with Inherent Task Ambiguity

Kaiqu Liang, Zixu Zhang, Jaime Fernández Fisac

专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.AI、cs.LG

Comments NeurIPS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.18676 2025-02-11 cs.RO cs.AI cs.LG 62%

Embodied Red Teaming for Auditing Robotic Foundation Models

Sathwik Karnik, Zhang-Wei Hong, Nishant Abhangi, Yen-Chen Lin, Tsun-Hsuan Wang, Christophe Dupuy, Rahul Gupta, Pulkit Agrawal

专题命中 幻觉与鲁棒性 :vision language model(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.04470 2025-02-10 cs.CV cs.AI 62%

Color in Visual-Language Models: CLIP deficiencies

Guillem Arias, Ramon Baldrich, Maria Vanrell

专题命中 幻觉与鲁棒性 :visual language model(abstract);分类 cs.CV、cs.AI

Comments 6 pages, 10 figures, conference, Artificial Intelligence

Journal ref in Color and Imaging Conference, 2024, pp 101 - 106

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.03973 2025-02-04 cs.CV cs.LG 62%

A comparison between humans and AI at recognizing objects in unusual poses

Netta Ollikka, Amro Abbas, Andrea Perin, Markku Kilpeläinen, Stéphane Deny

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV、cs.LG

Comments version accepted at TMLR

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.09718 2025-01-14 cs.CV cs.LG 62%

BayesAdapter: enhanced uncertainty estimation in CLIP few-shot adaptation

Pablo Morales-Álvarez, Stergios Christodoulidis, Maria Vakalopoulou, Pablo Piantanida, Jose Dolz

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV、cs.LG

Comments 30 pages, 5 figures, 23 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.03995 2025-01-08 cs.LG cs.CV cs.IR cs.IT math.IT 62%

RAG-Check: Evaluating Multimodal Retrieval Augmented Generation Performance

Matin Mortaheb, Mohammad A. Amir Khojastepour, Srimat T. Chakradhar, Sennur Ulukus

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.15631 2025-01-07 cs.LG cs.AI 62%

Data Augmentation for Sparse Multidimensional Learning Performance Data Using Generative AI

Liang Zhang, Jionghao Lin, John Sabatini, Conrad Borchers, Daniel Weitekamp, Meng Cao, John Hollander, Xiangen Hu, Arthur C. Graesser

专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.10727 2024-12-23 cs.CV cs.AI 62%

RoCOCO: Robustness Benchmark of MS-COCO to Stress-test Image-Text Matching Models

Seulki Park, Daeho Um, Hajung Yoon, Sanghyuk Chun, Sangdoo Yun, Jin Young Choi

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV、cs.AI

Comments Accepted to ECCV Synthetic Data for Computer Vision Workshop (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.02803 2024-12-05 cs.CV cs.AI eess.IV 62%

Gaussian Splatting Under Attack: Investigating Adversarial Noise in 3D Objects

Abdurrahman Zeybey, Mehmet Ergezer, Tommy Nguyen

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV、cs.AI

Comments Accepted to Safe Generative AI Workshop @ NeurIPS 2024: https://neurips.cc/virtual/2024/workshop/84705

Journal ref Safe Generative AI Workshop @ NeurIPS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.09968 2024-11-18 cs.CV cs.AI 62%

Seeing Clearly by Layer Two: Enhancing Attention Heads to Alleviate Hallucination in LVLMs

Xiaofeng Zhang, Yihao Quan, Chaochen Gu, Chen Shen, Xiaosong Yuan, Shaotian Yan, Hao Cheng, Kaijie Wu, Jieping Ye

专题命中 幻觉与鲁棒性 :multimodal large language model(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.11497 2024-11-05 cs.CV cs.LG stat.ML 62%

A Sober Look at the Robustness of CLIPs to Spurious Features

Qizhou Wang, Yong Lin, Yongqiang Chen, Ludwig Schmidt, Bo Han, Tong Zhang

专题命中 幻觉与鲁棒性 :vision language model(abstract);分类 cs.CV、cs.LG

Comments NeurIPS 2024; Qizhou Wang, Yong Lin, and Yongqiang Chen contributed equally; Project page: https://counteranimal.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.07241 2024-11-05 cs.CV cs.LG 62%

Calibrating Multi-modal Representations: A Pursuit of Group Robustness without Annotations

Chenyu You, Yifei Min, Weicheng Dai, Jasjeet S. Sekhon, Lawrence Staib, James S. Duncan

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV、cs.LG

Comments Accepted by CVPR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏