arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 2251 信号源:cs.CV, cs.AI, cs.LG

1. 幻觉与鲁棒性 2251 篇

2504.04225 2025-04-08 cs.CV 57%

Resilience of Vision Transformers for Domain Generalisation in the Presence of Out-of-Distribution Noisy Images

Hamza Riaz, Alan F. Smeaton

专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.CV

Comments 31 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.00429 2025-04-02 cs.CV 57%

Unleashing the Power of Pre-trained Encoders for Universal Adversarial Attack Detection

Yinghe Zhang, Chi Liu, Shuai Zhou, Sheng Shen, Peng Gui

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.20673 2025-03-28 cs.CV 57%

Mitigating Low-Level Visual Hallucinations Requires Self-Awareness: Database, Model and Training Strategy

Yinan Sun, Xiongkuo Min, Zicheng Zhang, Yixuan Gao, Yuqin Cao, Guangtao Zhai

专题命中 幻觉与鲁棒性 :multimodal large language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.04713 2025-03-21 cs.CV 57%

Multi-Reward as Condition for Instruction-based Image Editing

Xin Gu, Ming Li, Libo Zhang, Fan Chen, Longyin Wen, Tiejian Luo, Sijie Zhu

专题命中 幻觉与鲁棒性 :vision language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.15092 2025-03-20 cs.CR cs.AI cs.CL 57%

Towards Understanding the Safety Boundaries of DeepSeek Models: Evaluation and Findings

Zonghao Ying, Guangyi Zheng, Yongxin Huang, Deyue Zhang, Wenxin Zhang, Quanchen Zou, Aishan Liu, Xianglong Liu, Dacheng Tao

专题命中 幻觉与鲁棒性 :multimodal large language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.00430 2025-03-18 cs.RO cs.AI 57%

Evaluating Uncertainty-based Failure Detection for Closed-Loop LLM Planners

Zhi Zheng, Qian Feng, Hang Li, Alois Knoll, Jianxiang Feng

专题命中 幻觉与鲁棒性 :multimodal large language model(abstract);分类 cs.AI

Comments Accepted at ICRA 2024 Workshop on Back to the Future: Robot Learning Going Probabilistic. Website: https://sites.google.com/view/konwloop/home

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.08216 2025-03-17 cs.CV 57%

Attention Hijackers: Detect and Disentangle Attention Hijacking in LVLMs for Hallucination Mitigation

Beitao Chen, Xinyu Lyu, Lianli Gao, Jingkuan Song, Heng Tao Shen

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.15658 2025-03-14 cs.RO cs.AI 57%

Long-horizon Embodied Planning with Implicit Logical Inference and Hallucination Mitigation

Siyuan Liu, Jiawei Du, Sicheng Xiang, Zibo Wang, Dingsheng Luo

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.08342 2025-03-13 cs.CV 57%

Attention Reallocation: Towards Zero-cost and Controllable Hallucination Mitigation of MLLMs

Chongjun Tu, Peng Ye, Dongzhan Zhou, Lei Bai, Gang Yu, Tao Chen, Wanli Ouyang

专题命中 幻觉与鲁棒性 :MLLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.00610 2025-03-04 cs.CY cs.AI 57%

Urban Safety Perception Through the Lens of Large Multimodal Models: A Persona-based Approach

Ciro Beneduce, Bruno Lepri, Massimiliano Luca

专题命中 幻觉与鲁棒性 :LLaVA(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.07468 2025-03-04 cs.AI 57%

From Screens to Scenes: A Survey of Embodied AI in Healthcare

Yihao Liu, Xu Cao, Tingting Chen, Yankai Jiang, Junjie You, Minghua Wu, Xiaosong Wang, Mengling Feng, Yaochu Jin, Jintai Chen

专题命中 幻觉与鲁棒性 :multimodal large language model(abstract);分类 cs.AI

Comments 56 pages, 11 figures, manuscript accepted by Information Fusion

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.11451 2025-03-03 cs.CV 57%

CoMT: Chain-of-Medical-Thought Reduces Hallucination in Medical Report Generation

Yue Jiang, Jiawei Chen, Dingkang Yang, Mingcheng Li, Shunli Wang, Tong Wu, Ke Li, Lihua Zhang

专题命中 幻觉与鲁棒性 :visual language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.18654 2025-03-03 cs.CV 57%

Mitigating Object Hallucination in MLLMs via Data-augmented Phrase-level Alignment

Pritam Sarkar, Sayna Ebrahimi, Ali Etemad, Ahmad Beirami, Sercan Ö. Arık, Tomas Pfister

专题命中 幻觉与鲁棒性 :multimodal large language model(abstract);分类 cs.CV

Comments Published in ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.13175 2025-02-26 cs.CR cs.AI cs.RO 57%

Towards Robust and Secure Embodied AI: A Survey on Vulnerabilities and Attacks

Wenpeng Xing, Minghao Li, Mohan Li, Meng Han

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.18849 2025-02-25 cs.CV 57%

Dysca: A Dynamic and Scalable Benchmark for Evaluating Perception Ability of LVLMs

Jie Zhang, Zhongqi Wang, Mengqi Lei, Zheng Yuan, Bei Yan, Shiguang Shan, Xilin Chen

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV

Comments Accepted by ICLR2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11306 2025-02-18 cs.CL cs.LG 57%

Smoothing Out Hallucinations: Mitigating LLM Hallucination with Smoothed Knowledge Distillation

Hieu Nguyen, Zihao He, Shoumik Atul Gandre, Ujjwal Pasupulety, Sharanya Kumari Shivakumar, Kristina Lerman

专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.08142 2025-02-13 cs.AI 57%

Bridging the Safety Gap: A Guardrail Pipeline for Trustworthy LLM Inferences

Shanshan Han, Salman Avestimehr, Chaoyang He

专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.AI

Comments arXiv admin note: text overlap with arXiv:2406.10847

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.04360 2025-02-10 cs.CL cs.CR cs.LG 57%

MARAGE: Transferable Multi-Model Adversarial Attack for Retrieval-Augmented Generation Data Extraction

Xiao Hu, Eric Liu, Weizhou Wang, Xiangyu Guo, David Lie

专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.15264 2025-02-03 cs.CL cs.AI 57%

ReXTrust: A Model for Fine-Grained Hallucination Detection in AI-Generated Radiology Reports

Romain Hardy, Sung Eun Kim, Du Hyun Ro, Pranav Rajpurkar

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.AI

Comments Accepted to AIMedHealth 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.01996 2025-01-09 cs.CV 57%

ViG-Bias: Visually Grounded Bias Discovery and Mitigation

Badr-Eddine Marani, Mohamed Hanini, Nihitha Malayarukil, Stergios Christodoulidis, Maria Vakalopoulou, Enzo Ferrante

专题命中 幻觉与鲁棒性 :vision language model(abstract);分类 cs.CV

Comments ECCV 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.16958 2024-12-24 cs.CV 57%

Breaking Barriers in Physical-World Adversarial Examples: Improving Robustness and Transferability via Robust Feature

Yichen Wang, Yuxuan Chou, Ziqi Zhou, Hangtao Zhang, Wei Wan, Shengshan Hu, Minghui Li

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV

Comments Accepted by AAAI2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.15894 2024-12-23 cs.CV 57%

Craft: Cross-modal Aligned Features Improve Robustness of Prompt Tuning

Jingchen Sun, Rohan Sharma, Vishnu Suresh Lokhande, Changyou Chen

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV

Comments Accepted to WACV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.12793 2024-12-18 cs.CV 57%

CRoF: CLIP-based Robust Few-shot Learning on Noisy Labels

Shizhuo Deng, Bowen Han, Jiaqi Chen, Hao Wang, Dongyue Chen, Tong Jia

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.03411 2024-12-17 cs.LG cs.CL cs.CR 57%

Red Teaming GPT-4V: Are GPT-4V Safe Against Uni/Multi-Modal Jailbreak Attacks?

Shuo Chen, Zhen Han, Bailan He, Zifeng Ding, Wenqian Yu, Philip Torr, Volker Tresp, Jindong Gu

专题命中 幻觉与鲁棒性 :multimodal large language model(abstract);分类 cs.LG

Comments technical report; update code repo link

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.04440 2024-12-06 cs.CV 57%

GenMAC: Compositional Text-to-Video Generation with Multi-Agent Collaboration

Kaiyi Huang, Yukun Huang, Xuefei Ning, Zinan Lin, Yu Wang, Xihui Liu

专题命中 幻觉与鲁棒性 :MLLM(abstract);分类 cs.CV

Comments Project website: https://karine-h.github.io/GenMAC/

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.12058 2024-12-05 cs.AI cs.CL 57%

WellDunn: On the Robustness and Explainability of Language Models and Large Language Models in Identifying Wellness Dimensions

Seyedali Mohammadi, Edward Raff, Jinendra Malekar, Vedant Palit, Francis Ferraro, Manas Gaur

专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.AI

Comments Accepted in BlackboxNLP @ EMNLP 2024

Journal ref Proceedings of the 7th BlackboxNLP Workshop: Analyzing and Interpreting Neural Networks for NLP, pages 364-388, November 2024, Miami, Florida, US. Association for Computational Linguistics

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.06062 2024-11-27 cs.CL cs.CR cs.LG 57%

Practical Membership Inference Attacks against Fine-tuned Large Language Models via Self-prompt Calibration

Wenjie Fu, Huandong Wang, Chen Gao, Guanghua Liu, Yong Li, Tao Jiang

专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.LG

Comments Repo: NeurIPS2024_SPV-MIA" target="_blank" rel="noopener">https://github.com/tsinghua-fib-lab/NeurIPS2024_SPV-MIA

Journal ref The Thirty-eighth Annual Conference on Neural Information Processing Systems (NeurIPS 2024)

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.18054 2024-11-14 eess.IV cs.CV 57%

Leveraging Pre-trained Models for FF-to-FFPE Histopathological Image Translation

Qilai Zhang, Jiawen Li, Peiran Liao, Jiali Hu, Tian Guan, Anjia Han, Yonghong He

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV

Comments Accepted at IEEE BIBM 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.06799 2024-11-13 cs.AI physics.geo-ph 57%

When Geoscience Meets Foundation Models: Towards General Geoscience Artificial Intelligence System

Hao Zhang, Jin-Jian Xu, Hong-Wei Cui, Lin Li, Yaowen Yang, Chao-Sheng Tang, Niklas Boers

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.AI

Comments accpeted by IEEE Geoscience and Remote Sensing Magazine

Journal ref IEEE Geoscience and Remote Sensing Magazine, 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.05357 2024-11-12 cs.CV 57%

Enhancing Visual Classification using Comparative Descriptors

Hankyeol Lee, Gawon Seo, Wonseok Choi, Geunyoung Jung, Kyungwoo Song, Jiyoung Jung

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV

Comments Accepted by WACV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏