arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 2246 信号源:cs.CV, cs.AI, cs.LG

1. 幻觉与鲁棒性 2246 篇

2503.20208 2025-08-12 cs.RO cs.AI cs.LG 73%

Learning Adaptive Dexterous Grasping from Single Demonstrations

Liangzhi Shi, Yulin Liu, Lingqi Zeng, Bo Ai, Zhengdong Hong, Hao Su

机构 * University of California, San Diego(加州大学圣地亚哥分校) Tsinghua University(清华大学) Hillbot

专题命中 幻觉与鲁棒性 :vision-language model(abstract);VLM(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.10435 2025-07-04 cs.CV cs.AI 73%

COEF-VQ: Cost-Efficient Video Quality Understanding through a Cascaded Multimodal LLM Framework

Xin Dong, Sen Jia, Ming Rui Wang, Yan Li, Zhenheng Yang, Bingfeng Deng, Hongyu Xiong

机构 * ByteDance Inc.(字节跳动公司)

专题命中 幻觉与鲁棒性 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.22819 2025-07-01 cs.CV cs.LG 73%

Prompting without Panic: Attribute-aware, Zero-shot, Test-Time Calibration

Ramya Hebbalaguppe, Tamoghno Kandar, Abhinav Nagpal, Chetan Arora

机构 * IIT Delhi(德里印度理工学院) TCS Research Labs(塔塔咨询公司研究实验室)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.LG

Comments 26 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03614 2025-06-06 cs.CV cs.AI cs.CL cs.CR 73%

VLMs Can Aggregate Scattered Training Patches

Zhanhui Zhou, Lingjie Chen, Chao Yang, Chaochao Lu

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17529 2025-05-26 cs.CV cs.AI 73%

Do You Keep an Eye on What I Ask? Mitigating Multimodal Hallucination via Attention-Guided Ensemble Decoding

Yeongjae Cho, Keonwoo Kim, Taebaek Hwang, Sungzoon Cho

机构 * Seoul National University(首尔国立大学) Kim & Chang AI&IT System Center(金·昌AI&IT系统中心) Waddle Corporation(Waddle公司)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);visual question answering(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.19939 2025-05-20 cs.CR cs.AI cs.CL cs.CV 73%

VLSBench: Unveiling Visual Leakage in Multimodal Safety

Xuhao Hu, Dongrui Liu, Hao Li, Xuanjing Huang, Jing Shao

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Fudan University(复旦大学) Beihang University(北京航空航天大学)

专题命中 幻觉与鲁棒性 :LLaVA(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI

Comments ACL2025 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.02240 2025-05-14 cs.CV cs.AI 73%

SCA: Improve Semantic Consistent in Unrestricted Adversarial Attacks via DDPM Inversion

Zihao Pan, Lifeng Chen, Weibin Wu, Yuhang Cao, Zibin Zheng

机构 * School of Software Engineering, Sun Yat-sen University(中山大学软件工程学院) Computer Science, Beijing Jiaotong University(北京交通大学计算机科学)

专题命中 幻觉与鲁棒性 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.11116 2025-04-15 cs.CV cs.AI 73%

PhD: A ChatGPT-Prompted Visual hallucination Evaluation Dataset

Jiazhen Liu, Yuhan Fu, Ruobing Xie, Runquan Xie, Xingwu Sun, Fengzong Lian, Zhanhui Kang, Xirong Li

专题命中 幻觉与鲁棒性 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.AI

Comments Accepted by CVPR 2025, Highlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.08066 2025-04-14 cs.AI cs.CL cs.LG 73%

The AI Scientist-v2: Workshop-Level Automated Scientific Discovery via Agentic Tree Search

Yutaro Yamada, Robert Tjarko Lange, Cong Lu, Shengran Hu, Chris Lu, Jakob Foerster, Jeff Clune, David Ha

专题命中 幻觉与鲁棒性 :vision-language model(abstract);VLM(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.05776 2025-03-11 cs.LG cs.AI 73%

FAA-CLIP: Federated Adversarial Adaptation of CLIP

Yihang Wu, Ahmad Chaddad, Christian Desrosiers, Tareef Daqqaq, Reem Kateb

专题命中 幻觉与鲁棒性 :vision language model(abstract);VLM(abstract);分类 cs.AI、cs.LG

Comments Accepted in IEEE Internet of Things Journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.10011 2025-01-20 cs.CV cs.AI 73%

Mitigating Hallucinations on Object Attributes using Multiview Images and Negative Instructions

Zhijie Tan, Yuzhi Li, Shengwei Meng, Xiang Yuan, Weiping Li, Tong Mo, Bingce Wang, Xu Chu

专题命中 幻觉与鲁棒性 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI

Comments 2025 IEEE International Conference on Acoustics, Speech, and Signal Processing (ICASSP 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.19531 2024-12-30 cs.CV cs.AI 73%

Is Your Text-to-Image Model Robust to Caption Noise?

Weichen Yu, Ziyan Yang, Shanchuan Lin, Qi Zhao, Jianyi Wang, Liangke Gui, Matt Fredrikson, Lu Jiang

专题命中 幻觉与鲁棒性 :vision language model(abstract);VLM(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.06878 2024-12-11 cs.CV cs.LG 73%

SafeWatch: An Efficient Safety-Policy Following Video Guardrail Model with Transparent Explanations

Zhaorun Chen, Francesco Pinto, Minzhou Pan, Bo Li

专题命中 幻觉与鲁棒性 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.LG

Comments 43 pages, 20 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.04640 2024-11-01 cs.RO cs.AI cs.LG 73%

Unpacking Failure Modes of Generative Policies: Runtime Monitoring of Consistency and Progress

Christopher Agia, Rohan Sinha, Jingyun Yang, Zi-ang Cao, Rika Antonova, Marco Pavone, Jeannette Bohg

专题命中 幻觉与鲁棒性 :vision language model(abstract);VLM(abstract);分类 cs.AI、cs.LG

Comments Project page: https://sites.google.com/stanford.edu/sentinel. 35 pages, 9 figures. Accepted to the Conference on Robot Learning (CoRL) 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.18071 2024-10-24 cs.CV cs.AI cs.CL 73%

TP-Eval: Tap Multimodal LLMs' Potential in Evaluation by Customizing Prompts

Yuxuan Xie, Tianhua Li, Wenqi Shao, Kaipeng Zhang

专题命中 幻觉与鲁棒性 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.14869 2024-09-17 cs.CV cs.AI cs.GR 73%

PuzzleAvatar: Assembling 3D Avatars from Personal Albums

Yuliang Xiu, Yufei Ye, Zhen Liu, Dimitrios Tzionas, Michael J. Black

专题命中 幻觉与鲁棒性 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI

Comments Page: https://puzzleavatar.is.tue.mpg.de/, Code: https://github.com/YuliangXiu/PuzzleAvatar, Video: https://youtu.be/0hpXH2tVPk4

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.09127 2024-01-23 cs.CR cs.AI cs.LG 73%

Jailbreaking GPT-4V via Self-Adversarial Attacks with System Prompts

Yuanwei Wu, Xiang Li, Yixin Liu, Pan Zhou, Lichao Sun

专题命中 幻觉与鲁棒性 :multimodal large language model(abstract);MLLM(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.03287 2023-11-08 cs.LG cs.CL cs.CV 73%

Holistic Analysis of Hallucination in GPT-4V(ision): Bias and Interference Challenges

Chenhang Cui, Yiyang Zhou, Xinyu Yang, Shirley Wu, Linjun Zhang, James Zou, Huaxiu Yao

专题命中 幻觉与鲁棒性 :visual language model(abstract);LLaVA(abstract);分类 cs.CV、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.05402 2023-04-13 cs.CV cs.CR cs.LG cs.MM 73%

Boosting Cross-task Transferability of Adversarial Patches with Visual Relations

Tony Ma, Songze Li, Yisong Xiao, Shunchang Liu

专题命中 幻觉与鲁棒性 :visual reasoning(abstract);visual question answering(abstract);分类 cs.CV、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2201.00969 2022-01-05 cs.CV cs.CL cs.LG 73%

Interactive Attention AI to translate low light photos to captions for night scene understanding in women safety

Rajagopal A, Nirmala V, Arun Muthuraj Vedamanickam

专题命中 幻觉与鲁棒性 :vision-language model(abstract);visual question answering(abstract);分类 cs.CV、cs.LG

Comments In Springer Proceedings. International Conference On Big Data, Machine Learning and Applications 2021. http://bigdml.nits.ac.in/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15800 2026-03-18 cs.CV cs.CL cs.CR 72%

Evolving Contextual Safety in Multi-Modal Large Language Models via Inference-Time Self-Reflective Memory

通过推理时的自我反思记忆在多模态大语言模型中实现上下文安全演化

Ce Zhang, Jinxi He, Junyi He, Katia Sycara, Yaqi Xie

机构 * Robotics Institute, Carnegie Mellon University(卡内基梅隆大学机器人研究所)

专题命中 幻觉与鲁棒性 :MLLM(abstract,comments);visual reasoning(abstract);分类 cs.CV

AI总结 本文提出MM-SafetyBench++基准和EchoSafe框架,通过自反思记忆实现多模态大语言模型的上下文安全演化,实验表明其在安全性能上表现优异。

Comments Accepted at CVPR 2026. Project page: https://echosafe-mllm.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23163 2026-05-26 cs.CL 71%

Fast-dDrive: Efficient Block-Diffusion VLM for Autonomous Driving

Fast-dDrive:面向自动驾驶的高效块扩散视觉语言模型

Kewei Zhang, Jin Wang, Sensen Gao, Chengyue Wu, Yulong Cao, Songyang Han, Boris Ivanovic, Langechuan Liu, Marco Pavone, Song Han, Daquan Zhou, Enze Xie

机构 * Peking University(北京大学) NVIDIA The University of Hong Kong(香港大学) MIT(麻省理工学院)

专题命中 幻觉与鲁棒性 :VLM(title)

AI总结 提出Fast-dDrive,一种块扩散视觉语言动作模型,通过语义单元内双向细化与跨单元因果约束,结合结构化令牌冻结、分段感知训练和推测解码,实现高保真轨迹规划与高效推理,在WOD-E2E和nuScenes上达到最优性能,推理速度提升12倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20162 2026-03-23 cs.CL 71%

Evaluating Evidence Grounding Under User Pressure in Instruction-Tuned Language Models

评估在用户压力下指令调优语言模型的证据基础

Sai Koneru, Elphin Joe, Christine Kirchhoff, Jian Wu, Sarah Rajtmajer

机构 * College of Information Sciences and Technology, Pennsylvania State University(宾夕法尼亚州立大学信息科学与技术学院) Department of Computer Science, Old Dominion University(老 Dominion 大学计算机科学系)

专题命中 幻觉与鲁棒性 :grounding(title)

AI总结 研究探讨了在用户压力下指令调优语言模型如何平衡用户对齐压力与上下文证据的忠实性,通过控制的认知冲突框架评估证据一致性准确性及排序表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.00015 2025-10-03 cs.CL 71%

Design and Application of Multimodal Large Language Model Based System for End to End Automation of Accident Dataset Generation

MD Thamed Bin Zaman Chowdhury, Moazzem Hossain

专题命中 幻觉与鲁棒性 :multimodal large language model(title)

Comments This paper is accepted for presentation in TRB annual meeting 2026. The version presented here is the preprint version before peer review process

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.16826 2025-03-24 cs.CL 71%

When Tom Eats Kimchi: Evaluating Cultural Bias of Multimodal Large Language Models in Cultural Mixture Contexts

Jun Seong Kim, Kyaw Ye Thu, Javad Ismayilzada, Junyeong Park, Eunsu Kim, Huzama Ahmad, Na Min An, James Thorne, Alice Oh

专题命中 幻觉与鲁棒性 :multimodal large language model(title)

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11455 2025-02-18 cs.CR 71%

Adversary-Aware DPO: Enhancing Safety Alignment in Vision Language Models via Adversarial Training

Fenghua Weng, Jian Lou, Jun Feng, Minlie Huang, Wenjie Wang

专题命中 幻觉与鲁棒性 :vision language model(title)

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.08317 2024-05-15 cs.CL cs.SD eess.AS 71%

SpeechGuard: Exploring the Adversarial Robustness of Multimodal Large Language Models

Raghuveer Peri, Sai Muralidhar Jayanthi, Srikanth Ronanki, Anshu Bhatia, Karel Mundnich, Saket Dingliwal, Nilaksh Das, Zejiang Hou, Goeric Huybrechts, Srikanth Vishnubhotla, Daniel Garcia-Romero, Sundararajan Srinivasan, Kyu J Han, Katrin Kirchhoff

专题命中 幻觉与鲁棒性 :multimodal large language model(title)

Comments 9+6 pages, Submitted to ACL 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2104.08455 2021-09-15 cs.CL 71%

Neural Path Hunter: Reducing Hallucination in Dialogue Systems via Path Grounding

Nouha Dziri, Andrea Madotto, Osmar Zaiane, Avishek Joey Bose

专题命中 幻觉与鲁棒性 :grounding(title)

Comments EMNLP 2021 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14854 2026-08-18 cs.CV 新提交 70%

Zero-MELO: Test-Time Evidence Calibration with Multimodal LLMs for Zero-Shot Micro-Gesture Recognition

Zero-MELO:基于多模态大语言模型的测试时证据校准用于零样本微手势识别

Chengyan Wang, Hanliang Xie, Yueyi Yang, Haoyu Chen

机构 * University of Oulu(奥卢大学) Peking University(北京大学)

专题命中 幻觉与鲁棒性 :multimodal large language model(abstract,abstract_cn);分类 cs.CV

AI总结 该研究针对多模态大语言模型在微手势识别中局部证据不足、分数偏差的瓶颈,提出Zero-MELO框架,结合树搜索、测试时校准与多线索融合,在iMiGUE和MA-52数据集上显著优于Qwen2.5-VL基线。

Comments Accepted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04484 2026-08-18 cs.CV 版本更新 70%

TrustCLIP: Learning Private Visual Features via Adversarial Reconstruction

TrustCLIP:通过对抗性重建学习隐私视觉特征

Nikos Athanasiou, Ilya A. Petrov, Angela Yao, Shugao Ma, Eric Sauser, Edoardo Remelli, Shreyas Hampali, Johannes Schönberger, Fadime Sener, Bugra Tekin

机构 * Meta Max Planck Institute for Intelligent Systems(马克斯·普朗克智能系统研究所) University of Tübingen(图宾根大学) National University of Singapore(新加坡国立大学)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 研究视觉和视觉语言模型中视觉特征隐私问题,提出TrustCLIP框架,以特征条件生成器为隐私对手,优化编码器特征与下游模块投影,降低生成式反演保真度并保持下游任务性能。

Comments https://atnikos.github.io/trustclip/ Update affiliations

详情

展开后加载摘要…

URL PDF HTML 收藏