arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 2246 信号源:cs.CV, cs.AI, cs.LG

1. 幻觉与鲁棒性 2246 篇

2505.23518 2025-11-25 cs.AI 70%

TRAP: Targeted Redirecting of Agentic Preferences

TRAP:面向目标的代理偏好重定向

Hangoo Kang, Jehyeok Yeon, Gagandeep Singh

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);LLaVA(abstract);分类 cs.AI

AI总结 TRAP通过语义引导的跨模态操纵,诱导代理AI系统产生一致的选择偏见,揭示了语义层面的安全漏洞。

Comments Accepted to NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06251 2025-11-18 cs.CV 70%

Physics Knowledge in Frontier Models: A Diagnostic Study of Failure Modes

Ieva Bagdonaviciute, Vibhav Vineet

专题命中 幻觉与鲁棒性 :vision-language model(abstract);grounding(abstract);分类 cs.CV

Comments 8 pages, 7 figures. Preprint. v2: Updated experiments and diagnostics; formatting fixes

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10074 2025-11-14 cs.CV cs.SY eess.SY 70%

VLF-MSC: Vision-Language Feature-Based Multimodal Semantic Communication System

Gwangyeon Ahn, Jiwan Seo, Joonhyuk Kang

专题命中 幻觉与鲁棒性 :vision-language model(abstract);VLM(abstract);分类 cs.CV

Comments To appear in the AI4NextG Workshop at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09228 2025-11-13 cs.CV cs.CL 70%

Taming Object Hallucinations with Verified Atomic Confidence Estimation

Jiarui Liu, Weihao Xuan, Zhijing Jin, Mona Diab

机构 * CMU(卡内基梅隆大学) The University of Tokyo(东京大学) The University of Toronto(多伦多大学)

专题命中 幻觉与鲁棒性 :LLaVA(abstract);multimodal large language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.04514 2025-11-07 cs.CL cs.CV 70%

DAMRO: Dive into the Attention Mechanism of LVLM to Reduce Object Hallucination

Xuan Gong, Tianshi Ming, Xinpeng Wang, Zhihua Wei

机构 * Department of Computer Science and Technology, Tongji University(计算机科学与技术系,同济大学)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);LLaVA(abstract);分类 cs.CV

Comments Accepted by EMNLP2024 (Main Conference), add GitHub link

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00509 2025-11-04 cs.AI cs.CR 70%

Reimagining Safety Alignment with An Image

Yifan Xia, Guorui Chen, Wenqian Yu, Zhijiang Li, Philip Torr, Jindong Gu

机构 * School of Information Management, Wuhan University, Wuhan, China(武汉大学信息管理学院) Torr Vision Group, University of Oxford, Oxford, United Kingdom(牛津大学)

专题命中 幻觉与鲁棒性 :multimodal large language model(abstract);MLLM(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10466 2025-10-14 cs.CV 70%

When Images Speak Louder: Mitigating Language Bias-induced Hallucinations in VLMs through Cross-Modal Guidance

Jinjin Cao, Zhiyang Chen, Zijun Wang, Liyuan Ma, Weijian Luo, Guojun Qi

机构 * MAPLE Lab, Westlake University(西溪大学MAPLE实验室)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);VLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.14670 2025-10-14 cs.HC cs.AI 70%

StreetLens: Enabling Human-Centered AI Agents for Neighborhood Assessment from Street View Imagery

Jina Kim, Leeje Jang, Yao-Yi Chiang, Guanyu Wang, Michelle C. Pasco

机构 * University of Minnesota(明尼苏达大学)

专题命中 幻觉与鲁棒性 :vision language model(abstract);VLM(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.01534 2025-10-06 cs.CV 70%

Toward a Holistic Evaluation of Robustness in CLIP Models

Weijie Tu, Weijian Deng, Tom Gedeon

专题命中 幻觉与鲁棒性 :vision-language model(abstract);LLaVA(abstract);分类 cs.CV

Comments Accepted to IEEE TPAMI, extension of NeurIPS'23 work: A Closer Look at the Robustness of Contrastive Language-Image Pre-Training (CLIP)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20862 2025-10-01 cs.CV 70%

AVCD: Mitigating Hallucinations in Audio-Visual Large Language Models through Contrastive Decoding

Chaeyoung Jung, Youngjoon Jang, Joon Son Chung

机构 * Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);multimodal large language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25177 2025-09-30 cs.CV 70%

Mitigating Hallucination in Multimodal LLMs with Layer Contrastive Decoding

Bingkui Tong, Jiaer Xia, Kaiyang Zhou

机构 * Mohamed bin Zayed University of Artificial Intelligence(莫扎德·本·扎耶德人工智能大学) Hong Kong Baptist University(香港 Baptist大学)

专题命中 幻觉与鲁棒性 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21997 2025-09-29 cs.CV 70%

Exposing Hallucinations To Suppress Them: VLMs Representation Editing With Generative Anchors

Youxu Shi, Suorong Yang, Dong Liu

机构 * University of Science and Technology of China(中国科学技术大学) Nanjing University(南京大学)

专题命中 幻觉与鲁棒性 :LLaVA(abstract);multimodal large language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12521 2025-09-17 cs.LG 70%

Phi: Preference Hijacking in Multi-modal Large Language Models at Inference Time

Yifan Lan, Yuanpu Cao, Weitong Zhang, Lu Lin, Jinghui Chen

机构 * The Pennsylvania State University(宾夕法尼亚州立大学) The University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 幻觉与鲁棒性 :multimodal large language model(abstract);MLLM(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06989 2025-08-29 cs.CR cs.CV 70%

Probabilistic Modeling of Jailbreak on Multimodal LLMs: From Quantification to Application

Wenzhuo Xu, Zhipeng Wei, Xiongtao Sun, Zonghao Ying, Deyue Zhang, Dongdong Yang, Xiangzheng Zhang, Quanchen Zou

专题命中 幻觉与鲁棒性 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.14533 2025-08-12 cs.CV 70%

ArtiMuse: Fine-Grained Image Aesthetics Assessment with Joint Scoring and Expert-Level Understanding

Shuo Cao, Nan Ma, Jiayang Li, Xiaohui Li, Lihao Shao, Kaiwen Zhu, Yu Zhou, Yuandong Pu, Jiarui Wu, Jiaquan Wang, Bo Qu, Wenhai Wang, Yu Qiao, Dajuin Yao, Yihao Liu

专题命中 幻觉与鲁棒性 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

Comments 43 pages, 31 figures, 13 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.17722 2025-07-24 cs.CV 70%

BetterCheck: Towards Safeguarding VLMs for Automotive Perception Systems

Malsha Ashani Mahawatta Dona, Beatriz Cabrero-Daniel, Yinan Yu, Christian Berger

机构 * University of Gothenburg(哥德堡大学) Chalmers University of Technology(查尔姆斯理工大学)

专题命中 幻觉与鲁棒性 :vision language model(abstract);VLM(abstract);分类 cs.CV

Comments Accepted in The IEEE International Conference on Intelligent Transportation Systems (ITSC)2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.19697 2025-07-18 cs.CV 70%

Prompt-driven Transferable Adversarial Attack on Person Re-Identification with Attribute-aware Textual Inversion

Yuan Bian, Min Liu, Yunqi Yi, Xueping Wang, Yaonan Wang

机构 * School of Artificial Intelligence and Robotics, Hunan University(湖南大学人工智能与机器人学院) National Engineering Research Center of Robot Visual Perception and Control Technology(机器人视觉感知与控制技术国家工程研究中心) College of Information Science and Engineering, Hunan Normal University(湖南师范大学信息科学与工程学院)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);VLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.12430 2025-07-14 cs.CR cs.CV 70%

Pushing the Limits of Safety: A Technical Report on the ATLAS Challenge 2025

Zonghao Ying, Siyang Wu, Run Hao, Peng Ying, Shixuan Sun, Pengyu Chen, Junze Chen, Hao Du, Kaiwen Shen, Shangkun Wu, Jiwei Wei, Shiyuan He, Yang Yang, Xiaohai Xu, Ke Ma, Qianqian Xu, Qingming Huang, Shi Lin, Xun Wang, Changting Lin, Meng Han, Yilei Jiang, Siqi Lai, Yaozhi Zheng, Yifei Song, Xiangyu Yue, Zonglei Jing, Tianyuan Zhang, Zhilei Zhu, Aishan Liu, Jiakai Wang, Siyuan Liang, Xianglong Kong, Hainan Li, Junjie Mu, Haotong Qin, Yue Yu, Lei Chen, Felix Juefei-Xu, Qing Guo, Xinyun Chen, Yew Soon Ong, Xianglong Liu, Dawn Song, Alan Yuille, Philip Torr, Dacheng Tao

机构 * Beihang University(北航) Zhongguancun Laboratory(中关村实验室) Hefei Comprehensive National Science Center(合肥综合性国家科学中心) ETH Zürich(苏黎世联邦理工学院) Pengcheng Laboratory(鹏城实验室) Tsinghua University(清华大学) University of California, Berkeley(加州大学伯克利分校) Johns Hopkins University(约翰霍普金斯大学) University of Oxford(牛津大学) Meta Google Brain(谷歌脑) Nanyang Technological University(南洋理工大学) Aarhus University(哥本哈根大学) China University of Mining(中国矿业大学) University of Electronic Science(电子科学大学) School of Electronic, Electrical(电子、电气与通信工程学院) Key Laboratory of Intelligent Information Processing, Institute of Computing Technology, CAS(智能信息处理国家重点实验室) School of Computer Science(计算机科学学院) Key Laboratory of Big Data Mining(大数据挖掘国家重点实验室) Zhejiang Gongshang University(浙江工商大学) Binjiang Institute of Zhejiang University(浙江大学滨江学院) Zhejiang University(浙江大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 幻觉与鲁棒性 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

Comments AdvML@CVPR Challenge Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.07731 2025-07-11 cs.CV 70%

Energy-Guided Decoding for Object Hallucination Mitigation

Xixi Liu, Ailin Deng, Christopher Zach

机构 * Chalmers University of Technology(查尔姆斯理工大学) National University of Singapore(新加坡国立大学)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);visual question answering(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21874 2025-06-30 cs.CR cs.AI 70%

On the Feasibility of Poisoning Text-to-Image AI Models via Adversarial Mislabeling

Stanley Wu, Ronik Bhaskar, Anna Yoo Jeong Ha, Shawn Shan, Haitao Zheng, Ben Y. Zhao

机构 * University of Chicago(芝加哥大学)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);VLM(abstract);分类 cs.AI

Comments ACM Conference on Computer and Communications Security 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.01584 2025-06-30 cs.AI 70%

SENSEI: Semantic Exploration Guided by Foundation Models to Learn Versatile World Models

Cansu Sancaktar, Christian Gumbsch, Andrii Zadaianchuk, Pavel Kolev, Georg Martius

机构 * Autonomous Learning, University of Tübingen(图宾根大学自主学习研究所) Empirical Inference, Max Planck Institute for Intelligent Systems(马克斯·普朗克智能系统研究所) Neuro-Cognitive Modeling, University of Tübingen(图宾根大学神经认知建模研究所) VISLab, University of Amsterdam(阿姆斯特丹大学视觉实验室)

专题命中 幻觉与鲁棒性 :vision language model(abstract);VLM(abstract);分类 cs.AI

Comments ICML 2025 camera-ready version. Project webpage at https://sites.google.com/view/sensei-paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00618 2025-06-23 cs.AI 70%

RiOSWorld: Benchmarking the Risk of Multimodal Computer-Use Agents

Jingyi Yang, Shuai Shao, Dongrui Liu, Jing Shao

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) University of Science and Technology of China(中国科学技术大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 幻觉与鲁棒性 :multimodal large language model(abstract);MLLM(abstract);分类 cs.AI

Comments 40 pages, 6 figures, Project Page: https://yjyddq.github.io/RiOSWorld.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13038 2025-06-18 cs.CV cs.MM 70%

HKD4VLM: A Progressive Hybrid Knowledge Distillation Framework for Robust Multimodal Hallucination and Factuality Detection in VLMs

Zijian Zhang, Xuecheng Wu, Danlei Huang, Siyu Yan, Chong Peng, Xuezhi Cao

机构 * Xi'an Jiaotong University(西安交通大学) East China Normal University(华东师范大学)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);VLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07564 2025-06-12 cs.AI cs.CL 70%

SAFEFLOW: A Principled Protocol for Trustworthy and Transactional Autonomous Agent Systems

Peiran Li, Xinkai Zou, Zhuohang Wu, Ruifeng Li, Shuo Xing, Hanwen Zheng, Zhikai Hu, Yuping Wang, Haoxi Li, Qin Yuan, Yingmo Zhang, Zhengzhong Tu

专题命中 幻觉与鲁棒性 :vision-language model(abstract);VLM(abstract);分类 cs.AI

Comments Former versions either contain unrelated content or cannot be properly converted to PDF

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07971 2025-06-10 cs.CV 70%

CyberV: Cybernetics for Test-time Scaling in Video Understanding

Jiahao Meng, Shuyang Sun, Yue Tan, Lu Qi, Yunhai Tong, Xiangtai Li, Longyin Wen

机构 * Peking University(北京大学) ByteDance(字节跳动)

专题命中 幻觉与鲁棒性 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18657 2025-05-27 cs.AI 70%

MLLMs are Deeply Affected by Modality Bias

Xu Zheng, Chenfei Liao, Yuqian Fu, Kaiyu Lei, Yuanhuiyi Lyu, Lutao Jiang, Bin Ren, Jialei Chen, Jiawen Wang, Chengxin Li, Linfeng Zhang, Danda Pani Paudel, Xuanjing Huang, Yu-Gang Jiang, Nicu Sebe, Dacheng Tao, Luc Van Gool, Xuming Hu

机构 * HKUST(GZ)(香港科技大学(广州)) CSE, HKUST(香港科技大学计算机科学与工程系) Xi’an Jiaotong University(西安交通大学) University of Pisa, IT(比萨大学) University of Trento, IT(特伦特大学) Nagoya University(名古屋大学) China University of Mining & Technology, Beijing(中国矿业大学(北京)) Tongji University(同济大学) SPIC Energy Science and Technology Research Institute(SPIC能源科学与技术研究院) Shanghai Jiao Tong University(上海交通大学) Fudan University(复旦大学) College of Computing & Data Science, Nanyang Technological University(南洋理工大学计算机与数据科学学院)

专题命中 幻觉与鲁棒性 :multimodal large language model(abstract);MLLM(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.20468 2025-05-08 cs.CV 70%

Antidote: A Unified Framework for Mitigating LVLM Hallucinations in Counterfactual Presupposition and Object Perception

Yuanchen Wu, Lu Zhang, Hang Yao, Junlong Du, Ke Yan, Shouhong Ding, Yunsheng Wu, Xiaoqiang Li

机构 * School of Computer Engineering & Science, Shanghai University(上海大学计算机工程与科学学院) Tencent YouTu Lab(腾讯优图实验室)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);LLaVA(abstract);分类 cs.CV

Comments Accepted to CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.03153 2025-05-07 cs.CV 70%

Robust Fairness Vision-Language Learning for Medical Image Analysis

Sparsh Bansal, Mingyang Wu, Xin Wang, Shu Hu

机构 * Purdue University(普渡大学) University at Albany, State University of New York(纽约州立大学阿尔巴尼分校)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);VLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.21040 2025-05-01 cs.CV 70%

Can a Large Language Model Assess Urban Design Quality? Evaluating Walkability Metrics Across Expertise Levels

Chenyi Cai, Kosuke Kuriyama, Youlong Gu, Filip Biljecki, Pieter Herthogs

机构 * Singapore-ETH Centre, Future Cities Lab Global Programme, CREATE campus(新加坡-ETH中心,未来城市实验室全球计划,CREATE校区) National University of Singapore(新加坡国立大学) Takenaka Corporation(Takenaka公司) Department of Architecture, National University of Singapore(新加坡国立大学建筑系)

专题命中 幻觉与鲁棒性 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.06172 2025-04-24 cs.AI cs.CL 70%

Multimodal Situational Safety

Kaiwen Zhou, Chengzhi Liu, Xuandong Zhao, Anderson Compalas, Dawn Song, Xin Eric Wang

机构 * University of California, Santa Cruz(加州大学圣克ruz分校) University of California, Berkeley(加州大学伯克利分校)

专题命中 幻觉与鲁棒性 :multimodal large language model(abstract);MLLM(abstract);分类 cs.AI

Comments ICLR 2025 Camera Ready

详情

展开后加载摘要…

URL PDF HTML 收藏