arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 2246 信号源:cs.CV, cs.AI, cs.LG

1. 幻觉与鲁棒性 2246 篇

2509.21173 2026-05-18 cs.CV cs.AI cs.LG 75%

Less Precise Can Be More Reliable: A Systematic Evaluation of Quantization's Impact on VLMs Beyond Accuracy

精度降低可能更可靠:对VLMs量化影响的系统评估

Aymen Bouguerra, Daniel Montoya, Alexandra Gomez-Villa, Chokri Mraidha, Fabio Arnez

机构 * Computer Vision Center(计算机视觉中心)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 本文系统评估了量化对VLMs可靠性的影响,发现量化能提升准确率、校准、异常检测和抗噪能力,但不改善协变量偏移或虚假相关性。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01694 2026-03-03 cs.CV cs.AI cs.LG 75%

MVR: Multi-view Video Reward Shaping for Reinforcement Learning

MVR:多视图视频奖励塑造用于强化学习

Lirui Luo, Guoxi Zhang, Hongming Xu, Yaodong Yang, Cong Fang, Qing Li

机构 * School of Intelligence Science and Technology, Peking University(北京大学智能科学与技术学院) State Key Laboratory of General Artificial Intelligence, BIGAI(通用人工智能国家重点实验室)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 MVR通过多视角视频和视觉语言模型提升强化学习中的奖励塑造,有效解决复杂动态任务中的状态相关性和视角偏见问题。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11908 2026-01-27 cs.RO 75%

Safe Learning for Contact-Rich Robot Tasks: A Survey from Classical Learning-Based Methods to Safe Foundation Models

接触丰富机器人任务的安全学习:从经典学习方法到安全基础模型的综述

Heng Zhang, Rui Dai, Gokhan Solak, Pokuang Zhou, Yu She, Arash Ajoudani

机构 * Human-Robot Interfaces and Interaction Lab, Istituto Italiano di Tecnologia, Genova, Italy(人类-机器人接口与交互实验室,意大利技术研究院,热那亚,意大利) Ph.D. program of national interest in Robotics and Intelligent Machines (DRIM) and Università di Genova, Genoa, Italy(机器人与智能机器国家利益博士项目(DRIM)和热那亚大学,热那亚,意大利) Edwardson School of Industrial Engineering, Purdue University, West Lafayette, IN, USA(工业工程埃德华森学校,普渡大学,西拉法伊斯,美国)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);VLM(abstract);grounding(abstract)

AI总结 本文综述了接触丰富机器人任务的安全学习方法,探讨了从经典学习方法到安全基础模型的发展,分析了安全探索与执行的关键技术及未来方向。

Comments version 2

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.07147 2025-07-11 cs.LG cs.AI cs.CL cs.CV 75%

Weighted Multi-Prompt Learning with Description-free Large Language Model Distillation

Sua Lee, Kyubum Shin, Jung Ho Park

机构 * Seoul National University(首尔国立大学) Naver AI

专题命中 幻觉与鲁棒性 :vision language model(abstract);VLM(abstract);分类 cs.CV、cs.AI、cs.LG

Comments Published as a conference paper at ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08008 2025-06-10 cs.CV cs.AI cs.LG 75%

Hidden in plain sight: VLMs overlook their visual representations

Stephanie Fu, Tyler Bonnen, Devin Guillory, Trevor Darrell

机构 * UC Berkeley(伯克利大学)

专题命中 幻觉与鲁棒性 :vision language model(abstract);VLM(abstract);分类 cs.CV、cs.AI、cs.LG

Comments Project page: https://hidden-plain-sight.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.17348 2024-11-26 cs.RO 75%

DexGANGrasp: Dexterous Generative Adversarial Grasping Synthesis for Task-Oriented Manipulation

Qian Feng, David S. Martinez Lema, Mohammadhossein Malmir, Hang Li, Jianxiang Feng, Zhaopeng Chen, Alois Knoll

专题命中 幻觉与鲁棒性 :vision language model(abstract);grounding(abstract);multimodal large language model(abstract)

Comments 8 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.09050 2024-09-09 cs.CR cs.AI cs.CV cs.LG 75%

Refusing Safe Prompts for Multi-modal Large Language Models

Zedian Shao, Hongbin Liu, Yuepeng Hu, Neil Zhenqiang Gong

专题命中 幻觉与鲁棒性 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.00425 2024-06-11 cs.CV cs.AI cs.LG 75%

HALC: Object Hallucination Reduction via Adaptive Focal-Contrast Decoding

Zhaorun Chen, Zhuokai Zhao, Hongyin Luo, Huaxiu Yao, Bo Li, Jiawei Zhou

专题命中 幻觉与鲁棒性 :vision-language model(abstract);grounding(abstract);分类 cs.CV、cs.AI、cs.LG

Comments ICML camera-ready version. Code is released at https://github.com/BillChan226/HALC

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24602 2026-08-12 cs.CV 版本更新 74%

Majorization-Guided Test-Time Adaptation for Vision-Language Models under Modality-Specific Shift

基于主导性的测试时适应以应对视觉-语言模型在模态特定偏移下的表现

Lixian Chen, Mingxuan Huang, Yanhui Chen, Junyi Lin, Yang Shi

机构 * Guangdong University of Technology(广东工业大学)

专题命中 幻觉与鲁棒性 :vision-language model(title);分类 cs.CV

AI总结 本文研究了视觉-语言模型在部署时视觉与文本分支不对称偏移的问题,提出MG-MTTA方法通过控制模态可靠性而非仅预测熵来提升性能。

Comments Accepted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04509 2026-08-06 cs.AI 新提交 74%

CARGO-VL: Counterfactual Arbitration with Risk-Constrained Group Optimization for Vision-Language Models

CARGO-VL:面向视觉-语言模型的风险约束组优化反事实仲裁方法

De Jiang, Zhengyang Zhang, Kehong Yuan, Shaohua Ma

专题命中 幻觉与鲁棒性 :vision-language model(title);分类 cs.AI

AI总结 本研究提出CARGO-VL框架,结合XMC资源,通过组相对优化及原对偶控制器,提升视觉-语言模型的反事实仲裁性能,在多基准上优于逐点基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14499 2026-07-17 cs.AI 新提交 74%

Contextualized Evaluation of Vision Language Models through Dynamic, Multi-turn Interactions

通过动态多轮交互对视觉语言模型进行情境化评估

Yijiang Li, Huiqi Zou, Bingyang Wang, Ziang Xiao

机构 * UC San Diego(加州大学圣地亚哥分校) Northeastern University(东北大学) Georgia Institute of Technology(佐治亚理工学院) Johns Hopkins University(约翰·霍普金斯大学)

专题命中 幻觉与鲁棒性 :vision language model(title);分类 cs.AI

AI总结 研究多模态大语言模型现实有效性问题,提出CEDI框架,通过三方交互、多轮半结构化对话及多种策略评估,应用于视觉幻觉,发现能揭示更多接近实际情况的幻觉,凸显其对MLLMs能力评估的作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26287 2026-06-26 cs.CV 新提交 74%

GeMoE: Gating Entropy is All You Need for Uncertainty-aware Adaptive Routing in MoE-based Large Vision-Language Models

GeMoE:基于门控熵的MoE大视觉语言模型中不确定性感知自适应路由

Chaoxiang Cai, Minghe Weng, Jie Li, Yibo Jiang, Longrong Yang, Zequn Qin, Xi Li

机构 * School of Software Technology, Zhejiang University(浙江大学软件学院) College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院)

专题命中 幻觉与鲁棒性 :vision-language model(title);分类 cs.CV

AI总结 针对MoE架构中静态路由无法自适应选择专家的问题,提出基于门控熵的不确定性感知自适应路由方法GeMoE,通过最小描述长度原理建模复杂度与性能的权衡,在保持99.5%性能的同时提升36.5%专家激活稀疏性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12571 2026-06-12 cs.CV 版本更新 74%

Measurement Plasticity: Sensor-Level Adaptation for Vision-Language Models

测量塑性:面向视觉-语言模型的传感器级自适应

Boyeong Im, Wooseok Lee, Yoojin Kwon, Hyung-Sin Kim

机构 * University of Seoul(首尔大学)

专题命中 幻觉与鲁棒性 :vision-language model(title);分类 cs.CV

AI总结 提出多视角物理提示(MVP)用于测试时自适应,通过将相机曝光三角(ISO、快门速度、光圈)作为物理提示,在传感器层面进行自适应,无需梯度或模型修改,在ImageNet-ES上优于数字方法。

Comments Accepted to the ICML 2026 Workshop on Continual Adaptation at Scale

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05687 2026-04-23 cs.CV 74%

3D Smoke Scene Reconstruction Guided by Vision Priors from Multimodal Large Language Models

由多模态大语言模型视觉先验引导的3D烟雾场景重建

Xinye Zheng, Fei Wang, Yiqi Nie, Kun Li, Junjie Chen, Jiaqi Zhao, Yanyan Wei, Zhiliang Wu

机构 * Hefei University of Technology(合肥工业大学) Institute of Artificial Intelligence, Hefei Comprehensive National Science Center(合肥综合性国家科学中心人工智能研究院) Anhui University(安徽大学) United Arab Emirates University(阿联酋大学) Nanyang Technological University(南洋理工大学)

专题命中 幻觉与鲁棒性 :multimodal large language model(title);分类 cs.CV

AI总结 本文提出整合视觉先验与高效3D场景建模的框架,通过增强烟雾退化图像和开发Smoke-GS框架,提升烟雾场景重建与视图合成的鲁棒性与一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22737 2026-04-22 cs.CV 74%

Lingua-SafetyBench: A Benchmark for Safety Evaluation of Multilingual Vision-Language Models

Lingua-SafetyBench: 一个多语言视觉-语言模型安全评估基准

Enyi Shi, Pengyang Shao, Yanxin Zhang, Chenhang Cui, Jiayi Lyu, Xiaobo Xia, Fei Shen, Tat-Seng Chua

机构 * School of Computer Science and Engineering, Nanjing University of Science and Technology(南京理工大学计算机科学与工程学院) School of Computer Science, University of Wisconsin–Madison(威斯康星大学麦迪逊分校计算机科学系) School of Engineering Science, University of the Chinese Academy of Sciences(中国科学院工程科学学院) NExT++ Research Centre, National University of Singapore(新加坡国立大学NExT++研究中心)

专题命中 幻觉与鲁棒性 :vision-language model(title);分类 cs.CV

AI总结 本文提出Lingua-SafetyBench,通过10万多个多语言图像-文本对评估多模态模型的安全性,发现非高资源语言和非拉丁文在文本主导风险下安全性更差,强调需要专门的语言和模态对齐策略以提升安全性和公平性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.03627 2026-03-16 cs.CL cs.AI 74%

Partially Recentralization Softmax Loss for Vision-Language Models Robustness

部分重校正softmax损失用于视觉-语言模型鲁棒性

Hao Wang, Jinzhe Jiang, Xin Zhang, Chen Li

专题命中 幻觉与鲁棒性 :vision-language model(title);分类 cs.AI

AI总结 本文提出部分重校正softmax损失,通过限制top K softmax输出提升预训练多模态模型的对抗鲁棒性,实验显示细调后模型对主流攻击更具鲁棒性。

Comments The study described in Section 4 was conducted without required institutional review board approval. The paper is withdrawn pending completion of the approval process

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15873 2026-02-19 cs.RO cs.AI 74%

Test-Time Adaptation for Tactile-Vision-Language Models

测试时适应用于触觉-视觉-语言模型

Chuyang Ye, Haoxian Jing, Qinting Jiang, Yixi Lin, Qiang Li, Xing Tang, Jingyan Jiang

机构 * Shenzhen Technology University(深圳技术大学) New York University(纽约大学) Shenzhen University(深圳大学) Tsinghua University(清华大学)

专题命中 幻觉与鲁棒性 :vision-language model(title);分类 cs.AI

AI总结 本文提出了一种可靠性感知框架,用于提升触觉-视觉-语言模型在测试时的适应能力,通过估计各模态可靠性来过滤不可靠样本并优化融合过程,有效提升了在模态损坏情况下的准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10313 2026-02-18 cs.CV cs.MM 74%

Hierarchical Refinement of Universal Multimodal Attacks on Vision-Language Models

面向视觉语言模型的层次化通用多模态攻击

Peng-Fei Zhang, Zi Huang

机构 * School of Electrical Engineering and Computer Science, the University of Queensland(电气工程与计算机科学学院,昆士兰大学) Department of Computer Science, City University of Hong Kong(计算机科学系,香港城市大学)

专题命中 幻觉与鲁棒性 :vision-language model(title);分类 cs.CV

AI总结 本文提出HRA框架,通过层次化优化路径和文本重要性建模,实现对视觉语言模型的通用多模态攻击,验证了其在多种任务和数据集上的优越迁移性能。

Comments 10 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12405 2026-02-16 cs.RO cs.LG 74%

Self-Refining Vision Language Model for Robotic Failure Detection and Reasoning

自适应多任务视觉语言模型用于机器人故障检测与推理

Carl Qi, Xiaojie Wang, Silong Yong, Stephen Sheng, Huitan Mao, Sriram Srinivasan, Manikantan Nambi, Amy Zhang, Yesh Dattatreya

机构 * UT Austin(德克萨斯大学) Amazon Robotics(亚马逊机器人技术) Carnegie Mellon University(卡内基梅隆大学)

专题命中 幻觉与鲁棒性 :vision language model(title);分类 cs.LG

AI总结 ARMOR是一种自适应多任务视觉语言模型,通过多任务自 refinement 过程提升机器人故障检测与推理性能,实现故障检测率提升30%和推理表现提升100%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04752 2026-01-09 cs.CV 74%

Skeletonization-Based Adversarial Perturbations on Large Vision Language Model's Mathematical Text Recognition

基于骨架化的对抗扰动在大视觉语言模型数学文本识别中的应用

Masatomo Yoshida, Haruto Namura, Nicola Adami, Masahiro Okuda

机构 * Doshisha University Kyoto, 610-0394 Japan University of Brescia Brescia, 25134 Italy Independent Researcher Tokyo, Japan

专题命中 幻觉与鲁棒性 :vision language model(title);分类 cs.CV

AI总结 本文提出基于骨架化的对抗扰动方法,用于评估大视觉语言模型在数学文本识别中的视觉能力和局限性,并通过ChatGPT验证其实际应用价值。

Comments accepted to ITC-CSCC 2025

Journal ref Proc. ITC-CSCC 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04677 2025-10-03 cs.CV 74%

Robust Prompt Tuning for Vision-Language Models with Mild Semantic Noise

Yansheng Gao, Yufei Zheng, Shengsheng Wang

机构 * College of Computer Science and Technology, Key Laboratory of Symbolic Computation and Knowledge Engineering of Ministry of Education, Jilin University(计算机科学与技术学院、教育部符号计算与知识工程重点实验室、吉林大学) College of Software, Key Laboratory of Symbolic Computation and Knowledge Engineering of Ministry of Education, Jilin University(软件学院、教育部符号计算与知识工程重点实验室、吉林大学)

专题命中 幻觉与鲁棒性 :vision-language model(title);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16088 2025-09-22 cs.LG 74%

Randomized Smoothing Meets Vision-Language Models

Emmanouil Seferis, Changshun Wu, Stefanos Kollias, Saddek Bensalem, Chih-Hong Cheng

机构 * National Technical University of Athens(希腊雅典国家技术大学) Université Grenoble Alpes(格勒诺布尔阿尔卑斯大学) CSX-AI(CSX-AI公司) Carl von Ossietzky University of Oldenburg(奥尔登堡卡尔·冯·奥西特齐大学) Chalmers University of Technology(查尔姆斯理工大学)

专题命中 幻觉与鲁棒性 :vision-language model(title);分类 cs.LG

Comments EMNLP'25 full version, including appendix (proofs, additional experiments)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21794 2025-07-30 cs.CV 74%

Distribution-Based Masked Medical Vision-Language Model Using Structured Reports

Shreyank N Gowda, Ruichi Zhang, Xiao Gu, Ying Weng, Lu Yang

机构 * School of Computer Science, University of Nottingham(计算机科学学院,诺丁汉大学) Department of Computer Science and Technology, School of Informatics, Xiamen University(计算机科学与技术系,信息学院,厦门大学) CHI Lab, University of Oxford(CHI实验室,牛津大学) School of Computer Science, University of Nottingham Ningbo China(计算机科学学院,宁波大学中国)

专题命中 幻觉与鲁棒性 :vision-language model(title);分类 cs.CV

Comments Accepted in MICCAI-W 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.17645 2025-06-24 cs.CV 74%

Histopathology Image Report Generation by Vision Language Model with Multimodal In-Context Learning

Shih-Wen Liu, Hsuan-Yu Fan, Wei-Ta Chu, Fu-En Yang, Yu-Chiang Frank Wang

机构 * National Cheng Kung University, Taiwan(国立成功大学) NVIDIA Research(NVIDIA研究)

专题命中 幻觉与鲁棒性 :vision language model(title);分类 cs.CV

Comments Accepted to MIDL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.18825 2025-05-13 cs.RO cs.LG 74%

ELEMENTAL: Interactive Learning from Demonstrations and Vision-Language Models for Reward Design in Robotics

Letian Chen, Nina Moorman, Matthew Gombolay

机构 * School of Interactive Computing, Georgia Institute of Technology, Atlanta, United States(交互计算学院,佐治亚理工学院,美国亚特兰大) Department of XXX, University of YYY, Location, Country(XXX系,YYY大学,Location Country) School of ZZZ, Institute of WWW, Location, Country(ZZZ学院,WWW研究所,Location Country)

专题命中 幻觉与鲁棒性 :vision-language model(title);分类 cs.LG

Comments ICML 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.04772 2025-04-08 cs.LG 74%

Feedback-Enhanced Hallucination-Resistant Vision-Language Model for Real-Time Scene Understanding

Zahir Alsulaimawi

专题命中 幻觉与鲁棒性 :vision-language model(title);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.10071 2025-01-20 cs.CV cs.MM 74%

CLIP-PCQA: Exploring Subjective-Aligned Vision-Language Modeling for Point Cloud Quality Assessment

Yating Liu, Yujie Zhang, Ziyu Shan, Yiling Xu

专题命中 幻觉与鲁棒性 :vision-language model(title);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.10335 2024-12-17 cs.CV 74%

Efficient Generation of Targeted and Transferable Adversarial Examples for Vision-Language Models Via Diffusion Models

Qi Guo, Shanmin Pang, Xiaojun Jia, Yang Liu, Qing Guo

专题命中 幻觉与鲁棒性 :vision-language model(title);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.05574 2024-11-19 cs.CV 74%

Vision-Language Modeling with Regularized Spatial Transformer Networks for All Weather Crosswind Landing of Aircraft

Debabrata Pal, Anvita Singh, Saumya Saumya, Shouvik Das

专题命中 幻觉与鲁棒性 :vision-language model(title);分类 cs.CV

Comments Accepted in Indian Conference on Vision Graphics and Image Processing - ICVGIP 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.07111 2024-10-10 eess.IV cs.CL cs.CV 74%

Utility of Multimodal Large Language Models in Analyzing Chest X-ray with Incomplete Contextual Information

Choonghan Kim, Seonhee Cho, Joo Heung Yoon

专题命中 幻觉与鲁棒性 :multimodal large language model(title);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏