arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 2246 信号源:cs.CV, cs.AI, cs.LG

1. 幻觉与鲁棒性 2246 篇

2606.05874 2026-06-05 cs.CL 78%

Evaluating Stochastic Collapse and Implicit Bias in Multimodal Large Language Models

评估多模态大语言模型中的随机坍缩与隐式偏差

Huiyuan Zheng, Houtao Zhang, Boyang Wang, Qingyi Si, Hongcheng Guo

机构 * Fudan University(复旦大学) Beihang University(北航) JD.com(京东)

专题命中 幻觉与鲁棒性 :multimodal large language model(title,abstract)

AI总结 提出RandomBench基准测试,通过熵和分布偏差指标揭示多模态大语言模型在逻辑中性场景下存在随机坍缩现象,即无法维持均匀随机性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18442 2026-05-19 cs.RO 78%

SG-CADVLM: A Context-Aware Decoding Powered Vision Language Model for Safety-Critical Scenario Generation

SG-CADVLM: 一种基于上下文感知解码的视觉语言模型,用于安全关键场景生成

Hongyi Zhao, Shuo Wang, Qijie He, Ziyuan Pu

机构 * School of Transportation, Southeast University(东南大学交通学院)

专题命中 幻觉与鲁棒性 :vision language model(title);vision-language model(abstract)

AI总结 本文提出SG-CADVLM,一种结合上下文感知解码的多模态输入处理框架,用于从事故报告中生成高保真的安全关键场景,通过减少视觉语言模型的幻觉并同时生成道路几何和车辆轨迹,提升了生成场景的准确性和实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01333 2026-05-11 cs.CL 78%

OralMLLM-Bench: Evaluating Cognitive Capabilities of Multimodal Large Language Models in Dental Practice

OralMLLM-Bench: 评估多模态大语言模型在牙科实践中的认知能力

Rongyang Wang, Shuang Zhou, Jiashuo Wang, Wenya Xie, Xiaoxia Che

专题命中 幻觉与鲁棒性 :multimodal large language model(title,abstract)

AI总结 本文提出OralMLLM-Bench,通过27个临床任务评估多模态大语言模型在牙科影像分析中的认知能力,揭示模型与牙科医生的性能差异及改进方向。

Comments 21 pages, 4 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13302 2026-04-29 cs.CL 78%

Images Amplify Misinformation Sharing in Vision-Language Models

图像在视觉-语言模型中放大虚假信息的传播

Alice Plebe, Timothy Douglas, Diana Riazi, R. Maria del Rio-Chanona

机构 * Department of Industrial Engineering, University of Trento(特伦托大学工业工程系) Computer Science Department, University College London(伦敦大学学院计算机科学系)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract)

AI总结 研究探讨了图像如何影响视觉-语言模型分享新闻内容的倾向,发现图像能提高虚假新闻的分享率,且不同模型对图像的反应存在差异。

Comments Accepted for oral presentation at ICWSM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18942 2026-04-22 cs.CL 78%

Disparities In Negation Understanding Across Languages In Vision-Language Models

多语言中否定理解差异在视觉-语言模型中的表现

Charikleia Moraitaki, Sarah Pan, Skyler Pulling, Gwendolyn Flusche, Kumail Alhamoud, Marzyeh Ghassemi

机构 * Massachusetts Institute of Technology(麻省理工学院)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract)

AI总结 研究探讨了视觉-语言模型在不同语言中对否定理解的差异,通过多语言基准测试发现,CLIP在非拉丁文字语言表现不佳,而MultiCLIP在多语言中表现更优,SpaceVLM在部分语言中显著提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05437 2026-04-22 cs.CL 78%

Once Correct, Still Wrong: Counterfactual Hallucination in Multilingual Vision-Language Models

一旦正确,仍错误:多语言视觉-语言模型中的反事实幻觉

Basel Mousi, Fahim Dalvi, Shammur Chowdhury, Firoj Alam, Nadir Durrani

机构 * Qatar Computing Research Institute, HBKU(卡塔尔计算研究所,哈姆丹·本·哈马德大学)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract)

AI总结 研究探讨多语言视觉-语言模型在文化背景下反事实幻觉的问题,提出M²CQA基准测试,通过17个中东国家图像和多语言对比陈述评估模型性能,发现阿拉伯语尤其在方言中反事实幻觉率显著上升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21950 2026-04-20 cs.CL 78%

MEDSYN: Benchmarking Multi-EviDence SYNthesis in Complex Clinical Cases for Multimodal Large Language Models

MEDSYN:多证据合成在复杂临床病例中的基准测试用于多模态大语言模型

Boqi Chen, Xudong Liu, Jiachuan Peng, Marianne Frey-Marti, Bang Zheng, Kyle Lam, Lin Li, Jianing Qiu

机构 * ETH Zurich(苏黎世联邦理工学院) MBZUAI(马克斯·普朗克人工智能研究所) Amazon(亚马逊) University of Oxford(牛津大学) University of Bern(伯尔尼大学) Imperial College London(伦敦帝国理工学院) Peking University(北京大学)

专题命中 幻觉与鲁棒性 :multimodal large language model(title,abstract)

AI总结 MEDSYN是一个多语言、多模态的复杂临床病例基准测试,用于评估多模态大语言模型在差分诊断和最终诊断中的表现,揭示模型在异质临床证据合成中的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09017 2026-04-13 cs.NI 78%

Multimodal Large Language Model Enabled Robust Beamforming for HAP Downlink Communications

多模态大语言模型赋能的HAP下行链路鲁棒波束成形

Xiaoyu Xing, Peng Yang, Guoquan Tao, Dingyi Lu, Zehui Xiong, Xianbin Cao

专题命中 幻觉与鲁棒性 :multimodal large language model(title,abstract)

AI总结 本文提出基于多模态大语言模型的波束成形框架,通过飞行 telemetry 预测HAP姿态并实现鲁棒下行通信,提升用户服务比和总速率22.1%和12.5%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27091 2026-03-31 math.OC 78%

Meta-Contrastive Learning for Vision-Language Models via Task-Adaptive CLIP Training

通过任务自适应CLIP训练实现视觉语言模型的元对比学习

Merham Fouladvand, Peuroly Batra

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract)

AI总结 本文提出一种域条件元对比学习框架,通过任务自适应CLIP训练提升视觉语言模型跨域泛化能力,引入域嵌入和交叉域对齐正则化,增强模型在域偏移下的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20839 2026-03-24 cs.CV cs.AI cs.HC cs.LG 78%

Dodgersort: Uncertainty-Aware VLM-Guided Human-in-the-Loop Pairwise Ranking

Dodgersort: 一种考虑不确定性的视觉语言模型引导的人机协作成对排序

Yujin Park, Haejun Chung, Ikbeom Jang

机构 * Hanyang University(翰阳大学) Hankuk University of Foreign Studies(韩国民法大学)

专题命中 幻觉与鲁棒性 :VLM(title);分类 cs.CV、cs.AI、cs.LG

AI总结 Dodgersort通过CLIP基于的分层预排序、神经排名头和概率集成方法,减少人工比较并提升排序可靠性,在医学影像、历史 dating 和美学任务中实现11-16%的标注减少。

Comments 12 pages, 2 figures, Pacific-Asia Conference on Knowledge Discovery and Data Mining(PAKDD2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10846 2026-03-20 cs.CL 78%

DUAL-Bench: Measuring Over-Refusal and Robustness in Vision-Language Models

DUAL-Bench: 测量视觉语言模型中的过度拒绝与鲁棒性

Kaixuan Ren, Preslav Nakov, Usman Naseem

机构 * Macquarie University(麦考瑞大学) MBZUAI(马克斯·普朗克智能系统研究所)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract)

AI总结 本文提出DUAL-Bench,通过评估18种VLM在12类危险场景下的表现,揭示模型在双重使用场景中的脆弱安全边界,强调安全完成与过度拒绝的平衡需求。

Comments 26pages, 13 figures, Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15513 2026-03-17 cs.CL 78%

ViX-Ray: A Vietnamese Chest X-Ray Dataset for Vision-Language Models

ViX-Ray: 一个用于视觉-语言模型的越南胸部X光数据集

Duy Vu Minh Nguyen, Chinh Thanh Truong, Phuc Hoang Tran, Hung Tuan Le, Nguyen Van-Thanh Dat, Trung Hieu Pham, Kiet Van Nguyen

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract)

AI总结 本文提出ViX-Ray数据集,包含5400张越南胸部X光图像,用于评估和推动视觉-语言模型在越南临床领域的应用,发现现有模型在印象生成上存在低精度和过度幻觉问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10061 2026-03-13 cs.RO 78%

Decision-Aware Uncertainty Evaluation of Vision-Language Model-Based Early Action Anticipation for Human-Robot Interaction

基于视觉语言模型的早期动作预测在人机交互中的决策感知不确定性评估

Zhaoda Du, Michael Bowman, Qiaojie Zheng, Xiaoli Zhang

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract)

AI总结 本文提出了一种系统评估基于视觉语言模型的短期动作识别在人机交互中的不确定性方法,通过引入时间前缀评估协议和校准度量标准,揭示了部分观测下的误校准模式和失败模式,为信心门控的人机交互模块提供了可靠性证据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02147 2026-01-06 cs.CV cs.AI cs.LG 78%

BiPrompt: Bilateral Prompt Optimization for Visual and Textual Debiasing in Vision-Language Models

BiPrompt:面向视觉与文本去偏的双重视觉语言模型双向提示优化

Sunny Gupta, Shounak Das, Amit Sethi

专题命中 幻觉与鲁棒性 :vision-language model(title);分类 cs.CV、cs.AI、cs.LG

AI总结 BiPrompt通过双重视觉语言模型双向提示优化,同时减轻视觉和文本中的非因果特征依赖,提升模型在分布偏移下的鲁棒性和因果推理能力。

Comments Accepted at the AAAI 2026 Workshop AIR-FM, Assessing and Improving Reliability of Foundation Models in the Real World

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24513 2026-01-05 cs.CY 78%

From Static to Dynamic: Evaluating the Perceptual Impact of Dynamic Elements in Urban Scenes via MLLM-Guided Generative Inpainting

从静态到动态:通过MLLM引导的生成修复技术评估城市场景中动态元素的感知影响

Zhiwei Wei, Mengzi Zhang, Boyan Lu, Zhitao Deng, Nai Yang, Hua Liao

专题命中 幻觉与鲁棒性 :MLLM(title,abstract)

AI总结 通过MLLM引导的生成修复技术,研究评估了动态元素在城市场景中的感知影响,发现移除动态元素导致活力显著下降,揭示了光照、人类存在和深度变化对感知变化的关键作用。

Comments 31 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16110 2025-11-21 cs.CR 78%

Multi-Faceted Attack: Exposing Cross-Model Vulnerabilities in Defense-Equipped Vision-Language Models

多面攻击:揭示配备防御机制的视觉语言模型中的跨模型漏洞

Yijun Yang, Lichao Wang, Jianping Zhang, Chi Harold Liu, Lanqing Hong, Qiang Xu

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract)

AI总结 多面攻击揭示了配备防御机制的视觉语言模型中的跨模型安全漏洞,通过注意力转移攻击和轻量级转移增强算法,实现了58.5%的成功率。

Comments AAAI 2026 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03367 2025-11-06 cs.CV cs.AI cs.LG 78%

Decoupling Augmentation Bias in Prompt Learning for Vision-Language Models

Gahyeon Kim, Sohee Kim, Seokju Lee

机构 * Korea Institute of Energy Technology (KENTECH)(韩国能源技术研究所)

专题命中 幻觉与鲁棒性 :vision-language model(title);分类 cs.CV、cs.AI、cs.LG

Comments Accepted in Pattern Recognition

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20856 2025-10-27 cs.CR 78%

FPT-Noise: Dynamic Scene-Aware Counterattack for Test-Time Adversarial Defense in Vision-Language Models

Jia Deng, Jin Li, Zhenhua Zhao, Shaowei Wang

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract)

Comments 11pages,4figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21400 2025-09-29 cs.CR 78%

SafeSteer: Adaptive Subspace Steering for Efficient Jailbreak Defense in Vision-Language Models

Xiyu Zeng, Siyuan Liang, Liming Lu, Haotian Zhu, Enguang Liu, Jisheng Dang, Yongbin Zhou, Shuchao Pang

专题命中 幻觉与鲁棒性 :vision-language model(title);vision language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.18053 2025-09-29 cs.CR cs.CL 78%

Resource Consumption Red-Teaming for Large Vision-Language Models

Haoran Gao, Yuanhe Zhang, Zhenhong Zhou, Lei Jiang, Fanyu Meng, Yujia Xiao, Li Sun, Kun Wang, Yang Liu, Junlan Feng

机构 * China Mobile Research Institute(中国移动研究院) Beijing University of Posts and Telecommunications(北京邮电大学) Nanyang Technological University(南洋理工大学) University of Science and Technology of China(中国科学技术大学) North China Electric Power University(华北电力大学)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.16104 2025-08-12 cs.CY 78%

Beauty and the Bias: Exploring the Impact of Attractiveness on Multimodal Large Language Models

Aditya Gulati, Moreno D'Incà, Nicu Sebe, Bruno Lepri, Nuria Oliver

专题命中 幻觉与鲁棒性 :multimodal large language model(title,abstract)

Comments 39 pages, 4 figures, 33 tables; Accepted for publication at the Eighth AAAI/ACM Conference on AI, Ethics and Society (AIES 2025) (https://www.aies-conference.com/2025/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.09845 2025-08-05 cs.RO 78%

Friction-Aware Safety Locomotion for Wheeled-legged Robots using Vision Language Models and Reinforcement Learning

Bo Peng, Donghoon Baek, Qijie Wang, Joao Ramos

机构 * University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Department of Electrical and Computer Engineering(电气与计算机工程系) Department of Mechanical Science Engineering(机械科学与工程系) School of Software(软件学院)

专题命中 幻觉与鲁棒性 :vision language model(title);vision-language model(abstract)

Comments Accepted to Humanoids 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.10749 2025-07-16 cs.RO 78%

RCG: Safety-Critical Scenario Generation for Robust Autonomous Driving via Real-World Crash Grounding

Benjamin Stoler, Juliet Yang, Jonathan Francis, Jean Oh

机构 * School of Computer Science at Carnegie Mellon University(卡内基梅隆大学计算机科学学院) Bosch Center for AI(博世人工智能中心)

专题命中 幻觉与鲁棒性 :grounding(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.14744 2025-06-24 cs.CL 78%

HiddenDetect: Detecting Jailbreak Attacks against Large Vision-Language Models via Monitoring Hidden States

Yilei Jiang, Xinyan Gao, Tianshuo Peng, Yingshui Tan, Xiaoyong Zhu, Bo Zheng, Xiangyu Yue

机构 * MMLab, The Chinese University of Hong Kong(中文大学香港大学) Future Lab, Alibaba Group(阿里集团未来实验室)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract)

Comments Accepted by ACL 2025 (Main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13055 2025-06-17 cs.CL 78%

CFBenchmark-MM: Chinese Financial Assistant Benchmark for Multimodal Large Language Model

Jiangtong Li, Yiyun Zhu, Dawei Cheng, Zhijun Ding, Changjun Jiang

机构 * School of Computer Science and Technology, Tongji University(同济大学计算机科学与技术学院)

专题命中 幻觉与鲁棒性 :multimodal large language model(title,abstract)

Comments 22 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21967 2025-05-29 cs.CL 78%

Seeing the Threat: Vulnerabilities in Vision-Language Models to Adversarial Attack

Juan Ren, Mark Dras, Usman Naseem

机构 * School of Computing, Macquarie University(计算机学院,麦考瑞大学)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract)

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.11619 2025-03-17 cs.CR 78%

Tit-for-Tat: Safeguarding Large Vision-Language Models Against Jailbreak Attacks via Adversarial Defense

Shuyang Hao, Yiwei Wang, Bryan Hooi, Ming-Hsuan Yang, Jun Liu, Chengcheng Tang, Zi Huang, Yujun Cai

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.20750 2025-03-03 cs.CL 78%

Mitigating Hallucinations in Large Vision-Language Models by Adaptively Constraining Information Flow

Jiaqi Bai, Hongcheng Guo, Zhongyuan Peng, Jian Yang, Zhoujun Li, Mohan Li, Zhihong Tian

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract)

Comments Accepted to AAAI 2025. Camera ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.14948 2025-01-14 cs.LG cs.AI cs.CV 78%

Effective Backdoor Mitigation in Vision-Language Models Depends on the Pre-training Objective

Sahil Verma, Gantavya Bhatt, Avi Schwarzschild, Soumye Singhal, Arnav Mohanty Das, Chirag Shah, John P Dickerson, Pin-Yu Chen, Jeff Bilmes

专题命中 幻觉与鲁棒性 :vision-language model(title);分类 cs.CV、cs.AI、cs.LG

Comments Accepted at TMLR (https://openreview.net/forum?id=Conma3qnaT)

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.10603 2024-11-19 cs.RO cs.SY eess.SY 78%

A Novel MLLM-based Approach for Autonomous Driving in Different Weather Conditions

Sonda Fourati, Wael Jaafar, Noura Baccar

专题命中 幻觉与鲁棒性 :MLLM(title,abstract)

Comments 9 pages, 6 figures; Submitted to IEEE Transactions on Intelligent Transportation Systems

详情

展开后加载摘要…

URL PDF HTML 收藏