arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-03-24 至 2026-03-24 共收录 10 信号源:cs.CV, cs.AI, cs.LG

1. 幻觉与鲁棒性 10 篇

2603.20985 2026-03-24 cs.CV 85%

Consistent but Dangerous: Per-Sample Safety Classification Reveals False Reliability in Medical Vision-Language Models

一致却危险:每样本安全分类揭示医疗视觉-语言模型中的虚假可靠性

Binesh Sadanandan, Vahid Behzadan

机构 * SAIL Lab, University of New Haven(SAIL实验室,新罕布什尔大学)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);VLM(abstract);LLaVA(abstract);分类 cs.CV

AI总结 研究揭示医疗VLMs中一致性指标的缺陷,通过四象限分类发现危险样本高准确率且低熵,建议部署评估需结合文本基线以识别虚假可靠性。

Comments CVPR 2026 Workshop on Medical Reasoning with Vision Language Foundation Models

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16960 2026-03-24 cs.CR cs.AI 85%

Adversarial attacks against Modern Vision-Language Models

对抗现代视觉-语言模型的攻击

Alejandro Paredes La Torre

机构 * Duke University(杜克大学)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);VLM(abstract);LLaVA(abstract);分类 cs.AI

AI总结 研究开放源码视觉-语言模型在模拟真实预部署环境中的对抗鲁棒性,评估两种模型在三种梯度攻击下的表现,发现其存在显著的安全差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21426 2026-03-24 cs.CV 83%

Uncertainty-Aware Knowledge Distillation for Multimodal Large Language Models

面向不确定性的多模态大语言模型知识蒸馏

Jingchen Sun, Shaobo Han, Deep Patel, Wataru Kohno, Can Jin, Changyou Chen

机构 * NEC Laboratories America, Inc.(NEC美洲实验室) University at Buffalo, SUNY(布法罗大学) Rutgers University(罗格斯大学)

专题命中 幻觉与鲁棒性 :multimodal large language model(title);vision-language model(abstract);VLM(abstract);分类 cs.CV

AI总结 本文提出Beta-KD框架,通过统一贝叶斯视角平衡数据与教师指导,提升多模态VQA任务性能。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.23495 2026-03-24 cs.CV 83%

Embedding Shift Dissection on CLIP: Effects of Augmentations on VLM's Representation Learning

在CLIP上嵌入位移分析:不同增强对VLM表示学习的影响

Ashim Dahal, Saydul Akbar Murad, Nick Rahimi

机构 * University of Southern Mississippi(密西西比大学)

专题命中 幻觉与鲁棒性 :VLM(title,abstract);vision language model(abstract);分类 cs.CV

AI总结 研究分析不同增强技术对CLIP嵌入位移的影响,探讨增强对视觉语言模型表示学习的机械可解释性影响。

Comments accepted at MIV at CVPR 2025

Journal ref 2025 IEEE/CVF Conference on Computer Vision and Pattern Recognition Workshops (CVPRW)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20827 2026-03-24 cs.RO 82%

Swim2Real: VLM-Guided System Identification for Sim-to-Real Transfer

Swim2Real: 基于视觉-语言模型的系统辨识用于仿真到现实迁移

Kevin Qiu, Kyle Walker, Mike Y. Michelis, Marek Cygan, Josie Hughes

机构 * University of Warsaw(华沙大学) IDEAS NCBR EPFL(瑞士联邦理工学院) ETH Zurich(苏黎世联邦理工学院) Nomagic

专题命中 幻觉与鲁棒性 :VLM(title,abstract);vision-language model(abstract)

AI总结 本文提出Swim2Real系统,利用视觉-语言模型反馈校准水下仿真实验室,无需手动设计搜索阶段。通过同时校准16个参数,显著提升仿真到现实的迁移效果,实现零样本强化学习迁移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16523 2026-03-24 cs.CV cs.AI 81%

TTP: Test-Time Padding for Adversarial Detection and Robust Adaptation on Vision-Language Models

TTP: 视觉-语言模型上的对抗检测与鲁棒适应的测试时填充

Zhiwei Li, Yitian Pang, Weining Wang, Zhenan Sun, Qi Li

机构 * NLPR & MAIS, Institute of Automation, Chinese Academy of Sciences(神经网络与模式识别实验室及自动化研究所,中国科学院) University of Chinese Academy of Sciences(中国科学院大学) Department of Automation, Tsinghua University(清华大学自动化系)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出TTP框架,通过测试时填充实现对抗检测与鲁棒适应,提升视觉-语言模型在对抗攻击下的鲁棒性而不影响清洁准确性。

Comments Accepted to the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21047 2026-03-24 cs.CV 79%

When Minor Edits Matter: LLM-Driven Prompt Attack for Medical VLM Robustness in Ultrasound

微小修改同样重要:基于LLM驱动的提示攻击用于医学视觉语言模型在超声中的鲁棒性

Yasamin Medghalchi, Milad Yazdani, Amirhossein Dabiriaghdam, Moein Heidari, Mojan Izadkhah, Zahra Kavian, Giuseppe Carenini, Lele Wang, Dena Shahriari, Ilker Hacihaliloglu

机构 * University of British Columbia, Vancouver, Canada(不列颠哥伦比亚大学)

专题命中 幻觉与鲁棒性 :VLM(title);vision-language model(abstract);分类 cs.CV

AI总结 本文提出一个可扩展的对抗评估框架,利用大语言模型生成临床合理的对抗提示变体,评估SOTA医学视觉语言模型在超声中的鲁棒性,揭示模型在临床应用中的安全漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20839 2026-03-24 cs.CV cs.AI cs.HC cs.LG 78%

Dodgersort: Uncertainty-Aware VLM-Guided Human-in-the-Loop Pairwise Ranking

Dodgersort: 一种考虑不确定性的视觉语言模型引导的人机协作成对排序

Yujin Park, Haejun Chung, Ikbeom Jang

机构 * Hanyang University(翰阳大学) Hankuk University of Foreign Studies(韩国民法大学)

专题命中 幻觉与鲁棒性 :VLM(title);分类 cs.CV、cs.AI、cs.LG

AI总结 Dodgersort通过CLIP基于的分层预排序、神经排名头和概率集成方法,减少人工比较并提升排序可靠性,在医学影像、历史 dating 和美学任务中实现11-16%的标注减少。

Comments 12 pages, 2 figures, Pacific-Asia Conference on Knowledge Discovery and Data Mining(PAKDD2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23743 2026-03-24 cs.SE cs.AI 57%

Hybrid-Code v2: Zero-Hallucination Clinical ICD-10 Coding via Neuro-Symbolic Verification and Automated Knowledge Base Expansion

Hybrid-Code v2:通过神经符号验证和自动知识库扩展实现零幻觉的临床ICD-10编码

Yunguo Yu

机构 * AI Innovation & Prototyping, Zyter(人工智能创新与原型开发,Zyter)

专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.AI

AI总结 Hybrid-Code v2结合神经网络与符号验证,实现零类型I幻觉,同时保持高覆盖率和精度,通过自动知识库扩展解决规则系统扩展性问题。

Comments Version 2: Substantially extended version with (1) multi-layer verification framework (format, evidence, negation, temporal, exclusion), (2) automated knowledge base expansion from unlabeled clinical text, (3) formal zero Type-I hallucination guarantees, and (4) expanded experimental evaluation on 5,000 cases with detailed error analysis. 28 pages, 3 figure, original research paper;

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10065 2026-03-24 cs.AI 57%

RadHiera: Semantic Hierarchical Reinforcement Learning for Medical Report Generation

RadHiera:面向医学报告生成的语义分层强化学习

Bodong Du, Honglong Yang, Xiaomeng Li

机构 * The Hong Kong University of Science(香港科技大学)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.AI

AI总结 本文提出RadHiera框架,通过分层强化学习提升医学报告生成的语义一致性与诊断准确性,实验表明其在胸部X光和超声报告生成中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏