arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-03-18 至 2026-03-18 共收录 5 信号源:cs.CV, cs.AI, cs.LG

1. 幻觉与鲁棒性 5 篇

2603.16113 2026-03-18 cs.CV cs.AI 84%

PathGLS: Evaluating Pathology Vision-Language Models without Ground Truth through Multi-Dimensional Consistency

PathGLS: 通过多维一致性评估病理视觉-语言模型无需真实数据

Minbing Chen, Zhu Meng, Fei Su

机构 * Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);grounding(abstract);分类 cs.CV、cs.AI

AI总结 本文提出PathGLS,一种无需真实数据的病理VLM评估框架,从 grounding、logic 和 stability 三个维度评估模型性能,通过实验验证其在多个数据集上的优越性,显著优于其他方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16001 2026-03-18 cs.CV cs.CL cs.LG 81%

Mostly Text, Smart Visuals: Asymmetric Text-Visual Pruning for Large Vision-Language Models

大部分文本,智能视觉:不对称文本-视觉剪枝用于大型视觉-语言模型

Sijie Li, Biao Qian, Jungong Han

机构 * University of Sheffield, UK(英国谢菲尔德大学) Tsinghua University, China(清华大学)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV、cs.LG

AI总结 本文提出不对称文本-视觉剪枝方法,通过解耦文本和视觉token的权重,发现文本路径需用文本token校准,视觉路径可实现50%稀疏率,验证了其在多模态基准上的优越性。

Comments CVPR 2026. Code available here: https://github.com/LezJ/ATV-Pruning

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15940 2026-03-18 cs.CR cs.CV 79%

Do Not Leave a Gap: Hallucination-Free Object Concealment in Vision-Language Models

不要留下空白:视觉-语言模型中的无幻觉物体遮蔽

Amira Guesmi, Muhammad Shafique

机构 * Engineering Division, New York University Abu Dhabi, UAE(纽约大学阿布扎比分校工程系)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV

AI总结 本文提出一种背景一致的物体遮蔽攻击方法,通过重新编码视觉表示使目标物体与背景一致,避免幻觉产生,实验显示其能有效遮蔽目标物体并减少幻觉。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15800 2026-03-18 cs.CV cs.CL cs.CR 72%

Evolving Contextual Safety in Multi-Modal Large Language Models via Inference-Time Self-Reflective Memory

通过推理时的自我反思记忆在多模态大语言模型中实现上下文安全演化

Ce Zhang, Jinxi He, Junyi He, Katia Sycara, Yaqi Xie

机构 * Robotics Institute, Carnegie Mellon University(卡内基梅隆大学机器人研究所)

专题命中 幻觉与鲁棒性 :MLLM(abstract,comments);visual reasoning(abstract);分类 cs.CV

AI总结 本文提出MM-SafetyBench++基准和EchoSafe框架,通过自反思记忆实现多模态大语言模型的上下文安全演化,实验表明其在安全性能上表现优异。

Comments Accepted at CVPR 2026. Project page: https://echosafe-mllm.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06140 2026-03-18 cs.CV 57%

Boosting the Local Invariance for Better Adversarial Transferability

提升局部不变性以增强对抗迁移性

Bohan Liu, Xiaosen Wang

机构 * School of Computer Science and Technology, Huazhong University of Science and Technology(华中科技大学计算机科学与技术学院)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出LI-Boost方法,通过提升对抗扰动的局部不变性来增强模型间对抗迁移性,实验表明其在多种攻击类型上均有效。

Comments Code is available at https://github.com/Trustworthy-AI-Group/TransferAttack

详情

展开后加载摘要…

URL PDF HTML 收藏