arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-04-02 至 2026-04-02 共收录 3 信号源:cs.CV, cs.AI, cs.LG

1. 幻觉与鲁棒性 3 篇

2604.01010 2026-04-02 cs.CV cs.MM 85%

PDA: Text-Augmented Defense Framework for Robust Vision-Language Models against Adversarial Image Attacks

PDA:用于对抗图像攻击的文本增强防御框架

Jingning Xu, Haochen Luo, Chen Liu

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);VLM(abstract);visual question answering(abstract);分类 cs.CV

AI总结 PDA通过测试时文本增强提升视觉语言模型对多种对抗攻击的鲁棒性,无需修改底层模型,平衡了鲁棒性与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27982 2026-04-02 cs.CV cs.AI cs.CL 81%

CDH-Bench: A Commonsense-Driven Hallucination Benchmark for Evaluating Visual Fidelity in Vision-Language Models

CDH-Bench:一种基于常识的幻觉基准,用于评估视觉语言模型中的视觉保真度

Kesheng Chen, Yamin Hu, Qi Zhou, Zhenqian Zhu, Wenjian Luo

机构 * Guangdong Provincial Key Laboratory of Novel Security Intelligence Technologies, Institute of Cyberspace Security, School of Computer Science and Technology, Harbin Institute of Technology, Shenzhen(广东省新型安全智能技术重点实验室,网络空间安全研究院,计算机科学与技术学院,哈尔滨工业大学(深圳))

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出CDH-Bench基准,用于评估视觉语言模型在视觉证据与常识冲突时的视觉保真度,通过三种异常类型和两种QA任务,揭示模型在常识驱动下的幻觉问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15411 2026-04-02 cs.CV cs.LG 62%

D4C: Data-Free Quantization for Contrastive Language-Image Pre-training Models

D4C: 无数据量化用于对比语言-图像预训练模型

Wenlun Zhang, Yunshan Zhong, Zihao Ding, Xinyu Li, Kentaro Yoshioka

机构 * Keio University(庆应义塾大学) Hainan University(海南大学)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV、cs.LG

AI总结 本文提出D4C框架,解决无数据量化在CLIP模型中的性能问题,通过生成语义丰富且结构多样的伪图像提升模型压缩效果。

Comments Accepted to CVPRF 2026

详情

展开后加载摘要…

URL PDF HTML 收藏