arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-03-02 至 2026-03-02 共收录 2 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 2 篇

2602.23952 2026-03-02 cs.CV 83%

CC-VQA: Conflict- and Correlation-Aware Method for Mitigating Knowledge Conflict in Knowledge-Based Visual Question Answering

CC-VQA: 一种考虑冲突和相关性的方法,用于缓解基于知识的视觉问答中的知识冲突

Yuyang Hong, Jiaqi Gu, Yujin Lou, Lubin Fan, Qi Yang, Ying Wang, Kun Ding, Yue Wu, Shiming Xiang, Jieping Ye

机构 * School of Artificial Intelligence, UCAS(中国科学技术大学人工智能学院) MAIS, Institute of Automation(自动化研究所MAIS) Alibaba Cloud Computing(阿里云计算)

专题命中 视觉问答 :visual question answering(title,abstract);vision language model(abstract);分类 cs.CV

AI总结 CC-VQA提出了一种无训练、考虑冲突和相关性的方法,通过视觉中心的上下文冲突推理和相关性引导的编码解码,提升基于知识的视觉问答的准确率。

Comments Accepted by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01959 2026-03-02 cs.CV cs.AI cs.LG 75%

Structure-aware Contrastive Learning for Diagram Understanding of Multimodal Models

结构感知对比学习用于多模态模型的图表理解

Hiroshi Sasaki

机构 * The Japan Research Institute, Limited(日本研究机构)

专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 本文提出结构感知对比学习方法,通过专门的损失函数提升多模态模型对图表图像的理解能力,在图像-文本匹配和视觉问答任务中取得显著改进。

Comments 10 pages, 8 figures

Journal ref ICCVW (2025) 7463-7472

详情

展开后加载摘要…

URL PDF HTML 收藏