arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-05-08 至 2026-05-08 共收录 4 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 4 篇

2605.06058 2026-05-08 cs.LG cs.CV 84%

Towards Self-Explainable Document Visual Question Answering with Chain-of-Explanation Predictions

迈向具有解释链预测的自解释文档视觉问答

Kjetil Indrehus, Adrian Duric, Changkyu Choi, Ali Ramezani-Kebrya

机构 * Department of Informatics, University of Oslo(奥斯陆大学信息学院) Integreat – Norwegian Centre for Knowledge-driven Machine Learning(挪威知识驱动机器学习中心) TRUST – The Norwegian Centre for Trustworthy AI(挪威可信人工智能中心)

专题命中 视觉问答 :visual question answering(title,abstract);vision-language model(abstract);分类 cs.CV、cs.LG

AI总结 本文提出CoExVQA框架,通过解释链设计实现文档视觉问答的自解释,通过证据识别、答案定位和基于证据解码三步流程提升可解释性,实验显示在PFL-DocVQA上取得SotA性能,ANLS提升12%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09298 2026-05-08 cs.CV 77%

Multi-Modal LLM based Image Captioning in ICT: Bridging the Gap Between General and Industry Domain

基于多模态LLM的ICT图像描述:弥合通用与行业领域之间的差距

Lianying Chao, Kai Zhang, Haoran Cai, Sijie Wu, Xubin Li, Xin Chen

机构 * GTS, Huawei Technologies Co., Ltd.(华为技术有限公司GTS部门)

专题命中 视觉问答 :MLLM(abstract,abstract_cn);visual question answering(abstract);分类 cs.CV

AI总结 本文提出多阶段训练策略,构建ICT领域图像描述模型DICModel,通过合成图像文本对提升模型性能,实验表明其在BLEU指标和准确率上均优于现有模型。

Journal ref 2025 CCF BigData

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06201 2026-05-08 cs.AI 57%

Towards Annotation-Free Validation of MLLMs: A Vision-Language Logical Consistency Metric

迈向无标注验证的MLLMs:一种视觉-语言逻辑一致性度量

Ying Gu, Mei Chee Leong, Hui Li Tan, Shangbo Mao, Liyuan Li, Nancy Chen

机构 * Institute for Infocomm Research (I 2 R), Agency for Science, Technology and Research (A*STAR), Singapore(信息通信研究所(I2R),科技研究局(A*STAR),新加坡)

专题命中 视觉问答 :MLLM(abstract);分类 cs.AI

AI总结 本文提出一种无需标注的视觉-语言逻辑一致性度量,用于评估大语言模型在因果关系上的逻辑一致性,发现尽管准确率提升,但逻辑一致性仍显著滞后。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20825 2026-05-08 cs.CL 50%

Reinforced Informativeness Optimization for Long-Form Retrieval-Augmented Generation

强化信息量优化用于长文本检索增强生成

Yuhao Wang, Ruiyang Ren, Yucheng Wang, Wayne Xin Zhao, Jing Liu, Hua Wu, Haifeng Wang

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学公安学院人工智能学院) Baidu Inc.(百度公司)

专题命中 视觉问答 :grounding(abstract)

AI总结 本文提出RioRAG框架,通过 nugget-centric 验证实现可验证的信息量优化,提升长文本检索增强生成的准确性和稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏