arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 3129 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 3129 篇

2602.07266 2026-02-10 cs.HC 50%

ADCanvas: Accessible and Conversational Audio Description Authoring for Blind and Low Vision Creators

ADCanvas: 为视障和低视力创作者提供可访问且对话式的音频描述创作工具

Franklin Mingzhe Li, Michael Xieyang Liu, Cynthia L. Bennett, Shaun K. Kane

专题命中 视觉问答 :visual question answering(abstract)

AI总结 ADCanvas为视障和低视力创作者提供可访问且对话式的音频描述创作工具,通过多模态交互支持端到端的AD创作和视觉问答。

Comments 21 pages, 4 figures, published in CHI '26

Journal ref Proceedings of the 2026 CHI Conference on Human Factors in Computing Systems (CHI '26), April 13-17, 2026, Barcelona, Spain

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01986 2026-02-03 cs.HC 50%

Belief Updating and Delegation in Multi-Task Human-AI Interaction: Evidence from Controlled Simulations

信念更新与委托在多任务人机交互中的作用:来自受控模拟的证据

Shreyan Biswas, Alexander Erlei, Ujwal Gadiraju

专题命中 视觉问答 :visual question answering(abstract)

AI总结 研究发现用户在多任务人机交互中形成路径依赖的期望,保守更新信念,并基于主观信念而非客观性能决定对AI的依赖。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19202 2026-01-28 cs.CL 50%

Do Images Speak Louder than Words? Investigating the Effect of Textual Misinformation in VLMs

图像胜过言语吗?探讨文本误导在VLMs中的影响

Chi Zhang, Wenxuan Ding, Jiale Liu, Mingrui Wu, Qingyun Wu, Ray Mooney

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) Pennsylvania State University(宾夕法尼亚州立大学) New York University(纽约大学) University of Chinese Academy of Sciences(中国科学院大学) AG2ai, Inc.(AG2ai公司)

专题命中 视觉问答 :vision-language model(abstract)

AI总结 研究探讨了文本误导对视觉-语言模型(VLMs)的影响,发现模型易受误导性文本提示影响,导致性能显著下降。

Comments 24 pages, 10 figures. Accepted at EACL 2026 (main conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07295 2026-01-28 cs.CL 50%

CCFQA: A Benchmark for Cross-Lingual and Cross-Modal Speech and Text Factuality Evaluation

CCFQA:跨语言和跨模态语音与文本事实性评估基准

Yexing Du, Kaiyuan Liu, Youcheng Pan, Zheng Chu, Bo Yang, Xiaocheng Feng, Ming Liu, Yang Xiang

专题命中 视觉问答 :multimodal large language model(abstract)

AI总结 CCFQA是一个用于评估多模态大语言模型跨语言和跨模态事实性能力的基准,通过少样本迁移学习策略在多语言语音问答任务中取得与GPT-4o-mini-Audio相当的性能。

Comments Accepted in AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17212 2026-01-27 cs.CL 50%

DF-RAG: Query-Aware Diversity for Retrieval-Augmented Generation

DF-RAG:基于查询的多样性检索增强生成

Saadat Hasan Khan, Spencer Hong, Jingyu Wu, Kevin Lybarger, Youbing Yin, Erin Babinsky, Daben Liu

机构 * George Mason University(乔治·马歇尔大学) Capital One

专题命中 视觉问答 :grounding(abstract)

AI总结 DF-RAG通过在检索阶段引入多样性,提升复杂推理问答任务的F1性能,相比传统RAG提升了4-10个百分点,并接近Oracle上限的91.3%

Comments Accepted to Findings of EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16400 2026-01-26 cs.CL 50%

Clarify or Answer: Reinforcement Learning for Agentic VQA with Context Under-specification

澄清或回答:基于上下文不充分的代理视觉问答强化学习

Zongwan Cao, Bingbing Wen, Lucy Lu Wang

机构 * University of Washington(华盛顿大学) Allen Institute for AI(人工智能研究院)

专题命中 视觉问答 :visual question answering(abstract)

AI总结 CoA通过强化学习解决上下文不充分的视觉问答问题,通过生成聚焦问题澄清歧义,提升问答准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.19498 2026-01-21 cs.CL 50%

DomainCQA: Crafting Knowledge-Intensive QA from Domain-Specific Charts

DomainCQA: 从领域特定图表中构建知识密集型问答

Yujing Lu, Ling Zhong, Jing Yang, Weiming Li, Peng Wei, Yongheng Wang, Manni Duan, Qing Zhang

专题命中 视觉问答 :multimodal large language model(abstract)

AI总结 DomainCQA通过构建领域特定图表问答基准测试,提升多模态大语言模型在视觉理解和知识密集型推理方面的能力。

Comments 83 pages, 59 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12700 2026-01-21 eess.AS cs.SD 50%

Improving Audio Question Answering with Variational Inference

通过变分推断改进音频问答

Haolin Chen

机构 * Idiap Research Institute, Martigny, Switzerland(日内瓦研究所) École Polytechnique Fédérale de Lausanne, Lausanne, Switzerland(洛桑联邦理工学院)

专题命中 视觉问答 :multimodal large language model(abstract)

AI总结 本文通过改进的变分推断优化器提升音频问答任务的预测准确性与校准性。

Comments ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04720 2026-01-21 cs.CL 50%

Qwen3-VL-Embedding and Qwen3-VL-Reranker: A Unified Framework for State-of-the-Art Multimodal Retrieval and Ranking

Qwen3-VL-Embedding 和 Qwen3-VL-Reranker:面向最新多模态检索与排序的统一框架

Mingxin Li, Yanzhao Zhang, Dingkun Long, Keqin Chen, Sibo Song, Shuai Bai, Zhibo Yang, Pengjun Xie, An Yang, Dayiheng Liu, Jingren Zhou, Junyang Lin

专题命中 视觉问答 :visual question answering(abstract)

AI总结 Qwen3-VL-Embedding和Qwen3-VL-Reranker通过统一框架实现多模态检索与排序的高精度性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10645 2026-01-16 cs.CL 50%

Influential Training Data Retrieval for Explaining Verbalized Confidence of LLMs

用于解释大语言模型 verbalized 自信心的有影响力训练数据检索

Yuxi Xia, Loris Schoenegger, Benjamin Roth

机构 * Faculty of Computer Science, University of Vienna, Vienna, Austria(维也纳大学计算机科学系) UniVie Doctoral School Computer Science, Vienna, Austria(UniVie计算机科学博士学院) Faculty of Philological and Cultural Studies, University of Vienna, Vienna, Austria(维也纳大学语言与文化研究系)

专题命中 视觉问答 :grounding(abstract)

AI总结 TracVC通过追踪训练数据来解释LLMs表达自信心的来源,揭示了模型可能依赖无关数据模仿自信,而非真实内容基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22457 2025-12-30 cs.IR 50%

A Real-Time System to Populate FRA Form 57 from News

一种实时系统用于从新闻中填写FRA表单57

Chansong Lim, Haz Sameen Shahgir, Yue Dong, Jia Chen, Evangelos E. Papalexakis

专题命中 视觉问答 :vision language model(abstract)

AI总结 本文提出了一种实时系统,通过从新闻中提取信息来自动填写FRA表单57,解决了表单复杂性和新闻噪声问题。

Comments to be published in WSDM 2026 Demonstration

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10440 2025-12-12 cs.CL 50%

Enhancing Next-Generation Language Models with Knowledge Graphs: Extending Claude, Mistral IA, and GPT-4 via KG-BERT

通过知识图谱增强下一代语言模型:通过KG-BERT扩展Claude、Mistral IA和GPT-4

Nour El Houda Ben Chaabene, Hamza Hammami

机构 * STIH Laboratory, Sorbonne University(索邦大学STIH实验室) National Engineering School of Tunis(突尼斯国家工程学院) Faculty of Sciences of Tunis(突尼斯科学学院)

专题命中 视觉问答 :grounding(abstract)

AI总结 通过KG-BERT将知识图谱与Claude、Mistral IA和GPT-4结合,提升其事实可靠性与上下文感知能力。

Comments This paper was accepted and scheduled for inclusion in the ICALT 2025 proceedings but was ultimately not published due to absence from the conference presentation. It appears in the official program booklet. Conference: 2025 IEEE International Conference on Advanced Learning Technologies (ICALT)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08944 2025-12-11 cs.CL 50%

Enhancing Reliability across Short and Long-Form QA via Reinforcement Learning

通过强化学习提升短篇和长篇问答的可靠性

Yudong Wang, Zhe Yang, Wenhan Ma, Zhifang Sui, Liang Zhao

机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(多媒体信息处理国家重点实验室,计算机学院,北京大学)

专题命中 视觉问答 :grounding(abstract)

AI总结 本研究通过强化学习框架减少短篇和长篇问答中的幻觉问题,提升模型可靠性与事实可信度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22141 2025-12-01 cs.CL 50%

Bridging the Modality Gap by Similarity Standardization with Pseudo-Positive Samples

通过伪正样本进行相似性标准化以弥合模态差距

Shuhei Yamashita, Daiki Shirafuji, Tatsuhiko Saito

机构 * Mitsubishi Electric Corporation(三菱电机公司)

专题命中 视觉问答 :vision-language model(abstract)

AI总结 通过伪正样本进行相似性标准化,有效弥合跨模态检索中的模态差距,提升检索性能。

Comments Accepted to PACLIC2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20940 2025-11-27 cs.CL 50%

Chatty-KG: A Multi-Agent AI System for On-Demand Conversational Question Answering over Knowledge Graphs

Chatty-KG:一种用于基于知识图谱的按需对话问答的多智能体AI系统

Reham Omar, Abdelghny Orogat, Ibrahim Abdelaziz, Omij Mangukiya, Panos Kalnis, Essam Mansour

机构 * Concordia University(康科德大学) IBM Research(IBM研究院)

专题命中 视觉问答 :grounding(abstract)

AI总结 Chatty-KG通过多智能体系统实现基于知识图谱的对话问答,结合RAG检索与结构化执行,提升多轮问答的准确性和效率。

Comments This paper is accepted to SIGMOD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20227 2025-11-26 cs.IR 50%

HKRAG: Holistic Knowledge Retrieval-Augmented Generation Over Visually-Rich Documents

HKRAG:面向视觉丰富文档的综合知识检索增强生成

Anyang Tong, Xiang Niu, ZhiPing Liu, Chang Tian, Yanyan Wei, Zenglin Shi, Meng Wang

专题命中 视觉问答 :visual question answering(abstract)

AI总结 HKRAG通过综合检索和生成机制,提升视觉丰富文档中显著与细节知识的检索与生成能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20086 2025-11-26 cs.CL 50%

More Bias, Less Bias: BiasPrompting for Enhanced Multiple-Choice Question Answering

更多偏见,更少偏见:用于增强多项选择题回答的BiasPrompting

Duc Anh Vu, Thong Nguyen, Cong-Duy Nguyen, Viet Anh Nguyen, Anh Tuan Luu

机构 * Nanyang Techonological University(南洋理工大学) National University of Singapore(国立新加坡大学) Centre for AI research, VinUniversity(Vin大学人工智能研究中心)

专题命中 视觉问答 :grounding(abstract)

AI总结 BiasPrompting通过引导LLMs生成并评估所有可能答案的推理过程,提升多项选择题回答的推理能力,尤其在复杂问题中表现优异。

Comments Accepted at the 41st ACM/SIGAPP Symposium On Applied Computing (SAC 2026), Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08039 2025-11-05 cs.SD cs.CL cs.MM eess.AS 50%

Audio-Thinker: Guiding Audio Language Model When and How to Think via Reinforcement Learning

Shu Wu, Chenxing Li, Wenfu Wang, Hao Zhang, Hualei Wang, Meng Yu, Dong Yu

专题命中 视觉问答 :multimodal large language model(abstract)

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03659 2025-11-04 cs.CL 50%

Trustworthy Medical Question Answering: An Evaluation-Centric Survey

Yinuo Wang, Baiyang Wang, Robert E. Mercer, Frank Rudzicz, Sudipta Singha Roy, Pengjie Ren, Zhumin Chen, Xindi Wang

机构 * Shandong University(山东大学) University of Western Ontario(西方大学) Dalhousie University(达尔豪斯大学) University of Toronto(多伦多大学)

专题命中 视觉问答 :grounding(abstract)

Comments accepted to EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09266 2025-10-13 cs.CL 50%

CFVBench: A Comprehensive Video Benchmark for Fine-grained Multimodal Retrieval-Augmented Generation

Kaiwen Wei, Xiao Liu, Jie Zhang, Zijian Wang, Ruida Liu, Yuming Yang, Xin Xiao, Xiao Sun, Haoyang Zeng, Changzai Pan, Yidan Zhang, Jiang Zhong, Peijin Wang, Yingchao Feng

机构 * Chongqing University(重庆大学) Independent Researcher(独立研究者) University of the Chinese Academy of Sciences(中国科学院大学) Aerospace Information Research Institute, Chinese Academy of Sciences(中国科学院航天信息研究所)

专题命中 视觉问答 :multimodal large language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07881 2025-10-10 cs.CL 50%

CS3-Bench: Evaluating and Enhancing Speech-to-Speech LLMs for Mandarin-English Code-Switching

Heyang Liu, Yuhao Wang, Ziyang Cheng, Ronghua Wu, Qunshan Gu, Yanfeng Wang, Yu Wang

机构 * Shanghai Jiao Tong University(上海交通大学) Ant Group(蚂蚁集团)

专题命中 视觉问答 :multimodal large language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00579 2025-10-06 cs.MM cs.IR 50%

MHier-RAG: Multi-Modal RAG for Visual-Rich Document Question-Answering via Hierarchical and Multi-Granularity Reasoning

Ziyu Gong, Chengcheng Mai, Yihua Huang

专题命中 视觉问答 :vision-language model(abstract)

Comments Comments: Update Title, Author, Abstract, etc

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00161 2025-10-02 cs.CL 50%

TAMA: Tool-Augmented Multimodal Agent for Procedural Activity Understanding

Kimihiro Hasegawa, Wiradee Imrattanatrai, Masaki Asada, Ken Fukuda, Teruko Mitamura

机构 * Language Technologies Institute, Carnegie Mellon University(卡内基梅隆大学语言技术研究所) National Institute of Advanced Industrial Science and Technology (AIST)(国家先进工业科学与技术研究院)

专题命中 视觉问答 :vision-language model(abstract)

Comments 21 pages. Code: https://github.com/kimihiroh/tama

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24120 2025-09-30 cs.CL 50%

EduVidQA: Generating and Evaluating Long-form Answers to Student Questions based on Lecture Videos

Sourjyadip Ray, Shubham Sharma, Somak Aditya, Pawan Goyal

机构 * Indian Institute of Technology, Kharagpur(印度理工学院,克哈格普尔) Panjab University, Chandigarh(旁遮普大学,昌迪加尔)

专题命中 视觉问答 :multimodal large language model(abstract)

Comments EMNLP 2025 (Main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20007 2025-09-25 cs.CL 50%

DiffNator: Generating Structured Explanations of Time-Series Differences

Kota Dohi, Tomoya Nishida, Harsh Purohit, Takashi Endo, Yohei Kawaguchi

机构 * Research and Development Group, Hitachi, Ltd.(日立株式会社研发部)

专题命中 视觉问答 :visual question answering(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17961 2025-09-23 cs.CL 50%

Bringing Pedagogy into Focus: Evaluating Virtual Teaching Assistants' Question-Answering in Asynchronous Learning Environments

Li Siyan, Zhen Xu, Vethavikashini Chithrra Raghuram, Xuanming Zhang, Renzhe Yu, Zhou Yu

机构 * Columbia University(哥伦比亚大学)

专题命中 视觉问答 :grounding(abstract)

Comments Accepted in EMNLP 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.13835 2025-09-19 cs.CL 50%

RAcQUEt: Unveiling the Dangers of Overlooked Referential Ambiguity in Visual LLMs

Alberto Testoni, Barbara Plank, Raquel Fernández

机构 * Amsterdam UMC, Department of Medical Informatics(阿姆斯特丹大学医学中心,医学信息学系) Center for Information and Language Processing, LMU Munich(信息与语言处理中心,慕尼黑大学) Munich Center for Machine Learning (MCML), Munich(慕尼黑机器学习中心(MCML)) Institute for Logic, Language and Computation (ILLC), University of Amsterdam(逻辑、语言与计算研究所(ILLC),阿姆斯特丹大学)

专题命中 视觉问答 :grounding(abstract)

Comments Accepted to EMNLP 2025 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17471 2025-09-10 cs.CL 50%

FinRAGBench-V: A Benchmark for Multimodal RAG with Visual Citation in the Financial Domain

Suifeng Zhao, Zhuoran Jin, Sujian Li, Jun Gao

机构 * Key Laboratory of High Confidence Software Technologies, CS, Peking University, China(北京大学高可信软件技术重点实验室) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) State Key Laboratory of Multimedia Information Processing, School of Computer Sciences, Peking University(北京大学多媒体信息处理国家重点实验室)

专题命中 视觉问答 :multimodal large language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.19357 2025-08-28 cs.CL 50%

Context-Adaptive Synthesis and Compression for Enhanced Retrieval-Augmented Generation in Complex Domains

Peiran Zhou, Junnan Zhu, Yichen Shen, Ruoxi Yu

机构 * Kunming Medical University(昆明医科大学)

专题命中 视觉问答 :grounding(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18661 2025-08-27 cs.IR 50%

Extracting Information from Scientific Literature via Visual Table Question Answering Models

Dongyoun Kim, Hyung-do Choi, Youngsun Jang, John Kim

专题命中 视觉问答 :visual question answering(abstract)

Comments Accepted at ACM International Conference on Research in Adaptive and Convergent Systems, November 5-8, 2024, Pompei, Italy

Journal ref Proceedings of the ACM International Conference on Research in Adaptive and Convergent Systems (RACS 24), November 5-8, 2024, Pompei, Italy. ACM

详情

展开后加载摘要…

URL PDF HTML 收藏