arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 3129 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 3129 篇

1704.03895 2017-04-14 cs.CV 57%

What's in a Question: Using Visual Questions as a Form of Supervision

Siddha Ganju, Olga Russakovsky, Abhinav Gupta

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

Comments CVPR 2017 Spotlight paper and supplementary

详情

展开后加载摘要…

URL PDF HTML 收藏
1611.00471 2017-03-22 cs.CV 57%

Dual Attention Networks for Multimodal Reasoning and Matching

Hyeonseob Nam, Jung-Woo Ha, Jeonghee Kim

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
1612.05386 2016-12-19 cs.CV 57%

The VQA-Machine: Learning How to Use Existing Vision Algorithms to Answer New Questions

Peng Wang, Qi Wu, Chunhua Shen, Anton van den Hengel

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
1610.02692 2016-10-11 cs.CL cs.CV cs.MM 57%

Open-Ended Visual Question-Answering

Issey Masuda, Santiago Pascual de la Puente, Xavier Giro-i-Nieto

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

Comments Bachelor thesis report graded with A with honours at ETSETB Telecom BCN school, Universitat Politècnica de Catalunya (UPC). June 2016. Source code and models are publicly available at http://imatge-upc.github.io/vqa-2016-cvprw/

详情

展开后加载摘要…

URL PDF HTML 收藏
1606.03647 2016-10-03 cs.CV 57%

Training Recurrent Answering Units with Joint Loss Minimization for VQA

Hyeonwoo Noh, Bohyung Han

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
1608.03410 2016-08-12 cs.CV 57%

Solving Visual Madlibs with Multiple Cues

Tatiana Tommasi, Arun Mallya, Bryan Plummer, Svetlana Lazebnik, Alexander C. Berg, Tamara L. Berg

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

Comments accepted at BMVC 2016

详情

展开后加载摘要…

URL PDF HTML 收藏
1604.04808 2016-07-29 cs.CV 57%

Learning Models for Actions and Person-Object Interactions with Transfer to Question Answering

Arun Mallya, Svetlana Lazebnik

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
1604.06770 2016-07-26 cs.DB cs.AI 57%

A Hybrid Approach to Query Answering under Expressive Datalog+/-

Mostafa Milani, Andrea Cali, Leopoldo Bertossi

专题命中 视觉问答 :grounding(abstract);分类 cs.AI

Comments Extended version of RR'16 paper, to appear

详情

展开后加载摘要…

URL PDF HTML 收藏
1607.02769 2016-07-12 cs.CV cs.CL 57%

Annotation Methodologies for Vision and Language Dataset Creation

Gitit Kehat, James Pustejovsky

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

Comments in Scene Understanding Workshop (SUNw) in CVPR 2016

详情

展开后加载摘要…

URL PDF HTML 收藏
1506.01144 2016-04-29 cs.CV 57%

What value do explicit high level concepts have in vision to language problems?

Qi Wu, Chunhua Shen, Lingqiao Liu, Anthony Dick, Anton van den Hengel

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

Comments Accepted to IEEE Conf. Computer Vision and Pattern Recognition 2016. Fixed title

详情

展开后加载摘要…

URL PDF HTML 收藏
1603.01417 2016-03-07 cs.NE cs.CL cs.CV 57%

Dynamic Memory Networks for Visual and Textual Question Answering

Caiming Xiong, Stephen Merity, Richard Socher

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
1512.03460 2015-12-14 cs.CV cs.CL cs.RO 57%

Neural Self Talk: Image Understanding via Continuous Questioning and Answering

Yezhou Yang, Yi Li, Cornelia Fermuller, Yiannis Aloimonos

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13004 2026-08-14 cs.CL cs.IR 新提交 50%

HybridRAG-BN: A Retrieval-Augmented Framework with Fine-Tuned Verification for Bangla KBQA

HybridRAG-BN:面向孟加拉语知识库问答的带微调验证的检索增强框架

Rathijit Aich, Nirjhar Das, Mahfuzulhoq Chowdhury

专题命中 视觉问答 :grounding(abstract)

AI总结 针对孟加拉语KBQA的低资源挑战,提出HybridRAG-BN框架,整合混合检索、答案生成与LoRA微调的验证模块,经实验获竞赛双排行榜第一。

Comments Developed for the IEEE Computer Society CUET Student Branch

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12335 2026-08-14 cs.CL cs.MM 新提交 50%

HC-RAG: Evidence-Centric Retrieval-Augmented Generation over Heterogeneous Financial Filings

HC-RAG:面向异构金融文件的以证据为中心的检索增强生成

Siyuan Chen, Huaye Tan, You Li, Jiajun Liang

机构 * Sun Yat-sen University(中山大学) Central South University(中南大学)

专题命中 视觉问答 :grounding(abstract)

AI总结 HC-RAG是面向异构金融文件的以证据为中心的分层跨模态RAG框架,通过构建类型化金融证据图、按意图路由证据,在金融问答基准上较RAPTOR、GraphRAG取得显著性能提升。

Comments 16 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10996 2026-08-12 cs.CL 新提交 50%

ConRub-Med: Reinforcement Learning with Consensus Rubrics for Open-Ended Medical Question Answering

ConRub-Med:面向开放式医学问答的共识准则强化学习

Taojie Zhu, Yuan Xia, Tao Sun, Yizhi Wang, Yan Chen, Qunshan He, Tian Guan, Jian Wang, Jinjie Gu, Junwei Liu, Yonghong He

专题命中 视觉问答 :grounding(abstract)

AI总结 本研究提出ConRub-Med,通过三模型共识准则与三状态评分优化GRPO策略,在9个医学问答基准中6个排第一,HealthBench-Hard得分优于InfiMed-ORBIT。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06292 2026-08-07 cs.CL cs.SC 新提交 50%

NeSy-RAG: Neuro-Symbolic RAG for Explainable Question Answering

NeSy-RAG:用于可解释问答的神经符号检索增强生成框架

Jonas Gann, Michael Gertz

机构 * Heidelberg University(海德堡大学)

专题命中 视觉问答 :grounding(abstract)

AI总结 NeSy-RAG是一种模块化神经符号RAG框架,可生成透明推理轨迹,在ShARC基准上以61.1%的准确率优于同模型RAG基线,实现可解释问答。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03141 2026-08-05 eess.SP 新提交 50%

Geometric Cross-Modal Token Selection for Latency-Constrained Multimodal Token Communication

面向延迟约束多模态令牌通信的几何跨模态令牌选择

Joohyuk Park, Junyong Shin, Yongjeong Oh, Jihong Park, Yo-Seb Jeon

专题命中 视觉问答 :visual question answering(abstract)

AI总结 该研究针对延迟约束多模态令牌通信问题,提出基于几何的跨模态令牌选择框架及IBS、R-IBS策略,在VQA和AVQA任务上实现了显著的准确率提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16604 2026-07-21 eess.IV 新提交 50%

When Do Multimodal and Graph-Augmented RAG Help? A Controlled Evaluation for Document Question Answering

多模态和图增强的检索增强生成(RAG)何时有用?文档问答的对照评估

Sokipriala Jonah

专题命中 视觉问答 :visual question answering(abstract)

AI总结 研究文档问答中多模态和图增强RAG的作用,提出用多模态图-RAG架构,通过独立检索并融合文本、图和视觉证据源来评估效果。经实验发现其价值取决于多种因素,如检索设计等,还揭示了一些相关问题,如图像检索及生成器效率对结果的影响。

Comments 8 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14735 2026-07-17 cs.CL 新提交 50%

CoTu at EXACT 2026: Neuro-Symbolic Reasoning for Transparent Educational QA

CoTu在EXACT 2026中的应用:用于透明教育问答的神经符号推理

Quoc-Khang Tran, Minh-Thien Nguyen, Phu-An Thai, Xuan-Tung Bui, Truong-Thanh Ma, Nguyen-Khang Pham

机构 * Can Tho University(芹苴大学) Tay Do University(西原大学)

专题命中 视觉问答 :grounding(abstract)

AI总结 EXACT 2026竞赛要求用最多8B参数的自托管模型解决教育问答问题。CoTu团队开发神经符号思维程序管道,结合Z3编码、数值Python等,经答案类型路由等方法,在物理任务中获满分,决赛技术得分最高,总体第三,证明小模型也能实现可验证推理。

Comments The 2nd International XAI Challenge for Transparent Educational Question-Answering @ IEEE IJCNN 2026 Competition

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06796 2026-07-15 cs.RO 版本更新 50%

RoboDesign1M: A Large-scale Dataset for Robot Design Understanding

RoboDesign1M:用于机器人设计理解的大规模数据集

Tri Le, Toan Nguyen, Quang Tran, Quang Nguyen, Baoru Huang, Hoan Nguyen, Minh Nhat Vu, Tung D. Ta, Anh Nguyen

机构 * FPT Software AI Center(FPT软件人工智能中心) University of Liverpool(利物浦大学) University of Information Technology(信息技术大学) Automation & Control Institute(自动化与控制研究所) Department of Creative Informatics(创意信息系) Faculty of Environment and Information Studies(环境与信息科学系)

专题命中 视觉问答 :visual question answering(abstract)

AI总结 针对机器人设计领域缺乏大规模数据集的问题,介绍了含100万个样本的RoboDesign1M数据集,提出半自动数据收集管道,经多项实验评估,该数据集可推动机器人设计理解研究及相关自动化发展。

Comments 8 pages, accepted to IROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10494 2026-07-14 cs.SE 新提交 50%

Question Answering for Diagram-Rich Technical Meeting Videos

面向富含图表的技术会议视频的问答

Zhuoran Xu, Jia Li, Dayuan Tan, Mark Cole, Ish Ashraf, Sandeep Puri, Mehrdad Sabetzadeh, Shiva Nejati

专题命中 视觉问答 :grounding(abstract)

AI总结 研究面向富含图表的技术会议视频的问答问题,核心方法是开发基于大语言模型的多模态问答系统LMVQA,主要贡献是显著提高答案准确性,降低响应时间和成本,获领域专家认可。

Comments Accepted for publication in ICSME 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07380 2026-07-09 cs.IR 新提交 50%

Interpretable Uncertainty for Adaptive Retrieval and Reasoning in Question Answering

问答中自适应检索与推理的可解释不确定性

Ritajit Dey, Iadh Ounis, Graham McDonald

专题命中 视觉问答 :grounding(abstract)

AI总结 研究针对问答中大型语言模型的问题,提出基于LLM内部表示显式信号的不确定性感知框架,区分知识不足与模糊冲突,能在单次前向传播中估计,指导系统行为,为检索和推理策略提供透明实用替代方案。

Comments 2 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30251 2026-06-30 cs.MA 50%

TACO: Tool-Augmented Credit Optimization for Agentic Tool Use

TACO:面向智能体工具使用的工具增强信用优化

Mingkuan Feng, Jinyang Wu, Hao Gu, Fangrui Lv, Ruihan Jin, Chuyuan Zhang, Zhengqi Wen, Jianhua Tao

专题命中 视觉问答 :visual question answering(abstract)

AI总结 提出TACO方法,通过差分答案探针奖励和结果门控优势路由,为代码工具智能体提供无监督工具贡献信用分配,提升多模态问答准确性并减少冗余工具调用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10999 2026-06-23 cs.CL 版本更新 50%

KBQA-R1: Reinforcing Large Language Models for Knowledge Base Question Answering

KBQA-R1:强化大语言模型用于知识库问答

Xin Sun, Zhongqi Chen, Xing Zheng, Qiang Liu, Shu Wu, Bowen Song, Zilei Wang, Weiqiang Wang, Liang Wang

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 视觉问答 :grounding(abstract)

AI总结 提出KBQA-R1框架,通过强化学习(GRPO)将知识库问答建模为多轮决策过程,并引入参考拒绝采样(RRS)解决冷启动问题,在多个基准上取得最优性能。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19396 2026-06-19 q-bio.QM 新提交 50%

BioHarness: Substrate-Aware Evidence Assembly for Biomedical Question Answering across Literature, Knowledge Bases, and Biological Atlases

BioHarness:面向生物医学问答的底物感知证据组装——跨文献、知识库和生物图谱

Meng Xiao, Chuan Qin, Jinmiao Chen, Yihang Cheng, Yuanchun Zhou, Hengshu Zhu

专题命中 视觉问答 :grounding(abstract)

AI总结 提出BioHarness,通过级联控制机制在文献检索、知识库和生物图谱间选择性组装证据,提升生物医学问答准确率,在19,302个问答项上得分从65.9提升至71.0。

Comments 14 Pages, 11 Figures, Keywords: biomedical question answering; retrieval-augmented generation; large language models; evidence assembly; biomedical knowledge bases; biological atlases

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19667 2026-06-19 cs.CL 新提交 50%

CacheWeaver: Cache-Aware Evidence Ordering for Efficient Grounded RAG Inference

CacheWeaver:面向高效接地RAG推理的缓存感知证据排序

Kaizhen Tan, Rong Gu, Mingyuan Li

机构 * Heinz College of Information Systems and Public Policy, Carnegie Mellon University(卡内基梅隆大学海因茨信息系统与公共政策学院)

专题命中 视觉问答 :grounding(abstract)

AI总结 提出CacheWeaver,一种轻量级提示层方法,通过缓存感知的证据排序降低RAG推理的首令牌延迟,无需修改服务引擎或证据集。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17458 2026-06-17 cs.CE 新提交 50%

ICBCBench: An Industry Consortium Benchmark for Financial Deep Research

ICBCBench:面向金融深度研究的行业联盟基准

Weiya Li, Zhiwei Tang, Yizhou He, Chenghao Wang, Liang Feng, Xiao Sun, Dongrui Liu, Zichen Wen, Hu Wei, Jinghang Wang, Yi Luo, Li Guo, Linfeng Zhang

专题命中 视觉问答 :grounding(abstract)

AI总结 针对金融领域深度研究代理评估标准缺失的问题,提出ICBCBench基准,采用客观任务与主观报告评估双轨范式,揭示当前模型在复杂推理、事实依据和报告质量上的显著差距。

Comments 33 pages, 14 figures. Preprint. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10759 2026-06-17 cs.IR 新提交 50%

miniReranker: Efficient Multimodal Reranking through Visual Cache Reuse and Interaction Sparsity

miniReranker: 通过视觉缓存重用和交互稀疏性实现高效多模态重排序

Yingqi Fan, Xuan Lu, Anhao Zhao, Junlong Tong, Ping Nie, Kai Zou, Yunpu Ma, Wei Zhang, Xiaoyu Shen

专题命中 视觉问答 :multimodal large language model(abstract)

AI总结 提出miniReranker,通过视觉优先格式、早期退出、窄交互带和嵌入器引导剪枝,将重排序运行时间降至密集实现的1%以下,同时保持96%以上的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15139 2026-06-16 cs.GT cs.RO 新提交 50%

Self-Driving Negotiator: An interactive, verifiable benchmark for social negotiation and theory of mind under hidden intent

自动驾驶谈判者:一个在隐藏意图下进行社会谈判和心理理论的交互式可验证基准

Ashutosh Kumar

机构 * Owl Autonomous Imaging, Inc(Owl 自动成像公司)

专题命中 视觉问答 :visual question answering(abstract)

AI总结 提出一个文本多轮程序化生成环境,用于衡量自动驾驶中基于隐藏意图推断的隐式社会协调能力,通过特权模拟器状态计算奖励和诊断,当前最佳模型平均成功率仅0.68。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11212 2026-06-11 cs.CL 新提交 50%

EverydayGPT: Confidence-Gated Routing for Efficient and Safe Hybrid GPT-RAG Conversational QA

EverydayGPT: 用于高效安全混合GPT-RAG对话问答的置信门控路由

Jaspreet Singh Nahal

机构 * Dr. A.P.J. Abdul Kalam Technical University(阿卜杜尔·卡拉姆技术大学)

专题命中 视觉问答 :grounding(abstract)

AI总结 提出置信门控路由机制,通过联合策略决定检索与生成路径,使85%的查询使用快速RAG提取,延迟降低120倍以上,同时保持答案质量。

Comments 12 pages, 10 figures, 6 tables. Code and evaluation scripts available at: https://github.com/merciless-admiral-3083/EverydayGPT. This paper studies routing strategies for hybrid GPT-RAG systems under resource constraints, focusing on efficiency-safety tradeoffs rather than state-of-the-art accuracy

详情

展开后加载摘要…

URL PDF HTML 收藏