What's in a Question: Using Visual Questions as a Form of Supervision
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV
Comments CVPR 2017 Spotlight paper and supplementary
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV
Comments CVPR 2017 Spotlight paper and supplementary
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV
Comments Bachelor thesis report graded with A with honours at ETSETB Telecom BCN school, Universitat Politècnica de Catalunya (UPC). June 2016. Source code and models are publicly available at http://imatge-upc.github.io/vqa-2016-cvprw/
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV
Comments accepted at BMVC 2016
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV
专题命中 视觉问答 :grounding(abstract);分类 cs.AI
Comments Extended version of RR'16 paper, to appear
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV
Comments in Scene Understanding Workshop (SUNw) in CVPR 2016
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV
Comments Accepted to IEEE Conf. Computer Vision and Pattern Recognition 2016. Fixed title
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV
HybridRAG-BN:面向孟加拉语知识库问答的带微调验证的检索增强框架
专题命中 视觉问答 :grounding(abstract)
AI总结 针对孟加拉语KBQA的低资源挑战,提出HybridRAG-BN框架,整合混合检索、答案生成与LoRA微调的验证模块,经实验获竞赛双排行榜第一。
Comments Developed for the IEEE Computer Society CUET Student Branch
HC-RAG:面向异构金融文件的以证据为中心的检索增强生成
机构 * Sun Yat-sen University(中山大学) ; Central South University(中南大学)
专题命中 视觉问答 :grounding(abstract)
AI总结 HC-RAG是面向异构金融文件的以证据为中心的分层跨模态RAG框架,通过构建类型化金融证据图、按意图路由证据,在金融问答基准上较RAPTOR、GraphRAG取得显著性能提升。
Comments 16 pages, 5 figures
ConRub-Med:面向开放式医学问答的共识准则强化学习
专题命中 视觉问答 :grounding(abstract)
AI总结 本研究提出ConRub-Med,通过三模型共识准则与三状态评分优化GRPO策略,在9个医学问答基准中6个排第一,HealthBench-Hard得分优于InfiMed-ORBIT。
NeSy-RAG:用于可解释问答的神经符号检索增强生成框架
机构 * Heidelberg University(海德堡大学)
专题命中 视觉问答 :grounding(abstract)
AI总结 NeSy-RAG是一种模块化神经符号RAG框架,可生成透明推理轨迹,在ShARC基准上以61.1%的准确率优于同模型RAG基线,实现可解释问答。
面向延迟约束多模态令牌通信的几何跨模态令牌选择
专题命中 视觉问答 :visual question answering(abstract)
AI总结 该研究针对延迟约束多模态令牌通信问题,提出基于几何的跨模态令牌选择框架及IBS、R-IBS策略,在VQA和AVQA任务上实现了显著的准确率提升。
多模态和图增强的检索增强生成(RAG)何时有用?文档问答的对照评估
专题命中 视觉问答 :visual question answering(abstract)
AI总结 研究文档问答中多模态和图增强RAG的作用,提出用多模态图-RAG架构,通过独立检索并融合文本、图和视觉证据源来评估效果。经实验发现其价值取决于多种因素,如检索设计等,还揭示了一些相关问题,如图像检索及生成器效率对结果的影响。
Comments 8 pages, 3 figures
CoTu在EXACT 2026中的应用:用于透明教育问答的神经符号推理
机构 * Can Tho University(芹苴大学) ; Tay Do University(西原大学)
专题命中 视觉问答 :grounding(abstract)
AI总结 EXACT 2026竞赛要求用最多8B参数的自托管模型解决教育问答问题。CoTu团队开发神经符号思维程序管道,结合Z3编码、数值Python等,经答案类型路由等方法,在物理任务中获满分,决赛技术得分最高,总体第三,证明小模型也能实现可验证推理。
Comments The 2nd International XAI Challenge for Transparent Educational Question-Answering @ IEEE IJCNN 2026 Competition
RoboDesign1M:用于机器人设计理解的大规模数据集
机构 * FPT Software AI Center(FPT软件人工智能中心) ; University of Liverpool(利物浦大学) ; University of Information Technology(信息技术大学) ; Automation & Control Institute(自动化与控制研究所) ; Department of Creative Informatics(创意信息系) ; Faculty of Environment and Information Studies(环境与信息科学系)
专题命中 视觉问答 :visual question answering(abstract)
AI总结 针对机器人设计领域缺乏大规模数据集的问题,介绍了含100万个样本的RoboDesign1M数据集,提出半自动数据收集管道,经多项实验评估,该数据集可推动机器人设计理解研究及相关自动化发展。
Comments 8 pages, accepted to IROS 2026
面向富含图表的技术会议视频的问答
专题命中 视觉问答 :grounding(abstract)
AI总结 研究面向富含图表的技术会议视频的问答问题,核心方法是开发基于大语言模型的多模态问答系统LMVQA,主要贡献是显著提高答案准确性,降低响应时间和成本,获领域专家认可。
Comments Accepted for publication in ICSME 2026
问答中自适应检索与推理的可解释不确定性
专题命中 视觉问答 :grounding(abstract)
AI总结 研究针对问答中大型语言模型的问题,提出基于LLM内部表示显式信号的不确定性感知框架,区分知识不足与模糊冲突,能在单次前向传播中估计,指导系统行为,为检索和推理策略提供透明实用替代方案。
Comments 2 pages, 1 figure
TACO:面向智能体工具使用的工具增强信用优化
专题命中 视觉问答 :visual question answering(abstract)
AI总结 提出TACO方法,通过差分答案探针奖励和结果门控优势路由,为代码工具智能体提供无监督工具贡献信用分配,提升多模态问答准确性并减少冗余工具调用。
KBQA-R1:强化大语言模型用于知识库问答
机构 * University of Science and Technology of China(中国科学技术大学)
专题命中 视觉问答 :grounding(abstract)
AI总结 提出KBQA-R1框架,通过强化学习(GRPO)将知识库问答建模为多轮决策过程,并引入参考拒绝采样(RRS)解决冷启动问题,在多个基准上取得最优性能。
Comments ICML 2026
BioHarness:面向生物医学问答的底物感知证据组装——跨文献、知识库和生物图谱
专题命中 视觉问答 :grounding(abstract)
AI总结 提出BioHarness,通过级联控制机制在文献检索、知识库和生物图谱间选择性组装证据,提升生物医学问答准确率,在19,302个问答项上得分从65.9提升至71.0。
Comments 14 Pages, 11 Figures, Keywords: biomedical question answering; retrieval-augmented generation; large language models; evidence assembly; biomedical knowledge bases; biological atlases
CacheWeaver:面向高效接地RAG推理的缓存感知证据排序
机构 * Heinz College of Information Systems and Public Policy, Carnegie Mellon University(卡内基梅隆大学海因茨信息系统与公共政策学院)
专题命中 视觉问答 :grounding(abstract)
AI总结 提出CacheWeaver,一种轻量级提示层方法,通过缓存感知的证据排序降低RAG推理的首令牌延迟,无需修改服务引擎或证据集。
ICBCBench:面向金融深度研究的行业联盟基准
专题命中 视觉问答 :grounding(abstract)
AI总结 针对金融领域深度研究代理评估标准缺失的问题,提出ICBCBench基准,采用客观任务与主观报告评估双轨范式,揭示当前模型在复杂推理、事实依据和报告质量上的显著差距。
Comments 33 pages, 14 figures. Preprint. Under review
miniReranker: 通过视觉缓存重用和交互稀疏性实现高效多模态重排序
专题命中 视觉问答 :multimodal large language model(abstract)
AI总结 提出miniReranker,通过视觉优先格式、早期退出、窄交互带和嵌入器引导剪枝,将重排序运行时间降至密集实现的1%以下,同时保持96%以上的性能。
自动驾驶谈判者:一个在隐藏意图下进行社会谈判和心理理论的交互式可验证基准
机构 * Owl Autonomous Imaging, Inc(Owl 自动成像公司)
专题命中 视觉问答 :visual question answering(abstract)
AI总结 提出一个文本多轮程序化生成环境,用于衡量自动驾驶中基于隐藏意图推断的隐式社会协调能力,通过特权模拟器状态计算奖励和诊断,当前最佳模型平均成功率仅0.68。
EverydayGPT: 用于高效安全混合GPT-RAG对话问答的置信门控路由
机构 * Dr. A.P.J. Abdul Kalam Technical University(阿卜杜尔·卡拉姆技术大学)
专题命中 视觉问答 :grounding(abstract)
AI总结 提出置信门控路由机制,通过联合策略决定检索与生成路径,使85%的查询使用快速RAG提取,延迟降低120倍以上,同时保持答案质量。
Comments 12 pages, 10 figures, 6 tables. Code and evaluation scripts available at: https://github.com/merciless-admiral-3083/EverydayGPT. This paper studies routing strategies for hybrid GPT-RAG systems under resource constraints, focusing on efficiency-safety tradeoffs rather than state-of-the-art accuracy