Modern Question Answering Datasets and Benchmarks: A Survey
专题命中 视觉问答 :visual question answering(abstract)
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
专题命中 视觉问答 :visual question answering(abstract)
专题命中 视觉问答 :visual question answering(abstract)
Comments 14 pages, 11 figures
专题命中 视觉问答 :visual question answering(abstract)
Comments 5 pages, 4 figures
专题命中 视觉问答 :visual question answering(abstract)
Comments accepted at EMNLP 2021
专题命中 视觉问答 :visual question answering(abstract)
Comments Accepted by ACL2021 main conference
专题命中 视觉问答 :visual question answering(abstract)
专题命中 视觉问答 :visual question answering(abstract)
Comments Accepted to NLP Beyond Text workshop, EMNLP 2020
专题命中 视觉问答 :visual question answering(abstract)
Comments To be published on Proceedings of the ACM on Human-Computer Interaction, Vol. 4, No. CSCW2, Article 149. Publication date: October 2020
专题命中 视觉问答 :visual question answering(abstract)
Comments Accepted in ECAI-2020, 8 pages, 6 tables, 6 figures
专题命中 视觉问答 :visual question answering(abstract)
Comments To appear at The Prague Bulletin of Mathematical Linguistics 111
专题命中 视觉问答 :visual question answering(abstract)
专题命中 视觉问答 :visual question answering(abstract)
Comments Submitted to ICLR Workshop 2017
Immuno-VLM:通过生成式语义抗体实现大型视觉-语言模型的开放世界可信赖性
机构 * School of Software Engineering, Huazhong University of Science and Technology(华中科技大学软件学院) ; Nanyang Technological University, Singapore(新加坡南洋理工大学) ; Nanjing University(南京大学)
专题命中 视觉推理 :VLM(title,title_cn);vision-language model(title,abstract);分类 cs.CV
AI总结 针对大型视觉-语言模型在开放世界部署中因缺乏负面知识而将未知异常高置信度误分类为已知类别的“语义傲慢”问题,提出受生物免疫负选择启发的Immuno-VLM框架,利用大语言模型的生成推理主动产生“语义抗体”(近分布异常文本描述)来约束已知类决策空间,在ImageNet-1K和四个OOD基准上达到新最优。
Comments Accepted by ICML 2026
N3D-VLM:原生3D接地使视觉-语言模型在3D场景中实现精确的空间推理
机构 * HKUST(香港科技大学) ; Tencent AI Lab(腾讯AI实验室) ; CUHK(香港中文大学) ; ZJU(浙江大学) ; NJU(南京大学)
专题命中 视觉推理 :VLM(title,abstract);vision-language model(title,abstract);grounding(title,abstract);visual reasoning(abstract)
AI总结 N3D-VLM通过原生3D感知能力提升视觉-语言模型在3D场景中的空间推理精度与解释性。
Comments Project Page: https://n3d-vlm.github.io
金点狙击手:VLM中的自引导视觉推理用于细粒度动作理解
机构 * Beijing National Research Center for Information Science and Technology (BNRist), Department of Automation, Tsinghua University(清华大学自动化系北京信息科学与技术国家研究中心) ; State Key Laboratory of General Artificial Intelligence, Beijing Institute for General Artificial Intelligence (BIGAI)(北京通用人工智能研究院通用人工智能国家重点实验室)
专题命中 视觉推理 :VLM(title,title_cn);visual reasoning(title);vision-language model(abstract);分类 cs.CV、cs.AI
AI总结 提出金点狙击手框架,通过金点提取器、选择性苏格拉底提问器和语义蕴含评估器三个模块,增强轻量级VLM的细粒度人类动作理解能力,在CAP基准上达到接近GPT-4o的性能且事实准确性更优。
用于鲁棒跨数据集图像分类的MLLM路由异质集成模型
机构 * The Bredesen Center for Interdisciplinary Research and Graduate Education(布雷德森跨学科研究与研究生教育中心) ; University of Tennessee Knoxville(田纳西大学诺克斯维尔分校)
专题命中 视觉推理 :MLLM(title,title_cn);vision-language model(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 该研究针对跨数据集图像分类泛化难题,提出ARMDIL模型,通过MLLM智能体动态路由图像到适配的视觉骨干,兼具竞争力、高适应性与可解释性,为通用视觉系统奠定基础。
Comments 8 pages, 4 figures, 7 tables
自问式视觉语言模型:用于组合视觉推理的强化学习
机构 * Massachusetts Institute of Technology(麻省理工学院)
专题命中 视觉推理 :VLM(summary_cn,abstract);vision-language model(title,abstract);visual reasoning(title,abstract);分类 cs.CV
AI总结 提出自问式框架,通过GRPO强化学习训练VLM自动分解问题并回答子问题,提升组合视觉推理能力,在CLEVR和A-OKVQA上验证有效性。
推进基于多模态大语言模型(MLLM)的无人机(UAV)图像理解与推理:基准测试及无训练多智能体系统
机构 * Fudan University(复旦大学) ; College of Future Information Technology(未来信息技术学院) ; Shanghai Innovation Institute(上海创新研究院) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; The Chinese University of Hong Kong(香港中文大学)
专题命中 视觉推理 :MLLM(title,title_cn);grounding(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI
AI总结 本研究构建UAVQA-Bench基准,识别MLLM用于无人机图像理解的三类失效模式,提出含DSPE、CAIR、DAAS的无训练多智能体系统UAV-MAS,其32B版本在基准上准确率超Gemini 3 Pro 4.0个百分点
GHR-VLM:通过基于视觉基础的混合推理实现零样本公交视频分析
机构 * Rensselaer Polytechnic Institute(伦斯勒理工学院)
专题命中 视觉推理 :VLM(title,title_cn);vision-language model(abstract);grounding(abstract);分类 cs.CV、cs.AI
AI总结 研究旨在实现零样本公交视频分析,提出GHR-VLM框架,利用边缘-云设计,通过轻量级边缘监视器跟踪门状态、分割乘客片段,后端VLM经两阶段细化识别乘客与支付行为,减少云推理,评估显示其在公交支付分析中有潜力且面临视频条件挑战。
VectraYX-Vision-1B:一款具备结构化视觉推理与原生工具使用能力的20亿参数以下西班牙语/拉丁美洲网络安全多模态模型
专题命中 视觉推理 :vision-language model(title,abstract);visual reasoning(title);VLM(abstract,abstract_cn);LLaVA(abstract,abstract_cn)
AI总结 本研究推出VectraYX-Vision-1B,一款20亿参数以下西班牙语/拉丁美洲网络安全多模态模型,支持结构化推理与工具调用,针对网络UI优化,同时报告了其视觉定位的负面结果及相关修复方案,开源了模型与数据。
Comments 11 pages, 1 figure
基于VLM的方法用于机器人科学实验室中的视觉异常检测
机构 * Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) ; School of Physics and Electronic Information, Yantai University(烟台大学物理与电子信息学院) ; School of Computer and Big Data, Fuzhou University(福州大学计算机与大数据学院) ; Department of Automation, Shanghai Jiao Tong University(上海交通大学自动化系)
专题命中 视觉推理 :VLM(title,title_cn);vision-language model(abstract);visual reasoning(abstract);分类 cs.CV
AI总结 本文提出基于VLM的视觉推理方法,通过四个逐步信息提示配置实现多级监督,构建了专用视觉基准以评估其在科学流程异常检测中的有效性,实验表明提供更多上下文信息可提升检测准确率。
VisDoT : 通过类人解释 grounding 和思维分解增强视觉推理
机构 * Department of Computer Science and Artificial Intelligence, Dongguk University(东国大学计算机科学与人工智能系) ; Department of Electronics and Electrical Engineering, Dongguk University(东国大学电子与电气工程系)
专题命中 视觉推理 :visual reasoning(title,abstract);grounding(title,abstract);vision-language model(abstract);InternVL(abstract)
AI总结 VisDoT 通过类人解释 grounding 和思维分解提升视觉推理,显著提升图表问答和开放领域视觉问答性能。
Comments 30 pages, 21 figures, EACL 2026 Findings
零样本长时程灵巧操作:基于多视图3D接地VLM推理
机构 * Seoul National University(首尔国立大学)
专题命中 视觉推理 :VLM(title,title_cn);vision-language model(abstract);grounding(abstract)
AI总结 提出零样本框架,利用多视图RGB图像通过VLM生成3D任务规划,结合三角测量和射线投票实现精确3D接地,支持抓取和工具使用,在真实实验中优于基线方法。
聚焦推理,推断出异常:通过贝叶斯推理引导的聚焦VLM推理实现高速公路视频远场异常检测
机构 * School of Computer Science and Technology, Beijing Jiaotong University(北京交通大学计算机科学与技术学院) ; Key Laboratory of Big Data & Artificial Intelligence in Transportation, Ministry of Education(教育部交通运输大数据与人工智能重点实验室) ; Beijing Key Laboratory of Traffic Data Mining and Embodied Intelligence (2018)(北京市交通数据挖掘与具身智能重点实验室)
专题命中 视觉推理 :VLM(title,title_cn);vision-language model(abstract);分类 cs.CV、cs.AI
AI总结 本文提出VIBES框架,通过贝叶斯推理引导的聚焦VLM推理,解决远场目标异常检测中的注意力稀释和计算成本问题,提升检测准确性和实时效率。
回答前分割:用于多模态大语言模型视觉推理的像素定位
专题命中 视觉推理 :grounding(title,abstract);visual reasoning(title);MLLM(title);multimodal large language model(abstract)
AI总结 本文针对多模态大语言模型视觉推理,提出SegAnswer方法,将放大单元从边界框转为像素级分割掩码,能精准定位感兴趣区域,过滤冗余信息,与视觉令牌构建方式更契合,经多基准测试验证了其在像素定位及分割任务上的性能。
从演示到奖励:VLM奖励模型的测试时提示优化
机构 * University of Amsterdam(阿姆斯特丹大学) ; Catholic University of Leuven(鲁汶天主大学) ; Toyota Research Institute(丰田研究院) ; Toyota Motor Europe(丰田欧洲公司)
专题命中 视觉推理 :VLM(title,title_cn);vision-language model(abstract);分类 cs.AI、cs.LG
AI总结 提出Demo2Reward方法,利用少量专家演示在测试时优化VLM奖励模型的提示指令,减少假阳性并保持真阳性,无需额外训练即可提升下游策略学习。
衡量跨模态协同:VLM可解释性的一个基准
机构 * University of Luxembourg(卢森堡大学) ; Luxembourg Institute of Health (LIH)(卢森堡健康研究院)
专题命中 视觉推理 :VLM(title,title_cn);vision-language model(abstract);分类 cs.AI、cs.LG
AI总结 本文提出Synergistic Faithfulness作为衡量VLM跨模态协同的指标,解决了传统单模态评估方法在评估VLM可解释性时的不足,通过引入Shapley交互指数,实现了对多模态协同的准确评估,同时提升了计算效率。
看得更远,想得更深:通过低级视觉线索和反思提升VLM的推理能力
机构 * Baidu Inc.(百度公司) ; Zhejiang University(浙江大学) ; Harbin Institute of Technology(哈尔滨工业大学)
专题命中 视觉推理 :VLM(title,title_cn);grounding(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV、cs.AI
AI总结 本文提出ForeSight框架,通过低级视觉线索和有效视觉反馈提升VLM推理能力,构建新数据集CG-SalBench,并验证其在参数规模相同和部分指标上优于现有SOTA模型。
Comments CVPR2026
视觉语言模型中的感知带宽瓶颈:通过顺序实验设计实现主动视觉推理
机构 * The Hong Kong University of Science(香港科学与技术大学) ; University College London, London, United Kingdom(伦敦大学学院, 英国伦敦) ; ShanghaiTech University, Shanghai, China(上海科技大学, 中国上海) ; AI Lab, The Yangtze River Delta, China(人工智能实验室, 长江三角洲, 中国)
专题命中 视觉推理 :vision-language model(title,abstract);visual reasoning(title,abstract);VLM(abstract,abstract_cn);分类 cs.CV、cs.AI、cs.LG
AI总结 本文提出通过顺序贝叶斯最优实验设计实现主动视觉推理,解决视觉语言模型中感知带宽瓶颈问题,提升高分辨率视觉推理能力。
Comments 27 pages, 5 figures, accepted at ICML 2026
专题命中 视觉推理 :vision-language model(title,abstract);visual reasoning(title,abstract);VLM(abstract);visual question answering(abstract)
Comments 21 pages