What is needed for simple spatial language capabilities in VQA?
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI、cs.LG
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI、cs.LG
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI、cs.LG
Comments ICLR 2019 (Oral). Project page: http://nscl.csail.mit.edu/
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI、cs.LG
Comments NeurIPS 2018 (spotlight). The first two authors contributed equally to this work. Project page: http://nsvqa.csail.mit.edu
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI、cs.LG
Comments Accepted by NIPS 2018; Figure 1 was updated
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI、cs.LG
Comments COLING 2018
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI、cs.LG
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI、cs.LG
Comments 8 pages, 5 figures, including appendix, NIPS 2017 Workshop on Visually-Grounded Interaction and Language (ViGIL)
专题命中 视觉问答 :grounding(abstract);分类 cs.CV、cs.AI、cs.LG
Comments 20 pages, 13 figures, Webpage: https://embodiedqa.org/
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI、cs.LG
Comments Accepted in ICCV 2017. The arxiv version has an extra analysis on correlation with human attention
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI、cs.LG
Comments 11 pages, 4 figures, 2 tables, webpage: http://visualdialog.org/
专题命中 视觉问答 :grounding(abstract);分类 cs.CV、cs.AI、cs.LG
Comments Presented in AAAI-15 Workshop: Beyond the Turing Test
V2P-Bench: 通过视觉提示评估视频语言理解以提升人机交互
机构 * University of Science and Technology of China(中国科学技术大学) ; Huawei Noah’s Ark Lab(华为诺亚实验室) ; Xi’an Jiaotong University(西安交通大学)
专题命中 视觉问答 :vision-language model(abstract);分类 cs.CV、cs.AI;VLM(comments)
AI总结 V2P-Bench通过视觉提示评估视频语言理解,提升人机交互效率与体验,揭示模型在时空理解上的不足及Hack现象。
Comments Project Page: https://vlm-reasoning.github.io/V2P-Bench/
第10届AI City挑战赛
机构 * Santa Clara University(圣克拉拉大学) ; University at Albany, SUNY(纽约州立大学奥尔巴尼分校) ; Iowa State University(爱荷华州立大学) ; Woven by Toyota(丰田编织公司) ; United Arab Emirates University(阿拉伯联合酋长国大学) ; National Yang Ming Chiao Tung University(国立阳明交通大学) ; University of Macau(澳门大学) ; North Carolina State University(北卡罗来纳州立大学) ; Columbia University(哥伦比亚大学) ; Milestone Systems(里程碑系统公司) ; Xi’an Jiaotong University(西安交通大学) ; Johns Hopkins University(约翰斯·霍普金斯大学)
专题命中 视觉问答 :grounding(abstract);分类 cs.CV、cs.AI
AI总结 本文总结了与ECCV 2026同期举办的第10届AI City挑战赛的设置、数据集、评估结果等,该赛事规模扩大,设多类赛道,成功系统结合基础模型与多种技术。
Comments Summary of the 10th AI City Challenge Workshop in conjunction with ECCV 2026
UniTraffic-Agent:面向2026年AI城市挑战赛第3赛道的统一交通视频推理,含两项域外评估
机构 * School of Computer Science and Technology, University of Chinese Academy of Sciences (UCAS)(中国科学院大学计算机科学与技术学院) ; Institute of Computing Technology (ICT), Chinese Academy of Sciences (CAS)(中国科学院计算技术研究所) ; Beijing Academy of Artificial Intelligence (BAAI)(北京智源人工智能研究院) ; School of Artificial Intelligence and Robotics, Hunan University(湖南大学人工智能与机器人学院)
专题命中 视觉问答 :multimodal large language model(abstract);分类 cs.CV、cs.AI
AI总结 UniTraffic-Agent是第10届AI城市挑战赛第3赛道的MR-CAS解决方案,采用观察-推理-行动-验证工作流,在TAR、FETV、PSI-VQA三项任务中取得相应排名,为交通视频推理提供了新方案。
Comments This paper has been accepted to ECCV 2026 AI City Challenge Workshop
JieZi:用于古文字训诂的大规模专家审核数据集与基准
机构 * South China University of Technology(华南理工大学)
专题命中 视觉问答 :multimodal large language model(abstract);分类 cs.CV、cs.AI
AI总结 本文针对古文字训诂研究缺乏结构化数据与基准的问题,提出ACCE任务,构建JieZi-Dataset与JieZi-Bench,实验发现多模态大模型在古文字训诂的高阶任务上表现不佳,微调后性能显著提升。
Comments 19 pages, 13 figures. Accepted to the Dataset Track of ACM Multimedia 2026 for oral presentation
R4DSG:面向长时序自我中心视频中以对象为中心的问答的相对4D场景图记忆
机构 * Samsung R&D Institute China - Beijing(三星中国研发研究院(北京)) ; Shanghai Jiao Tong University(上海交通大学)
专题命中 视觉问答 :grounding(abstract);分类 cs.CV、cs.AI
AI总结 该研究提出R4DSG,一种面向长时序自我中心视频的相对4D场景图记忆,在EgoLifeQA数据集的对象相关问答任务中,较EgoRAG-Text取得显著性能提升,可作为可穿戴助手等的实用记忆载体。
Comments 10 pages, 3 figures, ACM Multimedia 2026, egocentric video; 3D scene graph; temporal memory; graph retrieval; object-state reasoning; multimodal question answering
PRISM:基于结构化多模态数据合成的感知优先级的评分标准内化
专题命中 视觉问答 :MLLM(abstract_cn);分类 cs.AI、cs.LG
AI总结 该研究针对多模态指令多要求重要性不等的问题,提出PRISM四阶段数据合成框架,结合PRISM-Eval评估,提升多模态大模型的多规则优先级感知指令遵循能力。
2026年EgoVis首届EgoCross挑战赛:跨域自我中心视频问答
专题命中 视觉问答 :multimodal large language model(abstract);分类 cs.CV、cs.AI
AI总结 本文介绍2026年EgoVis研讨会举办的首届EgoCross跨域自我中心视频问答挑战赛,含两个赛道,共获1500余份提交,公布结果与获胜方案,资源公开以推进相关研究。
Comments 1st EgoCross challenge @ EgoVis workshop, CVPR26
推理前的感知:面向视频理解与问答的动态隐式推理
机构 * Rice University(莱斯大学) ; Georgia Institute of Technology(佐治亚理工学院)
专题命中 视觉问答 :grounding(abstract);分类 cs.CV、cs.AI
AI总结 该研究针对视频问答现有方法依赖长文本思维链的问题,提出DyLaR模型,通过动态调整感知与推理隐式变量的使用,在9个视频基准上提升准确率且缩短响应长度。
具备知识意识的视觉-语言基础模型用于胎儿超声解读
机构 * National Engineering Research Center for Multimedia Software, School of Computer Science, Wuhan University(国家多媒体软件工程技术研究中心,武汉大学计算机学院) ; College of Computing and Data Science, Nanyang Technological University(computing and Data Science学院,南洋理工大学)
专题命中 视觉问答 :vision-language model(abstract);分类 cs.CV、cs.AI
AI总结 FetalMind通过Salient Epistemic Disentanglement方法,提升胎儿超声解读的准确性和效率,实现多视图图像推理和疾病诊断的高效处理。
Comments KDD 2026
3DZip:面向3D视觉问答的空间感知特征多样性引导的Token压缩方法
机构 * Pusan National University(釜山国立大学)
专题命中 视觉问答 :vision-language model(abstract);分类 cs.CV、cs.LG
AI总结 本文针对3D视觉问答中Token压缩忽略空间特性的问题,提出三阶段框架3DZip,在三个基准上以128个Token保留94.7%性能、提速1.92倍,优于现有方法。
Comments Accepted to ECCV 2026. Project page: https://cvsp-lab.github.io/3DZip
Obshazard-bench:面向原始地球观测流的实时灾害情报多模态基础模型基准测试
机构 * National University of Defense Technology(国防科技大学) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; Shanghai Jiao Tong University(上海交通大学)
专题命中 视觉问答 :multimodal large language model(abstract);分类 cs.AI、cs.LG
AI总结 本研究推出Obshazard-bench基准测试,评估多模态基础模型的实时灾害情报能力,发现现有模型在将原始多通道物理观测转化为符合决策需求的灾害推理方面存在显著局限。
SAGE:面向多模态学习与幻觉分析的专家标注南亚胃肠内镜数据集
机构 * Nepal Applied Mathematics and Informatics Institute for Research(尼泊尔应用数学与信息技术研究所) ; GastroIntestinal Department, Dhulikhel Hospital(杜尔基hel医院消化内科) ; Univesity of Lausanne(洛桑大学) ; University of West Virginia(西弗吉尼亚大学) ; University of Utah(犹他大学) ; University of Aberdeen(阿伯丁大学)
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI
AI总结 为解决南亚地区胃肠癌诊断数据缺乏问题,构建了包含1300张图像、标注和问答对的SAGE数据集,并评估了模型在人口偏移下的性能下降。
手语问答:手语理解的新任务、基准与基线模型
专题命中 视觉问答 :vision-language model(abstract);分类 cs.CV、cs.AI
AI总结 该研究提出手语问答新任务,构建基于PHOENIX14T与CSL-Daily的SignQA基准,设计带特定模块的基线模型,实验显示其在各问题类别上优于代表性视觉-语言模型。
评估用于视频游戏QA中自主代理驱动的几何裁剪检测的视觉语言模型
机构 * Sony Interactive Entertainment(索尼互动娱乐)
专题命中 视觉问答 :vision-language model(abstract);分类 cs.CV、cs.AI
AI总结 研究在代理驱动游戏QA中用VLMs检测几何裁剪异常,通过自定义代理收集视觉观察,自动注释提供标签,在零样本提示下对六个VLMs基准测试,分析对提示变体的敏感性,结果显示VLMs适合作多阶段QA管道的高召回候选过滤器。
视频中的思考:视频生成器真的能对现实世界进行推理吗?
机构 * Central South University(中南大学) ; Tencent(腾讯) ; Tsinghua University(清华大学)
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI
AI总结 探讨视频生成器能否对现实世界推理,引入因果生成双判断(CGDJ)评估,发现开源模型无明确因果感知却有合理动态,先进闭源系统推理与生成一致性有限,还揭示了视听失调问题。
NLPCC 2026共享任务1概述:难度感知多语言多模态医学教学视频理解评估
机构 * School of Computer Science and Technology, Beijing Institute of Technology(北京理工大学计算机科学与工程学院) ; Department of Computing, The Hong Kong Polytechnic University(香港理工大学计算学系) ; Shenzhen Institute of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院)
专题命中 视觉问答 :grounding(abstract);分类 cs.CV、cs.AI
AI总结 NLPCC 2026的DA - MIVQA共享任务,通过区分问题难度扩展多语言多模态医学视频基准,含三个赛道。其数据集来自公共医学教学渠道,涵盖多种场景并经人工标注难度。该任务为评估医学教学视频问答系统提供实用基准。
Comments 19 pages, 6 figures, 6 tables
停止思考,开始观察:通过无推理对齐实现多模态文档问答的高效训练后优化
专题命中 视觉问答 :grounding(abstract);分类 cs.AI、cs.LG
AI总结 研究多模态文档问答中高效训练后优化问题,提出感知 - RFT 框架,用组相对策略优化绕过推理令牌直接对齐视觉与基础输出,通过构建变体评估推理必要性,发现启用推理模型有优势,还识别基础差异,表明早期转换可减少训练数据并保持精度。
Comments Accepted at ICML 2026, Workshop on Efficient Multimodal Question Answering (EMM-QA)
有证据支持的视频问答
机构 * Salesforce, Palo Alto, CA, USA(Salesforce公司) ; Brown University, Providence, RI, USA(布朗大学)
专题命中 视觉问答 :grounding(abstract);分类 cs.CV、cs.AI
AI总结 研究视频问答中模型缺乏可视化依据的问题,提出E-VQA任务及ST-Evidence基准,开发数据集ST-Evidence-Instruct,通过微调提高模型表现,为可解释的视频理解建立基线。
Journal ref ECCV 2026
关于CVPR 2026@AdvML研讨会挑战赛的技术报告
机构 * Beihang University(北京航空航天大学) ; University of Chinese Academy of Sciences(中国科学院大学) ; Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) ; Tongji University(同济大学) ; iFLYTEK Co., Ltd.(科大讯飞股份有限公司) ; Anhui Laboratory for Safe Artificial Intelligence in the Yangtze River Delta(长三角安全人工智能安徽实验室) ; Wenzhou Business College(温州商学院) ; Jiangnan University(江南大学) ; Guangzhou City University of Technology(广州理工学院) ; Inceptio Technology(智元机器) ; Institute of Dataspace(数据空间研究所) ; Zhongguancun Laboratory(中关村实验室) ; Tsinghua University(清华大学) ; ETH Zürich(苏黎世联邦理工学院) ; University of Oxford(牛津大学) ; Shanghai AI Laboratory(上海人工智能实验室) ; BAAI(北京智源人工智能研究院) ; Meta ; Johns Hopkins University(约翰·霍普金斯大学) ; University of California, Berkeley(加州大学伯克利分校) ; Nanyang Technological University(南洋理工大学)
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI
AI总结 介绍CVPR 2026@AdvML研讨会针对自动驾驶VLAs的对抗性多模态攻击挑战赛,基于多视图视觉问答,参赛者要生成对抗图像和文本扰动。阐述任务设计等,研究领先提交作品发现后缀惩罚等模式,为多模态自动驾驶系统相关工作提供参考。