Compositional Memory for Visual Question Answering
专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV
专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV
Comments 20 pages
RISE:跨三维跟踪与结构化视觉-语言推理的路边基础设施序列理解
专题命中 视觉问答 :MLLM(abstract,abstract_cn);grounding(abstract);分类 cs.CV、cs.AI
AI总结 本研究提出RISE框架,结合仅图像的三维跟踪方法与结构化视觉-语言推理,构建含33910个问答对的RISE-VQA数据集,通过RISE-Bench评估任务,揭示相关挑战并验证域自适应与时间上下文的益处。
视频-大语言模型(Video-LLM)问答中幻觉引用的检测:自验证流水线与验证器 ablation 研究
专题命中 视觉问答 :grounding(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV、cs.AI
AI总结 针对视频-LLM问答中引用幻觉问题,提出自验证流水线,用小型自然语言推理模型作稳定验证器,在对抗性错误前提问题上检测率达79%,并发布相关代码。
360度图像感知与MLLMs:一个全面的基准和无需训练的方法
机构 * GSIS, Tohoku University(东大GSIS研究所,东京东大大学) ; RIKEN AIP, Japan(日本RIKEN AIP)
专题命中 视觉问答 :visual question answering(abstract);multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.AI
AI总结 本文提出360Bench基准和Free360方法,评估MLLMs在360度图像感知中的能力,揭示其不足,并提出基于场景图的无需训练框架提升VQA性能。
Journal ref ECCV2026 (Link: https://tranhuyen1191.github.io/360Bench-Free360/)
拼接与讲述:一种结构化多模态数据增强方法用于空间理解
机构 * School of Computer Science, Beijing Institute of Technology(北京理工大学计算机科学学院) ; School of Software and Microelectronics, Peking University(北京大学软件与微电子学院) ; Xiaohongshu Inc(小红书公司)
专题命中 视觉问答 :LLaVA(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV、cs.AI
AI总结 Stitch and Tell通过结构化空间监督提升视觉-语言模型的空间理解能力,有效缓解空间幻觉并提高相关任务性能。
Journal ref Advances in Neural Information Processing Systems 38 (NeurIPS 2025)
CARVE:用于高效3D医学体积理解的视觉证据跨切片各向异性重分配
专题命中 视觉问答 :MLLM(summary_cn,abstract_cn);分类 cs.CV、cs.AI
AI总结 针对3D医学体积理解中切片式MLLM的视觉令牌冗余问题,提出无需训练的CARVE框架,通过跨切片各向异性重分配压缩80%令牌,在AMOS-MM等基准上性能优于现有方法。
ClinFusion:用于整体医学理解的以视觉为中心的多模态大语言模型系统
机构 * DAMO Academy, Alibaba Group(达摩院,阿里巴巴集团) ; Hupan Laboratory(湖畔实验室) ; College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) ; Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) ; Department of Radiology, The Affiliated Yangming Hospital of Ningbo University(宁波大学附属阳明医院放射科) ; Zhejiang University-University of Illinois Urbana-Champaign Institute, Zhejiang University(浙江大学伊利诺伊大学厄巴纳香槟校区联合学院,浙江大学) ; Hepato-Pancreato-Biliary Center, Beijing Tsinghua Changgung Hospital, School of Clinical Medicine, Tsinghua Medicine, Tsinghua University(清华长庚医院肝胆胰中心,清华大学临床医学院,清华医学,清华大学) ; School of Software, Tsinghua University(清华大学软件学院) ; Beijing National Research Center for Information Science and Technology, Tsinghua University(清华大学北京信息科学与技术国家研究中心)
专题命中 视觉问答 :visual question answering(abstract);multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.AI
AI总结 研究针对多模态大语言模型在医学领域部署的挑战,提出ClinFusion,采用组合级联视觉编码器架构和视觉基础评估框架,在多模态医学基准测试中表现优异,超越开源和专有模型,经专家盲评验证效果良好。
Comments Code: https://github.com/alibaba-damo-academy/ClinFusion Models: https://huggingface.co/collections/Alibaba-DAMO-Academy/clinfusion
PathScale-R1:用于病理图像分析的跨尺度推理
机构 * National University of Singapore(新加坡国立大学) ; PuzzleLogic Pte Ltd(拼图逻辑私人有限公司) ; Fujian Medical University Cancer Hospital & Fujian Cancer Hospital(福建医科大学附属肿瘤医院)
专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract);grounding(abstract);分类 cs.CV、cs.AI
AI总结 研究针对病理诊断多尺度需求及现有模型局限,引入抗捷径跨尺度病理推理框架,设计相关策略构建PathScale-VQA基准,经优化得到PathScale-R1,实验证明其在跨尺度推理任务性能及对单尺度病理VQA的有效迁移。
增强病理视觉语言模型的跨尺度推理能力
机构 * Department of Electrical and Computer Engineering, National University of Singapore(新加坡国立大学电气与计算机工程系) ; PuzzleLogic Pte Ltd(PuzzleLogic私人有限公司) ; Department of Pathology, Fujian Medical University Cancer Hospital & Fujian Cancer Hospital(福建医科大学附属肿瘤医院病理科暨福建省肿瘤医院)
专题命中 视觉问答 :vision-language model(abstract);VLM(abstract_cn);visual question answering(abstract);分类 cs.CV、cs.AI
AI总结 提出首个跨尺度训练与评估范式,通过多倍率视觉问答任务增强病理视觉语言模型的跨尺度推理能力,并构建高质量基准数据集Scale-VQA及模型ScaleReasoner-R1,实现最优性能。
Comments MICCAI 2026
不平衡下的遗忘:多模态大语言模型遗忘中的公平性基准测试
机构 * University of Trento(特伦托大学) ; Fondazione Bruno Kessler(布鲁诺·凯斯勒基金会)
专题命中 视觉问答 :visual question answering(abstract);multimodal large language model(abstract);MLLM(abstract_cn);分类 cs.CV、cs.AI
AI总结 研究多模态大语言模型遗忘中的公平性问题,提出FAIRGET基准和FAUN算法,通过模拟现实场景下不平衡的遗忘请求,在考虑数据不平衡性质时遗忘身份,实验证明该方法在遗忘质量和公平性上具有优越性。
Comments 33 pages
D3VL:利用语言模型从3D时间序列数据和视频中理解驾驶场景
机构 * Bradley Department of Electrical and Computer Engineering, Virginia Tech(弗吉尼亚理工大学布拉德利电气与计算机工程系) ; Virginia Tech Transportation Institute(弗吉尼亚理工大学交通研究所) ; Sanghani Center for Artificial Intelligence and Data Analytics(桑哈尼人工智能与数据分析中心)
专题命中 视觉问答 :MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV、cs.AI
AI总结 本文针对自动驾驶中多模态大语言模型,提出D3VL框架,整合2D和3D时间序列数据,回答交通场景相关问题,在KITTI问答数据集上性能提升11%,并引入Waymo QA数据集扩展以评估模型在多样驾驶条件下处理3D和时间序列数据的能力。
Comments Accepted to IEEE IV 2026
全切片图像多模态基准测试中的数据泄露审计
机构 * University of Virginia(弗吉尼亚大学) ; Merck & Co., Inc.(默克公司)
专题命中 视觉问答 :vision-language model(abstract);VLM(abstract_cn);visual question answering(abstract);分类 cs.CV、cs.LG
AI总结 研究针对计算病理学中WSI VQA基准测试数据泄露问题,通过追踪标识符发现患者级和机构级泄露,证明其可从基础模型特征空间解码,导致准确率差距,当前评估无法区分推理与检索,最后给出无污染评估建议。
提前思考:多模态语言模型和世界模型中的预见智能
机构 * College of Software, Nankai University, China(南开大学软件学院) ; The University of Hong Kong, China(香港大学) ; NKIARI, Shenzhen Futian, China(NKIARI,深圳福田,中国) ; AAIS & VCIP, Nankai University, China(AAIS与VCIP,南开大学,中国) ; A*STAR Institute of Advanced Intelligence and Computing, Singapore(新加坡A*STAR先进智能与计算研究所)
专题命中 视觉问答 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV、cs.AI
AI总结 研究定义预见智能,引入FSU-QA数据集,对视觉语言模型在预见任务中全面研究,发现当前模型不足。该数据集可评估世界模型,增强预见推理,微调小模型能超大型先进模型,为开发下一代模型提供基础,还验证了评估协议。
Comments Accepted by ECCV 2026
迷失在末尾:多模态检索增强问答中的首因偏差
机构 * University of California, San Diego(加州大学圣地亚哥分校) ; The Ohio State University(俄亥俄州立大学)
专题命中 视觉问答 :VLM(abstract,abstract_cn);visual question answering(abstract);分类 cs.CV、cs.AI
AI总结 研究多模态知识型视觉问答中检索上下文的位置依赖,发现不同于纯文本的U形效应,出现首因偏差(开头优于末尾),并通过消融实验定位原因为指令调优阅读器的提示槽0。
Comments 15 pages, 9 figures
关注、变换或静默:面向高效多模态大语言模型推理的算子级视觉跳跃
机构 * Tsinghua Shenzhen International Graduate School(清华大学深圳国际研究生院) ; Sun Yat-sen University(中山大学) ; National Supercomputing Center in Shenzhen(国家超级计算深圳中心) ; Tsinghua University(清华大学)
专题命中 视觉问答 :MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV、cs.AI
AI总结 针对多模态大语言模型视觉令牌计算冗余问题,提出算子级视觉跳跃框架,选择性跳过冗余注意力或FFN算子,在Qwen3-VL上减少33.7%计算量并保持99.5%性能。
打破失败级联:面向医学多模态推理的步骤感知强化学习
机构 * Korea University(高丽大学) ; Upstage AI ; Kyung Hee University(庆熙大学) ; KAIST(韩国科学技术院) ; Hanyang University College of Medicine(汉阳大学医学院) ; AIGEN Sciences
专题命中 视觉问答 :visual question answering(abstract);multimodal large language model(abstract);MLLM(abstract_cn);分类 cs.CV、cs.AI
AI总结 提出步骤感知强化学习算法MRPO,通过为早期错误推理步骤分配指数级惩罚,打破失败级联,显著提升医学视觉问答准确率。
VinQA:面向真实世界多模态文档问答的交错视觉元素长文本答案生成
机构 * LG AI Research(LG AI研究院)
专题命中 视觉问答 :MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV、cs.AI
AI总结 提出VinQA数据集和两种编码方法(页面编码与模态编码),用于生成交错引用视觉元素的长文本答案;通过M-GroSE评估框架和微调Qwen2.5-VL模型,显著缩小与专有模型的性能差距。
Comments Accepted to CVPR 2026. Main paper: 5 figures, 4 tables; includes supplementary material
基于LLM增强优化的无人机低空经济网络高效机载视觉-语言推理
机构 * College of Computing and Data Science, Nanyang Technological University, Singapore(计算与数据科学学院、新加坡国立科技大学) ; The University of Sydney, Sydney, Australia(悉尼大学、澳大利亚悉尼) ; Department of Electrical and Computer Engineering, Western University, London, Canada(电气与计算机工程系、西方大学、加拿大伦敦) ; Department of Electrical and Computer Engineering, Sungkyunkwan University, South Korea(电气与计算机工程系、全州大学、韩国)
专题命中 视觉问答 :vision-language model(abstract);VLM(abstract_cn);visual question answering(abstract);分类 cs.AI、cs.LG
AI总结 针对无人机低空经济网络中机载视觉-语言模型推理的准确性与通信效率挑战,提出分层优化框架,包括交替分辨率与功率优化算法及大语言模型增强的强化学习轨迹优化方法,有效提升推理性能与通信效率。
StreamingVLM:无限视频流的实时理解
机构 * MIT(麻省理工学院) ; NVIDIA(英伟达)
专题命中 视觉问答 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV、cs.AI
AI总结 提出StreamingVLM,通过统一训练与流推理的框架,利用注意力汇点状态复用和滑动窗口机制实现无限视频流的实时稳定理解,在Inf-Streams-Eval基准上以8 FPS速度达到66.18%胜率,并提升通用VQA能力。
Comments Published as a conference paper at ICLR 2026. The first two authors contributed equally to this work
Look-Closer-Then-Diagnose: 通过主动缩放实现置信度感知的超声VQA
机构 * Computer Aided Medical Procedures (CAMP)(计算机辅助医疗程序) ; TU Munich, Germany(慕尼黑工业大学,德国) ; Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心) ; Munich, Germany(慕尼黑,德国) ; Zhongshan Hospital, Fudan University, China(复旦大学中山医院) ; The University of Hong Kong, Hongkong, China(香港大学,香港,中国)
专题命中 视觉问答 :vision-language model(abstract);VLM(abstract_cn);visual question answering(abstract);分类 cs.CV、cs.AI
AI总结 提出一个模拟超声医师认知流程的框架,通过“缩放-诊断”范式和基于组相对策略优化的不确定性感知奖励,提升超声视觉问答中病灶定位和诊断性能。
迈向具有空间定位病变证据的临床可解释性眼科VQA
机构 * Department of Computer Science and Engineering, Southern University of Science and Technology(南方科技大学计算机科学与工程系) ; The Hong Kong Polytechnic University(香港理工大学) ; National University of Singapore(新加坡国立大学) ; University of Washington(华盛顿大学) ; Institute of High Performance Computing, Agency for Science, Technology and Research(科技研究局高性能计算研究所)
专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract);grounding(abstract);分类 cs.CV、cs.AI
AI总结 本文提出FundusGround基准,通过空间定位病变证据提升眼科VQA的临床可解释性,通过三阶段流程收集标注病变的视网膜影像,并评估多种视觉语言模型在答案准确性和病变层面推理上的表现。
多模态机器去学习中的度量不可靠性:系统分析与原则统一分数
机构 * Murdoch University(墨尔本大学)
专题命中 视觉问答 :LLaVA(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV、cs.LG
AI总结 本文系统分析了多模态去学习中度量可靠性问题,提出统一质量评分(UQS)以解决不同度量标准间的冲突,通过实验验证了UQS在稳定排序方面的有效性。
Comments 9 Pages , 6 figures, Neurips 2026
PDF-WuKong:一种用于高效长PDF阅读的大型多模态模型,采用端到端稀疏采样
机构 * Huazhong University of Science and Technology(华中科技大学) ; Huawei Inc.(华为公司)
专题命中 视觉问答 :MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV、cs.AI
AI总结 本文提出PDF-WuKong,一种针对长PDF文档的多模态大语言模型,通过端到端稀疏采样提升多模态问答效率,实验表明其在长文档理解任务中优于其他模型,F1得分平均高出8.6%。
Comments Accepted by International Journal of Computer Vision (IJCV)
WildFireVQA: 一种大规模的辐射热视觉问答基准用于空中 wildfire 监测
机构 * Clemson University(克莱姆森大学)
专题命中 视觉问答 :visual question answering(abstract);multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.LG
AI总结 本文提出WildFireVQA基准,整合RGB影像与辐射热数据,包含6097个样本及207298个问题,评估多模态推理能力,揭示RGB和检索增强热上下文在 wildfire 监测中的表现差异。
Journal ref IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR-W 2026)
EVE: 通过可执行视觉变换实现多模态大语言模型的可验证自进化
机构 * National Engineering Research Center for Software Engineering, Peking University(软件工程国家级工程研究中心,北京大学) ; School of Control Science and Engineering, Shandong University(控制科学与工程学院,山东大学)
专题命中 视觉问答 :MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV、cs.AI
AI总结 本文提出EVE框架,通过可执行视觉变换实现多模态大语言模型的可验证自进化,解决伪标签方法和模板方法的不足,通过双策略架构和多维奖励系统提升模型自进化能力。
VEFX-Bench:一个全面的通用视频编辑和视觉特效基准测试
机构 * Texas A\&M University(德克萨斯大学)
专题命中 视觉问答 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV、cs.AI
AI总结 本文提出VEFX-Bench,基于VEFX-Dataset构建,用于标准化比较视频编辑系统,通过VEFX-Reward模型提升评估准确性,揭示当前模型在视觉合理性、指令遵循和编辑局部性方面的差距。
PBSBench:一种多级视觉-语言框架和血液病理学全滑片图像解释基准
机构 * The Ohio State University(俄亥俄州立大学) ; The Ohio State University Wexner Medical Center(俄亥俄州立大学韦克斯纳医学中心)
专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI
AI总结 本文提出PBSBench,一种针对血液病理学全滑片图像解释的多级视觉-语言框架和基准,通过构建PBSInstr数据集和PBS-VL模型,提升了对血涂片图像的理解能力。
Comments 19 pages, 12 figures, Accepted by CVPR Findings 2026
AEGIS:锚定强化梯度隔离用于知识保留的视觉-语言-动作微调
机构 * Independent Researcher(独立研究者)
专题命中 视觉问答 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV、cs.LG
AI总结 本文提出AEGIS方法,通过层间梯度投影保留预训练的视觉问答能力,避免因梯度不对称导致的性能下降,无需额外数据或缓冲区。
超越单帧:跨体积MRI的多帧空间接地推理
机构 * Georgia Institute of Technology(佐治亚理工学院) ; Harvard University(哈佛大学) ; Georgetown University(乔治城大学)
专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract);grounding(abstract);分类 cs.CV、cs.AI
AI总结 本文提出SGMRI-VQA基准,通过多帧空间接地推理提升医学VLMs性能,展示监督微调提升接地能力。