RePLan: Robotic Replanning with Perception and Language Models
专题命中 视觉问答 :vision language model(abstract);VLM(abstract);visual question answering(abstract);grounding(abstract)
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
专题命中 视觉问答 :vision language model(abstract);VLM(abstract);visual question answering(abstract);grounding(abstract)
专题命中 视觉问答 :visual question answering(abstract);grounding(abstract);MLLM(abstract);分类 cs.CV、cs.AI、cs.LG
Comments Work in progress. Code and demos are released at https://github.com/Alpha-VLLM/LLaMA2-Accessory
专题命中 视觉问答 :visual reasoning(abstract);visual question answering(abstract);grounding(abstract);分类 cs.CV、cs.AI、cs.LG
专题命中 视觉问答 :visual reasoning(abstract);visual question answering(abstract);grounding(abstract);分类 cs.CV、cs.AI、cs.LG
Comments First three authors contributed equally. Code are available at https://github.com/amazon-research/mix-generation. Oral presentation at WACV 2023 Pretraining Large Vision and Multimodal Models Workshop
SimulRAG:基于模拟器的检索增强生成(RAG)框架,用于将大型语言模型(LLMs)落地到长篇科学问答任务中
机构 * University of California San Diego(加州大学圣迭戈分校) ; Stanford University(斯坦福大学) ; Northeastern University(东北大学)
专题命中 视觉问答 :grounding(title,abstract);分类 cs.LG
AI总结 针对LLMs在长篇科学问答中易幻觉的问题,本文提出SimulRAG框架,引入UE+SBA机制,发布相关基准,实验表明其信息量与事实性较基线分别提升30.4%、16.3%
Comments Haozhou Xu and Dongxia Wu are co-first authors
TemMed-Bench:评估视觉语言模型的时序医学图像推理能力
机构 * University of California, Los Angeles(加州大学洛杉矶分校)
专题命中 视觉问答 :vision-language model(title,abstract);分类 cs.CV
AI总结 本文提出TemMed-Bench时序医学图像推理基准,评估12个视觉语言模型,发现多数模型缺乏分析患者状况时序变化的能力,多模态检索扩充可显著提升其性能。
多模态场景图与科莫戈罗夫-阿诺尔德专家网络用于音频-视觉问答
机构 * State Key Laboratory of Networking and Switching Technology, Beijing University of Posts and Telecommunications, China(网络与交换技术国家重点实验室,北京邮电大学)
专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.AI
AI总结 本文提出基于多模态场景图与科莫戈罗夫-阿诺尔德专家网络的SHRIKE模型,用于提升音频-视觉问答任务中的跨模态交互建模与时间推理性能。
UniHEAR:面向基于知识的视觉问答的统一异构源注意力检索
专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV
AI总结 针对KB-VQA现有系统的单源检索瓶颈与检索源盲重排序问题,提出UniHEAR框架,在E-VQA和InfoSeek数据集上实现最优检索与VQA性能,提升Recall@1达6.7和1.2个点。
Comments Accepted by ACM MM 2026
贝叶斯数据重加权改进基于知识的视觉问答的多模态检索
机构 * University at Buffalo(布法罗大学) ; NEC Laboratories America(美国 NEC 实验室) ; Adobe Research(奥多比研究院) ; Iowa State University(爱荷华州立大学) ; New York University(纽约大学)
专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.LG
AI总结 针对基于知识的视觉问答中多模态检索的负样本处理问题,提出贝叶斯数据重加权框架,通过概率建模与随机EM优化,在三个检索器和七个基准上提升了检索准确率。
HierDoc:用于长文档视觉问答的分层页到区域证据路由
专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV
AI总结 HierDoc是分层证据路由框架,将长文档视觉问答的页与区域选择整合为连续两阶段,在开放权重系统中达SOTA,使LongDocURL提升16.87%,区域证据可显著提升单页系统性能。
Comments 15 pages, 4 figures; includes supplementary material
阅读还是忽略?视觉语言模型中排版攻击鲁棒性和文本识别的统一基准
机构 * Turing Inc.(Turing公司) ; The University of Tokyo(东京大学) ; Institute of Science Tokyo(东京科学研究院) ; Tohoku University(东北大学)
专题命中 视觉问答 :vision-language model(title,abstract);分类 cs.CV
AI总结 研究大型视觉语言模型排版攻击鲁棒性和文本识别问题,引入RIO-VQA任务及RIO-Bench基准,发现目标中心防御的权衡,提出数据驱动防御基线,提升模型在两方面的性能,凸显现有鲁棒性范围与现实需求的错位。
Comments Accepted at ECCV 2026. The project page is available at: https://turingmotors.github.io/rio-vqa/
超越医学诊断:医学多模态大语言模型如何在空间中思考
专题命中 视觉问答 :multimodal large language model(title,abstract);分类 cs.CV
AI总结 本文提出SpatialMed基准,通过自主合成空间视觉问答数据评估医学MLLMs的3D空间智能,发现现有模型在医学影像空间推理能力不足。
AV-Master:双路径综合感知实现更优的音频视觉问答
机构 * Great Bay University(大湾区大学) ; Dongguan Key Laboratory for Intelligence and Information Technology(东莞智能与信息科技重点实验室) ; Nankai University(南开大学) ; Tsinghua Shenzhen International Graduate School(清华大学深圳国际研究生院) ; The Chinese University of Hong Kong(香港中文大学)
专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV
AI总结 AV-Master通过动态建模时序和模态维度,提升模型在复杂视听场景中提取关键信息的能力,有效解决现有方法在时间采样和模态偏好意识上的不足,从而在复杂场景中增强推理能力。
Comments Accepted by IEEE Transactions on Circuits and Systems for Video Technology (TCSVT'26)
从LLM中蒸馏答案集编程规则用于神经符号视觉问答
机构 * Vienna University of Technology ( TU Wien )(维也纳技术大学) ; Jönköping University(约克灵厄普大学)
专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.AI
AI总结 提出从大语言模型中蒸馏答案集编程规则的方法,以可解释的方式扩展视觉问答系统的推理能力,仅需少量示例即可生成正确规则。
Comments Under consideration in Theory and Practice of Logic Programming (TPLP)
用于植物显微图像理解的视觉语言模型基准测试
机构 * The University of Queensland(昆士兰大学) ; Adelaide University(阿德莱德大学) ; University of Southern Queensland(南昆士兰大学)
专题命中 视觉问答 :vision-language model(title,abstract);分类 cs.CV
AI总结 提出PlantMicro基准,包含5000+图像和9000+VQA对,评估视觉语言模型在植物显微图像理解上的能力,发现现有模型在细粒度识别和生物学推理上表现不佳。
伪造答案:针对无OCR文档视觉问答的对抗性伪造
机构 * University of Cagliari, Italy(卡利亚里大学) ; Computer Vision Center, UAB, Spain(UAB计算机视觉中心)
专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV
AI总结 提出一种视觉上不可察觉但语义上定向的对抗攻击方法,通过伪造文档内容诱导DocVQA模型产生错误答案,在Pix2Struct和Donut模型上验证了有效性。
迷失于体积:CT-SpatialVQA基准用于评估3D医学视觉-语言模型的语义-空间理解
机构 * Mohamed Bin Zayed University of Artificial Intelligence(莫扎德人工智能大学) ; New York University Abu Dhabi(纽约大学阿布扎克分校)
专题命中 视觉问答 :vision-language model(title,abstract);分类 cs.CV
AI总结 本文提出CT-SpatialVQA基准,评估3D医学视觉-语言模型对3DCT数据的语义-空间理解能力,发现现有模型在语义-空间推理任务中表现不佳,需更深入整合体积证据以确保临床可靠性。
OmniVideo-100K:通过结构化脚本和证据链进行音视频推理的数据集
机构 * Nanjing University(南京大学) ; CASIA(中国科学院自动化研究所)
专题命中 视觉问答 :visual reasoning(title);visual question answering(abstract);分类 cs.CV
AI总结 提出OmniVideo-100K数据集,通过实体锚定视频脚本和线索引导的QA生成机制,解决音视频问答中跨段实体不一致和长时推理不足的问题,微调模型在多个基准上取得显著提升。
Comments Project page: https://github.com/MiG-NJU/OmniVideo-100K
基于视觉基础模型的注意力一致纵向医学视觉问答
机构 * University of California, San Diego(加州大学圣地亚哥分校) ; Yale Biomedical Imaging Institute(耶鲁大学生物医学成像研究所)
专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.AI
AI总结 提出一种注意力引导的编码器-解码器框架,通过轻量级配准和自适应掩码生成,结合辅助损失函数,实现胸部X光片的纵向医学视觉问答,在Medical-Diff-VQA基准上取得优异性能。
Comments Accepted to CVPR 2026 Workshop PHAROS-AIF-MIH
Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) Workshops, 2026, pp. 6448-6458
InsightVQA: 高维情感认知视觉问答基准
机构 * East China Normal University(东华师范大学)
专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV
AI总结 为解决现有基准仅关注情感识别而缺乏深层认知推理的问题,提出大规模层次化视觉问答数据集InsightVQA,包含725K问答对,并构建评估基准InsightVQA-Bench和基线模型InsightNet。
Comments 16 pages, 22 figures
REAL: 通过推理枢轴对齐解决知识密集型视觉问答中的知识冲突
机构 * University of Science and Technology of China(中国科学技术大学) ; Tsinghua University(清华大学)
专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.AI
AI总结 提出REAL框架,通过推理枢轴对齐和引导解码,解决知识密集型视觉问答中因开放域检索引起的知识冲突问题。
Comments Accepted by ICML 2026
RoboSurg-VQA:面向手术分割感知的视觉问答多模态基准
机构 * Swansea University, UK(威尔士大学) ; Maynooth University, Ireland(迈诺特大学) ; Aston University, UK(阿斯顿大学)
专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV
AI总结 提出RoboSurg-VQA基准,通过重新利用公共手术分割数据集,构建分割感知的视觉问答任务,以评估在机器人辅助和微创手术中恶劣视觉条件下的语言化临床问题理解能力。
HyLoVQA: 动态超网络生成低秩适应用于连续视觉问答
机构 * School of Computer Science, Hubei University, Wuhan 430062, China(湖北大学计算机学院,武汉430062,中国) ; Hubei Key Laboratory of Big Data Intelligent Analysis and Application (Hubei University), Wuhan 430062, China(湖北省大数据智能分析与应用重点实验室(湖北大学),武汉430062,中国) ; Key Laboratory of Intelligent Sensing System and Security (Hubei University), Ministry of Education, Wuhan 430062, China(智能感知系统与安全重点实验室(湖北大学),教育部,武汉430062,中国)
专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV
AI总结 HyLoVQA通过动态超网络生成低秩适应,解决连续视觉问答中任务干扰问题,提升模型对当前任务和对象的适应能力。
Comments Accepted by IJCAI 2026
通过超越128K上下文的泛化有效训练长上下文视觉-语言模型
机构 * CSE Department, HKUST(香港科技大学计算机科学与工程系)
专题命中 视觉问答 :vision-language model(title,abstract);分类 cs.CV
AI总结 本文研究了长上下文视觉-语言模型的持续预训练,通过平衡数据和检索优化,提出MMProLong模型在长文档VQA等任务中表现优异,且能扩展至更长上下文和多任务场景。
Comments work in progress
PolarVLM:弥合视觉语言模型中的语义-物理差距
机构 * Beijing University of Posts and Telecommunications, China(北京邮电大学) ; National Institute of Informatics, Japan(日本国立信息机构) ; Peking University, China(北京大学) ; The University of Tokyo, Japan(东京大学)
专题命中 视觉问答 :vision-language model(title,abstract);分类 cs.CV
AI总结 PolarVLM通过引入极化物理参数,解决视觉语言模型在反射和透明物体等光学模糊问题中的局限,提出双流架构和分阶段训练策略,构建首个极化感知的VQA基准,实现25.4%的总体提升。
Comments 23 pages, 12 figures, including appendices
SpecVQA:一种用于科学图像光谱理解和视觉问答的基准测试
机构 * DP Technology(DP技术)
专题命中 视觉问答 :visual question answering(title);multimodal large language model(abstract);分类 cs.AI
AI总结 SpecVQA通过7种典型光谱类型和专家标注的问答对,评估多模态模型在科学光谱理解中的能力,提出光谱数据采样与插值重建方法,提升模型在科学光谱理解中的表现。
当表面欺骗:利用褶皱诱导的注意力转移攻击视觉-语言模型
专题命中 视觉问答 :vision-language model(title);visual question answering(abstract);分类 cs.CV
AI总结 本文提出一种参数化结构扰动方法,通过构建多尺度褶皱场和整合位移场扭曲与表面一致的外观变化,以攻击视觉-语言模型的鲁棒性。
检索以恢复:通过语义一致的净化实现不完整音频-视觉问答
机构 * School of Computing and Information Technology, Great Bay University(大湾大学计算机与信息学院) ; Dongguan Key Laboratory for Intelligence and Information Technology(东莞智能与信息科技重点实验室) ; Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) ; College of Computer Science, Nankai University(南开大学计算机学院) ; School of mathematics, Sun Yat-sen University(中山大学数学学院)
专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV
AI总结 本文提出R$^{2}$ScP框架,通过检索而非生成方法处理缺失模态,利用统一语义嵌入进行跨模态检索,并引入上下文感知适应净化机制,提升语义恢复能力,实验表明其在不完整模态场景中性能更优。
Comments Accepted by ACL 2026 Main Conference
FPBench: 多模态大语言模型在指纹分析中的综合基准测试
机构 * New York University(纽约大学) ; University of Wyoming(怀俄明大学)
专题命中 视觉问答 :multimodal large language model(title);visual question answering(abstract);分类 cs.CV
AI总结 本文提出FPBench基准测试,评估20种多模态大语言模型在7个真实和合成数据集上的8项生物识别任务,发现微调视觉和语言编码器可提升性能7%-39%。
Comments Revised version with additional experiments and code release
KG-CMI: 基于知识图谱的跨Mamba交互用于医学视觉问答
机构 * School of Software, Northwestern Polytechnical University(西北工业大学软件学院) ; Tianjin Central Hospital of Gynecology Obstetrics(天津市中心妇产科医院) ; Department of Computer Science and Information Technology, La Trobe University(拉筹伯大学计算机科学与信息技术系) ; CSIRO Data61(澳大利亚联邦科学与工业研究组织Data61) ; School of Computer Science and Technology, Harbin Institute of Technology(哈尔滨工业大学计算机科学与技术学院) ; School of Computer Software, Tianjin University(天津大学计算机软件学院) ; Centre for Artificial Intelligence driven Drug Discovery, Faculty of Applied Science, Macao Polytechnic University(澳门理工大学应用科学学院人工智能驱动药物发现中心) ; Department of Cardiology, Tianjin Chest Hospital(天津市胸科医院心内科)
专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV
AI总结 本文提出KG-CMI框架,通过整合医学知识图谱提升医学视觉问答的准确性与多样性,实验表明其在三个数据集上表现优于现有方法。