arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 3122 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 3122 篇

2310.12638 2023-10-20 cs.AI 74%

PSYCHIC: A Neuro-Symbolic Framework for Knowledge Graph Question-Answering Grounding

Hanna Abi Akl

专题命中 视觉问答 :grounding(title);分类 cs.AI

Comments 10 pages, 3 figures, 2 tables, accepted for the Scholarly-QALD challenge at the International Semantic Web Conference (ISWC) 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.14558 2023-10-13 cs.CV 74%

Compressing And Debiasing Vision-Language Pre-Trained Models for Visual Question Answering

Qingyi Si, Yuanxin Liu, Zheng Lin, Peng Fu, Weiping Wang

专题命中 视觉问答 :visual question answering(title);分类 cs.CV

Comments EMNLP 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2212.08283 2023-08-08 cs.CV cs.CL 74%

SceneGATE: Scene-Graph based co-Attention networks for TExt visual question answering

Feiqi Cao, Siwen Luo, Felipe Nunez, Zean Wen, Josiah Poon, Caren Han

专题命中 视觉问答 :visual question answering(title);分类 cs.CV

Comments Published in Robotics (Q1, SCI indexed Journal): https://www.mdpi.com/2218-6581/12/4/114

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.19664 2023-06-01 cs.CV cs.CL cs.MM 74%

Unveiling Cross Modality Bias in Visual Question Answering: A Causal View with Possible Worlds VQA

Ali Vosoughi, Shijian Deng, Songyang Zhang, Yapeng Tian, Chenliang Xu, Jiebo Luo

专题命中 视觉问答 :visual question answering(title);分类 cs.CV

Comments 22 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.05068 2023-03-10 cs.CV 74%

Toward Unsupervised Realistic Visual Question Answering

Yuwei Zhang, Chih-Hui Ho, Nuno Vasconcelos

专题命中 视觉问答 :visual question answering(title);分类 cs.CV

Comments Yuwei Zhang and Chih-Hui Ho contributed equally to this work

详情

展开后加载摘要…

URL PDF HTML 收藏
2207.02624 2022-07-07 cs.CV cs.CL 74%

Knowing Earlier what Right Means to You: A Comprehensive VQA Dataset for Grounding Relative Directions via Multi-Task Learning

Kyra Ahrens, Matthias Kerzel, Jae Hee Lee, Cornelius Weber, Stefan Wermter

专题命中 视觉问答 :grounding(title);分类 cs.CV

Journal ref IJCAI 2022 Workshop on Spatio-Temporal Reasoning and Learning

详情

展开后加载摘要…

URL PDF HTML 收藏
1910.09134 2022-04-20 cs.CV cs.CL 74%

Good, Better, Best: Textual Distractors Generation for Multiple-Choice Visual Question Answering via Reinforcement Learning

Jiaying Lu, Xin Ye, Yi Ren, Yezhou Yang

专题命中 视觉问答 :visual question answering(title);分类 cs.CV

Journal ref CVPR'2022 Workshop on Open-Domain Retrieval Under a Multi-Modal Setting

详情

展开后加载摘要…

URL PDF HTML 收藏
2203.17219 2022-04-01 cs.CV 74%

SimVQA: Exploring Simulated Environments for Visual Question Answering

Paola Cascante-Bonilla, Hui Wu, Letao Wang, Rogerio Feris, Vicente Ordonez

专题命中 视觉问答 :visual question answering(title);分类 cs.CV

Comments Accepted to CVPR 2022. Camera-Ready version. Project page: https://simvqa.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2110.08484 2022-03-16 cs.CV cs.CL 74%

A Good Prompt Is Worth Millions of Parameters: Low-resource Prompt-based Learning for Vision-Language Models

Woojeong Jin, Yu Cheng, Yelong Shen, Weizhu Chen, Xiang Ren

专题命中 视觉问答 :vision-language model(title);分类 cs.CV

Comments Accepted to ACL 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2104.10283 2021-06-03 cs.CL cs.CV 74%

GraghVQA: Language-Guided Graph Neural Networks for Graph-based Visual Question Answering

Weixin Liang, Yanhao Jiang, Zixuan Liu

专题命中 视觉问答 :visual question answering(title);分类 cs.CV

Comments NAACL 2021 MAI-Workshop. Code available at https://github.com/codexxxl/GraphVQA

详情

展开后加载摘要…

URL PDF HTML 收藏
2004.08385 2020-04-21 cs.CV cs.CL 74%

Knowledge-Based Visual Question Answering in Videos

Noa Garcia, Mayu Otani, Chenhui Chu, Yuta Nakashima

专题命中 视觉问答 :visual question answering(title);分类 cs.CV

Comments arXiv admin note: substantial text overlap with arXiv:1910.10706

详情

展开后加载摘要…

URL PDF HTML 收藏
1910.13077 2019-10-30 cs.CV 74%

Learning Rich Image Region Representation for Visual Question Answering

Bei Liu, Zhicheng Huang, Zhaoyang Zeng, Zheyu Chen, Jianlong Fu

专题命中 视觉问答 :visual question answering(title);分类 cs.CV

Comments Rank 2 in VQA Challenge 2019

详情

展开后加载摘要…

URL PDF HTML 收藏
1712.03316 2018-09-07 cs.CV 74%

IQA: Visual Question Answering in Interactive Environments

Daniel Gordon, Aniruddha Kembhavi, Mohammad Rastegari, Joseph Redmon, Dieter Fox, Ali Farhadi

专题命中 视觉问答 :visual question answering(title);分类 cs.CV

Comments Published in CVPR 2018

详情

展开后加载摘要…

URL PDF HTML 收藏
1805.08174 2018-05-22 cs.CV cs.CL 74%

Reproducibility Report for "Learning To Count Objects In Natural Images For Visual Question Answering"

Shagun Sodhani, Vardaan Pahuja

专题命中 视觉问答 :visual question answering(title);分类 cs.CV

Comments Submitted to Reproducibility in ML Workshop, ICML'18

详情

展开后加载摘要…

URL PDF HTML 收藏
1804.00298 2018-04-04 cs.CV 74%

Differential Attention for Visual Question Answering

Badri Patro, Vinay P. Namboodiri

专题命中 视觉问答 :visual question answering(title);分类 cs.CV

Comments Accepted to CVPR 2018

详情

展开后加载摘要…

URL PDF HTML 收藏
1704.05526 2017-09-13 cs.CV 74%

Learning to Reason: End-to-End Module Networks for Visual Question Answering

Ronghang Hu, Jacob Andreas, Marcus Rohrbach, Trevor Darrell, Kate Saenko

专题命中 视觉问答 :visual question answering(title);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
1604.01485 2016-04-07 cs.CV cs.CL cs.NE 74%

A Focused Dynamic Attention Model for Visual Question Answering

Ilija Ilievski, Shuicheng Yan, Jiashi Feng

专题命中 视觉问答 :visual question answering(title);分类 cs.CV

Comments Submitted to ECCV 2016

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14075 2026-08-17 cs.AI cs.CV cs.DL 新提交 73%

A Pathway to General-Purpose Scientific AI: Multimodal Comprehension of Scientific Images

通用科学人工智能的实现路径:科学图像的多模态理解

Jennifer D'Souza, Fahad Ahmed, Cecilia Andrea Bustamante Andrade, Lina Frolova, Poorani Gnanasambandan, Dilshad Hussain, Muhammad Uzair Khan, Nkembeng Kevin Nkengfoa, Paul Praveen J., Fabio Priante, Sjoerd Franciscus van der Werf, Thomas Frederik Jan van Roeden

机构 * TIB Leibniz Information Centre for Science and Technology(莱布尼茨科学与技术信息中心(TIB)) Eindhoven University of Technology(埃因霍温理工大学) Freie Universität Berlin(柏林自由大学) International Center for Chemical and Biological Sciences, University of Karachi(卡拉奇大学国际化学与生物科学中心) National University of Sciences and Technology(国家科技大学) University of Warwick(华威大学) PSG College of Technology(PSG理工学院) Aalto University(阿尔托大学)

专题命中 视觉问答 :visual question answering(abstract);grounding(abstract);分类 cs.CV、cs.AI

AI总结 该研究提出以科学图像多模态理解构建通用科学AI的路径,依托ALD/E-ImageMiner基准与2026年ICDAR竞赛,明确相关任务能力检验维度及长期研究方向,推动可机器执行的科学视觉知识与可验证多模态科学AI发展。

Comments 15 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10964 2026-08-12 cs.CV cs.AI 新提交 73%

CARE: Confidence-Aware Reasoning for Reliable Medical VQA

CARE:用于可靠医学视觉问答的置信感知推理

Yuetian Du, Yucheng Wang, Zhenyuan Chen, Luyuan Chen, Rongyu Zhang, Jinjian Zhang, Wei Zhou, Zhijie Xu, Ming Kong, Zhan Zhou, Jie Liu, Qiang Zhu

机构 * Ant Group(蚂蚁集团) University of Michigan(密歇根大学) City University of Hong Kong(香港城市大学)

专题命中 视觉问答 :visual question answering(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 该研究针对医学多模态大语言模型的置信度校准问题,提出CARE框架,通过双阶段流程优化准确率与校准度,在三个医学VQA基准上取得最优性能,为临床决策支持提供可信基础。

Comments Accepted by MICCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08991 2026-08-12 cs.CV cs.AI 版本更新 73%

PinpointQA: A Benchmark for Small Object-Centric Spatial Understanding in Indoor Videos

PinpointQA: 一个用于室内视频中微小物体中心空间理解的数据集和基准

Zhiyu Zhou, Peilin Liu, Ruoxuan Zhang, Luyang Zhang, Cheng Zhang, Hongxia Xie, Wen-Huang Cheng

机构 * Jilin University(吉林大学) National Taiwan University(国立台湾大学)

专题命中 视觉问答 :grounding(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出PinpointQA数据集,用于评估多模态大语言模型在室内视频中对微小物体空间定位的精准理解能力,通过四个递进任务验证模型性能,并展示其作为诊断基准和训练数据集的效果。

Comments Accepted at the ECCV 2026 Workshop on Embodied Multimodal Reasoning in Physical Environments (EMR)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03826 2026-08-05 cs.CV cs.LG 新提交 73%

Geo-Embed: Towards Unified Multimodal Embeddings for Urban Understanding

Geo-Embed:面向城市理解的统一多模态嵌入

Jiapeng Li, Yong Li, Junjie Zhou, Fan Zhang, Yu Liu

专题命中 视觉问答 :visual question answering(abstract);grounding(abstract);分类 cs.CV、cs.LG

AI总结 本文针对现有多模态嵌入模型难以支持异构地理空间任务的问题,提出GeoMEB基准与Geo-Embed模型,在GeoMEB上实现15.3%的相对性能提升,为地理空间嵌入器发展提供方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01664 2026-08-04 cs.CV cs.LG 新提交 73%

FAU at ImageCLEF 2026 Task on Multimodal Reasoning Robust Candidate Scoring and Concise Multilingual Visual Answering

FAU参加2026年ImageCLEF多模态推理任务:鲁棒候选评分与简洁多语种视觉问答

Mohamed Basem, Vincent Christlein

机构 * Friedrich-Alexander-Universität Erlangen-Nürnberg(弗里德里希-亚历山大-埃尔兰根-纽伦堡大学)

专题命中 视觉问答 :vision-language model(abstract);VLM(abstract_cn);分类 cs.CV、cs.LG

AI总结 FAU提交的多模态推理系统,未做任务特定模型训练,在2026年ImageCLEF竞赛中,获Visual MCQ第三名、Visual OpenQA第一名,凸显推理工程的实用价值。

Comments 16 pages, 3 figures, 7 tables. CLEF 2026 Working Notes, ImageCLEF 2026 Multimodal Reasoning Task

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01328 2026-08-04 cs.CL cs.AI cs.CV 新提交 73%

LongChart VQA: A Comprehensive Benchmark for MLLMs with Complex Multi-Chart Reasoning

LongChart VQA:面向具备复杂多图表推理能力的多模态大语言模型的综合基准

Ziyan Xiao, Yinghao Zhu, Wenting Zhang, Heaju Kim, Lequan Yu

机构 * The University of Hong Kong(香港大学)

专题命中 视觉问答 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.AI

AI总结 LongChart VQA是面向具备复杂多图表推理能力的MLLMs的综合基准,该基准含平均6.5张图像与31.2个问题,评估10个SOTA MLLMs发现其准确率随计算复杂性提升下降,为多图表推理研究指明方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00345 2026-08-04 cs.CV cs.AI 新提交 73%

ORCA: ORgan-Centroid Aggregation for Training-Free 3D CT Visual Token Compression

ORCA:面向无需训练的3D CT视觉令牌压缩的器官质心聚合方法

Renjie Liang, Zijian Xu, Jinqian Pan, Chengkun Sun, Zhengkang Fan, Shawn Li, You Qin, Mei Liu, Jie Xu

专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract);分类 cs.CV、cs.AI

AI总结 针对3D CT视觉令牌压缩的痛点,提出无需训练的即插即用ORCA方法,在多数据集、多任务上实现显著压缩比与速度提升,性能优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25266 2026-08-03 cs.CV cs.LG 版本更新 73%

FORGE: Frame Orthogonality in Relevance Geometry for Long-Form Video Understanding

FORGE:用于长视频理解的相关几何中的帧正交性

Ghazal Kaviani, Ghassan AlRegib

机构 * Georgia Institute of Technology(佐治亚理工学院) Center for Signal and Information Processing (CSIP)(信号与信息处理中心 (CSIP)) School of Electrical and Computer Engineering(电气与计算机工程学院)

专题命中 视觉问答 :multimodal large language model(abstract);MLLM(abstract_cn);分类 cs.CV、cs.LG

AI总结 研究长视频理解中推理时最大化查询相关信息问题,提出FORGE模型无关方法,通过在预训练嵌入空间引入查询条件几何统一相关性和多样性,实验证明该方法在关键帧选择和问答上有显著提升。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07131 2026-07-30 cs.CV cs.AI 版本更新 73%

Deep Expert Injection for Anchoring Retinal VLMs with Domain-Specific Knowledge

深度专家注入用于带有领域特定知识的视网膜视觉语言模型的锚定

Shuai Lu, Meng Wang, Jia Guo, Jiawei Du, Bo Liu, Shengzhu Yang, Weihang Zhang, Huazhu Fu, Huiqi Li

机构 * Beijing Institute of Technology, Beijing, China(北京理工大学) National University of Singapore, Singapore(新加坡国立大学) Tsinghua University, Beijing, China(清华大学) The Hong Kong Polytechnic University, Hong Kong(香港理工大学)

专题命中 视觉问答 :vision language model(abstract);visual question answering(abstract);分类 cs.CV、cs.AI

AI总结 本文提出EyExIn框架,通过深度专家注入机制提升视网膜VLMs的领域知识嵌入能力,解决感知与推理间隙问题,实现高精度眼科视觉问答。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28583 2026-07-15 cs.CV cs.AI cs.MM 版本更新 73%

Navigating the Mirage: A Dual-Path Agentic Framework for Robust Misleading Chart Question Answering

穿越幻象:一种双路径代理框架用于鲁棒的误导图表问答

Yanjie Zhang, Yafei Li, Rui Sheng, Zixin Chen, Yanna Lin, Huamin Qu, Lei Chen, Yushi Sun

机构 * The Hong Kong University of Science and Technology(香港科技大学)

专题命中 视觉问答 :vision-language model(abstract);grounding(abstract);分类 cs.CV、cs.AI

AI总结 本文提出ChartCynics双路径框架,通过分离感知与验证,利用诊断视觉路径和OCR驱动数据路径解决图表误导问题,提升模型鲁棒性。

Comments 10pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03006 2026-07-07 cs.CV cs.AI cs.SE 新提交 73%

PosterHarness: Turning Scientific Poster Generation into an Auditable Instruction-Following Benchmark

PosterHarness:将科学海报生成转变为可审计的指令跟随基准

Tianyi Yang, Dawei Fu, Youpeng Wu, Zixun Kou, Linrui Chen, Ruobing Jiang, Zijian Wang, Qiang Li

机构 * School of Physics, Peking University(北京大学物理学院)

专题命中 视觉问答 :VLM(abstract,abstract_cn);分类 cs.CV、cs.AI

AI总结 研究针对文本丰富图像模型,缺乏衡量其是否遵循科学传播规范的方法这一问题,提出PosterHarness,将海报生成变为可审计任务,介绍核心方法,展示了相关实验发现及与其他方法的对比结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01436 2026-07-03 cs.AI cs.LG 新提交 73%

Discrete Diffusion Language Models for Interactive Radiology Report Drafting

离散扩散语言模型用于交互式放射报告草稿生成

Max Van Puyvelde, Halil Ibrahim Gulluk, Wim Van Criekinge, Olivier Gevaert

机构 * Stanford University School of Medicine(斯坦福大学医学院) Ghent University(根特大学) Stanford University(斯坦福大学)

专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract);分类 cs.AI、cs.LG

AI总结 提出将离散扩散语言模型用于放射报告草稿生成,利用其任意顺序填充能力实现交互式编辑,在医学VQA任务上达到或超越自回归模型,解码速度快3.5-4.4倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01390 2026-07-03 cs.CV cs.AI cs.MM 版本更新 73%

SEPS: Semantic-enhanced Patch Slimming Framework for fine-grained cross-modal alignment

SEPS:面向细粒度跨模态对齐的语义增强补丁精简框架

Xinyu Mao, Junsi Li, Haoji Zhang, Yu Liang, Ming Sun

专题命中 视觉问答 :visual question answering(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 提出SEPS框架,通过两阶段机制整合稠密与稀疏文本语义,识别显著视觉补丁,并利用相关性感知选择与均值计算突出关键补丁-词对应,提升跨模态相似度评估,在Flickr30K和MS-COCO上rSum提升23%-86%。

详情

展开后加载摘要…

URL PDF HTML 收藏