arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 3126 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 3126 篇

2511.17432 2025-11-24 cs.CL cs.AI cs.CV 62%

SMILE: A Composite Lexical-Semantic Metric for Question-Answering Evaluation

SMILE:一种用于问答评估的复合词法-语义度量标准

Shrikant Kendre, Austin Xu, Honglu Zhou, Michael Ryoo, Shafiq Joty, Juan Carlos Niebles

机构 * Salesforce AI Research(Salesforce人工智能研究)

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI

AI总结 SMILE是一种结合句子级和关键词级语义理解的新型问答评估度量标准,通过平衡词法精确性与语义相关性,提供全面且高效的评估方法。

Comments 23 pages, 6 tables, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.02104 2025-11-18 cs.LG cs.AI 62%

Foundation Model in Biomedicine

Xiangrui Liu, Yuanyuan Zhang, Qianyu Shang, Yingzhou Lu, Changchang Yin, Xiaoling Hu, Xiaoou Liu, Lulu Chen, Alexander Rodríguez, Yezhou Yang, Ping Zhang, Jintai Chen, Shan Du, Huaxiu Yao, Sheng Wang, Tianfan Fu, Xiao Wang

机构 * Arizona State University(亚利桑那州立大学) Purdue University(普渡大学) University of British Columbia(不列颠哥伦比亚大学) Stanford University(斯坦福大学) The Ohio State University(俄亥俄州立大学) Massachusetts General Hospital(麻省总医院) Harvard Medical School(哈佛医学院) Virginia Polytechnic Institute(弗吉尼亚多项技术学院) University of Michigan(密歇根大学) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) Nanjing University(南京大学)

专题命中 视觉问答 :vision-language model(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12131 2025-11-18 cs.CV cs.AI 62%

OAD-Promoter: Enhancing Zero-shot VQA using Large Language Models with Object Attribute Description

Quanxing Xu, Ling Zhou, Feifei Zhang, Jinyu Tian, Rubing Huang

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11468 2025-11-17 cs.CV cs.AI 62%

Benchmarking Visual LLMs Resilience to Unanswerable Questions on Visually Rich Documents

Davide Napolitano, Luca Cagliero, Fabrizio Battiloro

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09651 2025-11-14 cs.IR cs.AI cs.CL cs.LG eess.SP 62%

Retrieval-Augmented Generation for Reliable Interpretation of Radio Regulations

Zakaria El Kassimi, Fares Fourati, Mohamed-Slim Alouini

机构 * KAUST(卡斯泰尔大学)

专题命中 视觉问答 :grounding(abstract);分类 cs.AI、cs.LG

Comments 12 pages, 7 figures, AI4NextG @ NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21814 2025-11-07 cs.CV cs.AI 62%

Gestura: A LVLM-Powered System Bridging Motion and Semantics for Real-Time Free-Form Gesture Understanding

Zhuoming Li, Aitong Liu, Mengxi Jia, Yubi Lu, Tengxiang Zhang, Changzhi Sun, Dell Zhang, Xuelong Li

机构 * Institute of Artificial Intelligence (TeleAI) of China Telecom(中国电信人工智能研究院(TeleAI))

专题命中 视觉问答 :vision-language model(abstract);分类 cs.CV、cs.AI

Comments IMWUT2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02046 2025-11-05 cs.CV cs.AI 62%

Text-VQA Aug: Pipelined Harnessing of Large Multimodal Models for Automated Synthesis

Soham Joshi, Shwet Kamal Mishra, Viswanath Gopalakrishnan

机构 * International Institute of Information Technology Bangalore(国际信息科技学院班加罗尔)

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI

Comments First two authors contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23495 2025-11-05 cs.CL cs.AI cs.LG 62%

Diagnosing and Addressing Pitfalls in KG-RAG Datasets: Toward More Reliable Benchmarking

Liangliang Zhang, Zhuorui Jiang, Hongliang Chi, Haoyang Chen, Mohammed Elkoumy, Fali Wang, Qiong Wu, Zhengyi Zhou, Shirui Pan, Suhang Wang, Yao Ma

机构 * Rensselaer Polytechnic Institute(罗切斯特理工学院) University of Toronto(多伦多大学) Pennsylvania State University(宾夕法尼亚州立大学) AT&T Chief Data Office(AT&T首席数据办公室) Griffith University(格里菲斯大学)

专题命中 视觉问答 :grounding(abstract);分类 cs.AI、cs.LG

Comments Accepted at NeurIPS 2025 Datasets and Benchmarks Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19028 2025-10-30 cs.CV cs.AI 62%

InfoChartQA: A Benchmark for Multimodal Question Answering on Infographic Charts

Tianchi Xie, Minzhi Lin, Mengchen Liu, Yilin Ye, Changjian Chen, Shixia Liu

专题命中 视觉问答 :multimodal large language model(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.17939 2025-10-29 cs.CV cs.AI 62%

GEMeX-RMCoT: An Enhanced Med-VQA Dataset for Region-Aware Multimodal Chain-of-Thought Reasoning

Bo Liu, Xiangyu Zhao, Along He, Yidi Chen, Huazhu Fu, Xiao-Ming Wu

机构 * The Hong Kong Polytechnic University(香港理工大学) Shenzhen University(深圳大学) West China Hospital of Sichuan University(四川大学华西医院) IHPC, Agency for Science, Technology and Research(科技研究局IHPC)

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI

Comments Accepted at ACM MM 2025 (also known as GEMeX-ThinkVG)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21501 2025-10-27 cs.CV cs.AI 62%

GranViT: A Fine-Grained Vision Model With Autoregressive Perception For MLLMs

Guanghao Zheng, Bowen Shi, Mingxing Xu, Ruoyu Sun, Peisen Zhao, Zhibo Zhang, Wenrui Dai, Junni Zou, Hongkai Xiong, Xiaopeng Zhang, Qi Tian

机构 * Shanghai Jiao Tong University(上海交通大学) Huawei Inc.(华为公司)

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI

Comments 21 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21955 2025-10-27 cs.CV cs.AI 62%

Towards Comprehensive Scene Understanding: Integrating First and Third-Person Views for LVLMs

Insu Lee, Wooje Park, Jaeyun Jang, Minyoung Noh, Kyuhong Shim, Byonghyo Shim

专题命中 视觉问答 :vision-language model(abstract);分类 cs.CV、cs.AI

Comments Accepted to NeurIPS 2025 (Spotlight)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20193 2025-10-24 cs.IR cs.CL cs.CV cs.LG 62%

Multimedia-Aware Question Answering: A Review of Retrieval and Cross-Modal Reasoning Architectures

Rahul Raja, Arpita Vats

机构 * Carnegie Mellon University(卡内基梅隆大学) Boston University(波士顿大学)

专题命中 视觉问答 :grounding(abstract);分类 cs.CV、cs.LG

Comments In Proceedings of the 2nd ACM Workshop in AI-powered Question and Answering Systems (AIQAM '25), October 27-28, 2025, Dublin, Ireland. ACM, New York, NY, USA, 8 pages. https://doi.org/10.1145/3746274.3760393

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13856 2025-10-17 cs.CL cs.AI cs.CV 62%

Multimodal Retrieval-Augmented Generation with Large Language Models for Medical VQA

A H M Rezaul Karim, Ozlem Uzuner

机构 * George Mason University(乔治·马歇尔大学)

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23590 2025-10-14 cs.CV cs.AI cs.CL 62%

Jigsaw-R1: A Study of Rule-based Visual Reinforcement Learning with Jigsaw Puzzles

Zifu Wang, Junyi Zhu, Bo Tang, Zhiyu Li, Feiyu Xiong, Jiaqian Yu, Matthew B. Blaschko

专题命中 视觉问答 :multimodal large language model(abstract);分类 cs.CV、cs.AI

Comments TMLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08492 2025-10-10 cs.LG cs.CV 62%

Better Together: Leveraging Unpaired Multimodal Data for Stronger Unimodal Models

Sharut Gupta, Shobhita Sundaram, Chenyu Wang, Stefanie Jegelka, Phillip Isola

机构 * MIT CSAIL(麻省理工学院计算机科学与人工智能实验室) TU Munich(慕尼黑技术大学)

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.LG

Comments 63 pages, 29 tables, and 47 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.07966 2025-10-01 cs.CV cs.AI cs.CL 62%

Scaling RL to Long Videos

Yukang Chen, Wei Huang, Baifeng Shi, Qinghao Hu, Hanrong Ye, Ligeng Zhu, Zhijian Liu, Pavlo Molchanov, Jan Kautz, Xiaojuan Qi, Sifei Liu, Hongxu Yin, Yao Lu, Song Han

机构 * NVIDIA MIT(麻省理工学院) HKU(香港大学) UC Berkeley(加州大学伯克利分校)

专题命中 视觉问答 :vision-language model(abstract);分类 cs.CV、cs.AI

Comments Accepted by NeurIPS 2025. Code at https://github.com/NVlabs/Long-RL and model at https://huggingface.co/Efficient-Large-Model/LongVILA-R1-7B

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24350 2025-09-30 cs.CV cs.AI 62%

Dynamic Orchestration of Multi-Agent System for Real-World Multi-Image Agricultural VQA

Yan Ke, Xin Yu, Heming Du, Scott Chapman, Helen Huang

机构 * The University of Queensland(昆士兰大学)

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI

Comments 13 pages, 2 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09079 2025-09-29 cs.CV cs.AI 62%

VidBridge-R1: Bridging QA and Captioning for RL-based Video Understanding Models with Intermediate Proxy Tasks

Xinlong Chen, Yuanxing Zhang, Yushuo Guan, Weihong Lin, Zekun Wang, Bohan Zeng, Yang Shi, Sihan Yang, Qiang Liu, Pengfei Wan, Liang Wang, Tieniu Tan

机构 * New Laboratory of Pattern Recognition (NLPR), Institute of Automation, Chinese Academy of Sciences (CASIA)(中国科学院自动化研究所模式识别实验室) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Kling Team, Kuaishou Technology(快手科技 Kling 团队) Peking University(北京大学) Nanjing University(南京大学)

专题命中 视觉问答 :multimodal large language model(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.07879 2025-09-15 cs.IR cs.AI cs.CV 62%

OMGM: Orchestrate Multiple Granularities and Modalities for Efficient Multimodal Retrieval

Wei Yang, Jingjing Fu, Rui Wang, Jinyu Wang, Lei Song, Jiang Bian

机构 * Microsoft Research Asia(微软亚洲研究院)

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI

Comments Accepted to ACL 2025 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.02748 2025-09-03 cs.CV cs.AI 62%

Story Generation from Visual Inputs: Techniques, Related Tasks, and Challenges

Daniel A. P. Oliveira, Eugénio Ribeiro, David Martins de Matos

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI

Comments 23 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15717 2025-08-22 cs.CV cs.AI 62%

StreamMem: Query-Agnostic KV Cache Memory for Streaming Video Understanding

Yanlai Yang, Zhuokai Zhao, Satya Narayan Shukla, Aashu Singh, Shlok Kumar Mishra, Lizhu Zhang, Mengye Ren

机构 * Meta AI New York University(纽约大学)

专题命中 视觉问答 :multimodal large language model(abstract);分类 cs.CV、cs.AI

Comments 15 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.00329 2025-08-22 cs.CV cs.LG 62%

ABC: Achieving Better Control of Multimodal Embeddings using VLMs

Benjamin Schneider, Florian Kerschbaum, Wenhu Chen

机构 * University of Waterloo(滑铁卢大学)

专题命中 视觉问答 :vision-language model(abstract);分类 cs.CV、cs.LG

Comments TMLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11628 2025-08-18 cs.CV cs.AI 62%

Is ChatGPT-5 Ready for Mammogram VQA?

Qiang Li, Shansong Wang, Mingzhe Hu, Mojtaba Safari, Zachary Eidex, Xiaofeng Yang

机构 * Department of Radiation Oncology, Winship Cancer Institute, Emory University School of Medicine(放射肿瘤科、Winship癌症研究所、埃默里大学医学院)

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10865 2025-08-15 cs.CV cs.AI 62%

Performance of GPT-5 in Brain Tumor MRI Reasoning

Mojtaba Safari, Shansong Wang, Mingzhe Hu, Zach Eidex, Qiang Li, Xiaofeng Yang

机构 * Department of Radiation Oncology, Winship Cancer Institute, Emory University School of Medicine(放射肿瘤科,Winship癌症研究所,埃默里大学医学院)

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10429 2025-08-15 cs.AI cs.CR cs.CV 62%

MM-Food-100K: A 100,000-Sample Multimodal Food Intelligence Dataset with Verifiable Provenance

Yi Dong, Yusuke Muraoka, Scott Shi, Yi Zhang

机构 * Codatta Kite AI Binance Wallet Community Codatta Community

专题命中 视觉问答 :vision-language model(abstract);分类 cs.CV、cs.AI

Comments 10 pages, 5 figures, 6 tables. The dataset is available at https://huggingface.co/datasets/Codatta/MM-Food-100K

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.10778 2025-08-15 cs.CV cs.AI 62%

Warehouse Spatial Question Answering with LLM Agent

Hsiang-Wei Huang, Jen-Hao Cheng, Kuang-Ming Chen, Cheng-Yen Yang, Bahaa Alattar, Yi-Ru Lin, Pyongkun Kim, Sangwon Kim, Kwangju Kim, Chung-I Huang, Jenq-Neng Hwang

机构 * Information Processing Lab, University of Washington, USA(华盛顿大学信息处理实验室) Electronics and Telecommunications Research Institute, South Korea(韩国电子电信研究院) National Center for High-performance Computing, Taiwan(台湾高性能计算国家研究中心)

专题命中 视觉问答 :MLLM(abstract);分类 cs.CV、cs.AI

Comments 1st Place Solution of the 9th AI City Challenge Track 3

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09945 2025-08-14 cs.CL cs.AI cs.CV 62%

VisCodex: Unified Multimodal Code Generation via Merging Vision and Coding Models

Lingjie Jiang, Shaohan Huang, Xun Wu, Yixia Li, Dongdong Zhang, Furu Wei

专题命中 视觉问答 :multimodal large language model(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07022 2025-08-12 cs.AI cs.CL cs.LG cs.MM 62%

MultiMedEdit: A Scenario-Aware Benchmark for Evaluating Knowledge Editing in Medical VQA

Shengtao Wen, Haodong Chen, Yadong Wang, Zhongying Pan, Xiang Chen, Yu Tian, Bo Qian, Dong Liang, Sheng-Jun Huang

专题命中 视觉问答 :visual reasoning(abstract);分类 cs.AI、cs.LG

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04197 2025-08-07 cs.CV cs.AI 62%

Gather and Trace: Rethinking Video TextVQA from an Instance-oriented Perspective

Yan Zhang, Gangyan Zeng, Daiqing Wu, Huawen Shen, Binbin Li, Yu Zhou, Can Ma, Xiaojun Bi

机构 * Institute of Information Engineering, Chinese Academy of Sciences School of Cyber Security, University of Chinese Academy of Sciences Beijing China School of Cyber Science Engineering, Nanjing University of Science VCIP \& TMCC \& DISSec, College of Computer Science, Nankai University Tianjin China Key Laboratory of Ethnic Language Intelligent Analysis Security Governance of MOE, Minzu University of China Beijing China Institute of Information Engineering, Chinese Academy of Sciences School of Cyber Security, University of Chinese Academy of Sciences VCIP \& TMCC \& DISSec, College of Computer Science, Nankai University Security Governance of MOE, Minzu University of China

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI

Comments Accepted by 2025 ACM MM

详情

展开后加载摘要…

URL PDF HTML 收藏