arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 3129 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 3129 篇

2507.18447 2025-07-25 cs.CV 57%

PDB-Eval: An Evaluation of Large Multimodal Models for Description and Explanation of Personalized Driving Behavior

Junda Wu, Jessica Echterhoff, Kyungtae Han, Amr Abdelraouf, Rohit Gupta, Julian McAuley

机构 * Computer Science and Engineering University of California San Diego(计算机科学与工程大学加州大学圣地亚哥分校) InfoTech Labs Toyota Motor North America(信息科技实验室丰田北美)

专题命中 视觉问答 :MLLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.17262 2025-07-24 cs.CV 57%

VisionTrap: Unanswerable Questions On Visual Data

Asir Saadat, Syem Aziz, Shahriar Mahmud, Abdullah Ibne Masud Mahi, Sabbir Ahmed

机构 * Rochester Institute of Technology(罗切斯特技术学院) Islamic University of Technology(伊斯兰技术大学) United International University(联合国际大学)

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.09815 2025-07-23 cs.CV 57%

VRU-Accident: A Vision-Language Benchmark for Video Question Answering and Dense Captioning for Accident Scene Understanding

Younggun Kim, Ahmed S. Abdelrahman, Mohamed Abdel-Aty

机构 * University of Central Florida(中央佛罗里达大学)

专题命中 视觉问答 :multimodal large language model(abstract);分类 cs.CV

Comments 22 pages, 11 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.16018 2025-07-23 cs.CV 57%

Artifacts and Attention Sinks: Structured Approximations for Efficient Vision Transformers

Andrew Lu, Wentinn Liao, Liuhui Wang, Huzheng Yang, Jianbo Shi

机构 * University of Pennsylvania(宾夕法尼亚大学)

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.15655 2025-07-22 cs.CV 57%

HW-MLVQA: Elucidating Multilingual Handwritten Document Understanding with a Comprehensive VQA Benchmark

Aniket Pal, Ajoy Mondal, Minesh Mathew, C. V. Jawahar

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

Comments This is a minor revision of the original paper submitted to IJDAR

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03433 2025-07-22 cs.CV 57%

ViT-Split: Unleashing the Power of Vision Foundation Models via Efficient Splitting Heads

Yifan Li, Xin Li, Tianqin Li, Wenbin He, Yu Kong, Liu Ren

机构 * Michigan State University(密歇根州立大学) Bosch Research North America & Bosch Center for Artificial Intelligence (BCAI)(博世美国研究部及博世人工智能中心(BCAI)) Carnegie Mellon University(卡内基梅隆大学)

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

Comments The project is available: https://jackyfl.github.io/vitsplit.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.04748 2025-07-08 cs.AI 57%

LLM-based Question-Answer Framework for Sensor-driven HVAC System Interaction

Sungmin Lee, Minju Kang, Joonhee Lee, Seungyong Lee, Dongju Kim, Jingi Hong, Jun Shin, Pei Zhang, JeongGil Ko

机构 * School of Integrated Technology, Yonsei University(延世大学集成技术学院) LG Electronics(LG电子) Department of Electrical and Computer Engineering, University of Michigan(密歇根大学电气与计算机工程系) Graduate School of Artificial Intelligence, POSTECH(POSTECH人工智能研究生院)

专题命中 视觉问答 :grounding(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.04590 2025-07-08 cs.CV cs.CL 57%

VLM2Vec-V2: Advancing Multimodal Embedding for Videos, Images, and Visual Documents

Rui Meng, Ziyan Jiang, Ye Liu, Mingyi Su, Xinyi Yang, Yuepeng Fu, Can Qin, Zeyuan Chen, Ran Xu, Caiming Xiong, Yingbo Zhou, Wenhu Chen, Semih Yavuz

机构 * Salesforce Research(Salesforce研究机构) UC Santa Barbara(加州大学圣巴巴拉分校) University of Waterloo(滑铁卢大学) Tsinghua University(清华大学)

专题命中 视觉问答 :grounding(abstract);分类 cs.CV

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12890 2025-07-08 cs.CV 57%

Specialized Foundation Models for Intelligent Operating Rooms

Ege Özsoy, Chantal Pellegrini, David Bani-Harouni, Kun Yuan, Matthias Keicher, Nassir Navab

专题命中 视觉问答 :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21319 2025-07-03 cs.HC cs.CV 57%

SimVecVis: A Dataset for Enhancing MLLMs in Visualization Understanding

Can Liu, Chunlin Da, Xiaoxiao Long, Yuxiao Yang, Yu Zhang, Yong Wang

机构 * Nanyang Technological University(南洋理工大学) ByteDance Inc.(字节跳动公司) Nanjing University(南京大学) Tsinghua University(清华大学) University of Oxford(牛津大学)

专题命中 视觉问答 :multimodal large language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.19967 2025-06-26 cs.CL cs.AI 57%

Inference Scaled GraphRAG: Improving Multi Hop Question Answering on Knowledge Graphs

Travis Thompson, Seung-Hwan Lim, Paul Liu, Ruoying He, Dongkuan Xu

机构 * North Carolina State University(北卡罗来纳州立大学) Oak Ridge National Laboratory(奥本海默国家实验室)

专题命中 视觉问答 :grounding(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.18272 2025-06-24 cs.CV 57%

ReFrame: Rectification Framework for Image Explaining Architectures

Debjyoti Das Adhikary, Aritra Hazra, Partha Pratim Chakrabarti

机构 * Indian Institute of Technology, Kharagpur(印度理工学院,克拉格浦尔)

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

Comments Accepted in CODS-COMAD December 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.12733 2025-06-17 cs.CV 57%

Learning to Fuse: Modality-Aware Adaptive Scheduling for Robust Multimodal Foundation Models

Liam Bennett, Mason Clark, Lucas Anderson, Hana Satou, Olivia Martinez

机构 * Alan Mitkiy, Michael Johnson, Sofia García, Hana Satou(未知机构)

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.01208 2025-06-17 cs.CV cs.CL 57%

Watch Out Your Album! On the Inadvertent Privacy Memorization in Multi-Modal Large Language Models

Tianjie Ju, Yi Hua, Hao Fei, Zhenyu Shao, Yubin Zheng, Haodong Zhao, Mong-Li Lee, Wynne Hsu, Zhuosheng Zhang, Gongshen Liu

机构 * Shanghai Jiao Tong University(上海交通大学) National University of Singapore(新加坡国立大学)

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

Comments Accepted at ICML 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10389 2025-06-13 cs.LG 57%

EQA-RM: A Generative Embodied Reward Model with Test-time Scaling

Yuhang Chen, Zhen Tan, Tianlong Chen

机构 * The University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) Arizona State University(亚利桑那州立大学)

专题命中 视觉问答 :grounding(abstract);分类 cs.LG

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09645 2025-06-12 cs.CL cs.IR cs.LG 57%

Learning Efficient and Generalizable Graph Retriever for Knowledge-Graph Question Answering

Tianjun Yao, Haoxuan Li, Zhiqiang Shen, Pan Li, Tongliang Liu, Kun Zhang

机构 * Mohamed bin Zayed University of Artificial Intelligence(莫扎德·本·扎耶德人工智能大学) Peking university(北京大学) Georgia Institute of Technology(佐治亚理工学院) The University of Sydney(悉尼大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 视觉问答 :grounding(abstract);分类 cs.LG

Comments 32 pages, 28 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09473 2025-06-12 cs.CV 57%

Provoking Multi-modal Few-Shot LVLM via Exploration-Exploitation In-Context Learning

Cheng Chen, Yunpeng Zhai, Yifan Zhao, Jinyang Gao, Bolin Ding, Jia Li

机构 * State Key Laboratory of Virtual Reality Technology and Systems(虚拟现实技术与系统国家重点实验室) Tongyi Lab, Alibaba Group(阿里云实验室)

专题命中 视觉问答 :vision-language model(abstract);分类 cs.CV

Comments 10 pages, 6 figures, CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08553 2025-06-11 cs.CV 57%

From Pixels to Graphs: using Scene and Knowledge Graphs for HD-EPIC VQA Challenge

Agnese Taluzzi, Davide Gesualdi, Riccardo Santambrogio, Chiara Plizzari, Francesca Palermo, Simone Mentasti, Matteo Matteucci

机构 * Politecnico di Milano(米兰理工大学) EssilorLuxottica(Essilor Luxottica)

专题命中 视觉问答 :MLLM(abstract);分类 cs.CV

Comments Technical report for the HD-EPIC VQA Challenge 2025 (1st place)

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.19593 2025-06-11 cs.CL cs.CV 57%

SK-VQA: Synthetic Knowledge Generation at Scale for Training Context-Augmented Multimodal LLMs

Xin Su, Man Luo, Kris W Pan, Tien Pei Chou, Vasudev Lal, Phillip Howard

机构 * Intel Labs(英特尔实验室) Amazon(亚马逊)

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

Comments ICML 2025 Spotlight Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.05153 2025-06-10 cs.CV 57%

Hummingbird: High Fidelity Image Generation via Multimodal Context Alignment

Minh-Quan Le, Gaurav Mittal, Tianjian Meng, A S M Iftekhar, Vishwas Suryanarayanan, Barun Patra, Dimitris Samaras, Mei Chen

机构 * Microsoft(微软公司) Stony Brook University(史蒂文尼森布鲁克大学)

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

Comments Accepted to ICLR 2025. Project page with code release: https://roar-ai.github.io/hummingbird

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05287 2025-06-06 cs.CV 57%

EOC-Bench: Can MLLMs Identify, Recall, and Forecast Objects in an Egocentric World?

Yuqian Yuan, Ronghao Dang, Long Li, Wentong Li, Dian Jiao, Xin Li, Deli Zhao, Fan Wang, Wenqiao Zhang, Jun Xiao, Yueting Zhuang

机构 * Zhejiang University(浙江大学) DAMO Academy, Alibaba Group(达摩院,阿里巴巴集团) Hupan Lab Project Page Code Benchmark(虎跑实验室项目页面代码基准)

专题命中 视觉问答 :multimodal large language model(abstract);分类 cs.CV

Comments 32pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02544 2025-06-06 cs.CL cs.AI cs.IR 57%

CoRe-MMRAG: Cross-Source Knowledge Reconciliation for Multimodal RAG

Yang Tian, Fan Liu, Jingyuan Zhang, Victoria W., Yupeng Hu, Liqiang Nie

专题命中 视觉问答 :multimodal large language model(abstract);分类 cs.AI

Comments Accepted to ACL 2025 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03665 2025-06-05 cs.CL cs.CV 57%

ROSA: Addressing text understanding challenges in photographs via ROtated SAmpling

Hernán Maina, Guido Ivetta, Mateo Lione Stuto, Julian Martin Eisenschlos, Jorge Sánchez, Luciana Benotti

机构 * FAMAF, Universidad Nacional de Córdoba(科迪贝拉大学法玛大学分校) CONICET(阿根廷国家科研 council) Fundación Vía Libre(自由之路基金会) Mercado Libre Inc.(Mercado Libre公司)

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01319 2025-06-03 cs.SD cs.CV cs.MM eess.AS 57%

Learning Sparsity for Effective and Efficient Music Performance Question Answering

Xingjian Diao, Tianzhen Yang, Chunhui Zhang, Weiyi Wu, Ming Cheng, Jiang Gui

机构 * Dartmouth College(达特茅斯学院) Yale University(耶鲁大学)

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

Comments Accepted to the main conference of the 63rd Annual Meeting of the Association for Computational Linguistics (ACL 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01174 2025-06-03 cs.AI 57%

GraphPad: Inference-Time 3D Scene Graph Updates for Embodied Question Answering

Muhammad Qasim Ali, Saeejith Nair, Alexander Wong, Yuchen Cui, Yuhao Chen

机构 * University of Waterloo(滑铁卢大学) University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 视觉问答 :vision-language model(abstract);分类 cs.AI

Comments CVPR 2025 Workshop on 3D-LLM/VLA: Bridging Language, Vision and Action in 3D Environments

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.08145 2025-06-03 cs.CL cs.CV 57%

Insight Over Sight: Exploring the Vision-Knowledge Conflicts in Multimodal LLMs

Xiaoyuan Liu, Wenxuan Wang, Youliang Yuan, Jen-tse Huang, Qiuzhi Liu, Pinjia He, Zhaopeng Tu

机构 * School of Data Science, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)数据科学学院) Tencent(腾讯) Renmin University of China(中国人民大学) Johns Hopkins University(约翰霍普金斯大学)

专题命中 视觉问答 :multimodal large language model(abstract);分类 cs.CV

Comments Accepted by ACL 2025 main

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24227 2025-06-02 cs.CV cs.CR 57%

Light as Deception: GPT-driven Natural Relighting Against Vision-Language Pre-training Models

Ying Yang, Jie Zhang, Xiao Lv, Di Lin, Tao Xiang, Qing Guo

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23484 2025-05-30 cs.CV 57%

VCapsBench: A Large-scale Fine-grained Benchmark for Video Caption Quality Evaluation

Shi-Xue Zhang, Hongfa Wang, Duojun Huang, Xin Li, Xiaobin Zhu, Xu-Cheng Yin

机构 * University of Science and Technology Beijing(北京科技大学) Tencent(腾讯) Tsinghua Shenzhen International Graduate School(清华大学深圳国际研究生院)

专题命中 视觉问答 :vision-language model(abstract);分类 cs.CV

Comments submitting

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23143 2025-05-30 cs.CV 57%

Interpreting Chest X-rays Like a Radiologist: A Benchmark with Clinical Reasoning

Jinquan Guan, Qi Chen, Lizhou Liang, Yuhang Liu, Vu Minh Hieu Phan, Minh-Son To, Jian Chen, Yutong Xie

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

Comments 10 pages (main text), 18 pages (appendix)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.00954 2025-05-29 cs.CV 57%

Hypo3D: Exploring Hypothetical Reasoning in 3D

Ye Mao, Weixun Luo, Junpeng Jing, Anlan Qiu, Krystian Mikolajczyk

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

Comments 24 pages, 15 figures, 15 tables

详情

展开后加载摘要…

URL PDF HTML 收藏