arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 3129 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 3129 篇

2410.08695 2025-05-27 cs.CV 57%

Dynamic Multimodal Evaluation with Flexible Complexity by Vision-Language Bootstrapping

Yue Yang, Shuibai Zhang, Wenqi Shao, Kaipeng Zhang, Yi Bin, Yu Wang, Ping Luo

机构 * School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院) Shanghai AI Laboratory(上海人工智能实验室) Tongji University(同济大学) The University of Hong Kong(香港大学)

专题命中 视觉问答 :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.11117 2025-05-26 cs.CV 57%

Beyond the Destination: A Novel Benchmark for Exploration-Aware Embodied Question Answering

Kaixuan Jiang, Yang Liu, Weixing Chen, Jingzhou Luo, Ziliang Chen, Ling Pan, Guanbin Li, Liang Lin

专题命中 视觉问答 :grounding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16229 2025-05-23 cs.CV 57%

CT-Agent: A Multimodal-LLM Agent for 3D CT Radiology Question Answering

Yuren Mao, Wenyi Xu, Yuyang Qin, Yunjun Gao

机构 * School of Software Technology, Zhejiang University(浙江大学软件学院)

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.12532 2025-05-23 cs.AI 57%

CityEQA: A Hierarchical LLM Agent on Embodied Question Answering Benchmark in City Space

Yong Zhao, Kai Xu, Zhengqiu Zhu, Yue Hu, Zhiheng Zheng, Yingfeng Chen, Yatai Ji, Chen Gao, Yong Li, Jincai Huang

机构 * National University of Defense Technology(国防科技大学) Tsinghua University(清华大学)

专题命中 视觉问答 :visual reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.02575 2025-05-23 cs.CV cs.MM 57%

Copy-Move Forgery Detection and Question Answering for Remote Sensing Image

Ze Zhang, Enyuan Zhao, Di Niu, Jie Nie, Xinyue Liang, Lei Huang

机构 * Faculty of Information Science and Engineering, Ocean University of China(信息科学与工程学院,中国海洋大学) Hangzhou Institute for Advanced Study, University of Chinese Academy of Sciences(杭州高等研究院,中国科学院大学)

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

Comments 11 figs, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15755 2025-05-22 cs.CV 57%

Exploring The Visual Feature Space for Multimodal Neural Decoding

Weihao Xia, Cengiz Oztireli

机构 * University of Cambridge(剑桥大学)

专题命中 视觉问答 :multimodal large language model(abstract);分类 cs.CV

Comments Project: https://weihaox.github.io/VINDEX

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15628 2025-05-22 cs.CV 57%

SNAP: A Benchmark for Testing the Effects of Capture Conditions on Fundamental Vision Tasks

Iuliia Kotseruba, John K. Tsotsos

机构 * York University(约克大学)

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15269 2025-05-22 cs.CV 57%

LiveVLM: Efficient Online Video Understanding via Streaming-Oriented KV Cache and Retrieval

Zhenyu Ning, Guangda Liu, Qihao Jin, Wenchao Ding, Minyi Guo, Jieru Zhao

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院) College of Intelligent Robotics and Advanced Manufacturing, Fudan University(复旦大学智能机器人与先进制造学院) Guizhou Provincial Laboratory of Big Data, College of Computer Science and Technology, Guizhou University(贵州大数据省实验室,贵州大学计算机科学与技术学院)

专题命中 视觉问答 :LLaVA(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13520 2025-05-21 cs.IR cs.AI 57%

Beyond Retrieval: Joint Supervision and Multimodal Document Ranking for Textbook Question Answering

Hessa Alawwad, Usman Naseem, Areej Alhothali, Ali Alkhathlan, Amani Jamal

机构 * Faculty of Computing and Information Technology, King Abdulaziz University(计算机与信息科技学院,国王阿卜杜勒阿齐兹大学) College of Computer and Information Science, Imam Mohammad Ibn Saud Islamic University (IMSIU)(计算机与信息科学学院,伊玛目穆罕默德·本·萨乌德伊斯兰大学) School of Computing, Macquarie University(计算学院,麦考瑞大学)

专题命中 视觉问答 :multimodal large language model(abstract);分类 cs.AI

Comments 14 pages, 16 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13429 2025-05-20 cs.CV 57%

Understanding Complexity in VideoQA via Visual Program Generation

Cristobal Eyzaguirre, Igor Vasiljevic, Achal Dave, Jiajun Wu, Rares Andrei Ambrus, Thomas Kollar, Juan Carlos Niebles, Pavel Tokmakov

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12589 2025-05-20 cs.CV 57%

SurveillanceVQA-589K: A Benchmark for Comprehensive Surveillance Video-Language Understanding with Large Models

Bo Liu, Pengfei Qiao, Minhan Ma, Xuange Zhang, Yinan Tang, Peng Xu, Kun Liu, Tongtong Yuan

机构 * Department of Computer Science, Beijing University of Technology(北京理工大学计算机科学系) Inspur Electronic Information Industry Co., Ltd(Inspur电子信息产业有限公司) Department of Electronic Engineering, Tsinghua University(清华大学电子工程系) JD Explore Academy(京东探索研究院)

专题命中 视觉问答 :vision-language model(abstract);分类 cs.CV

Comments The dataset and code are publicly available at: https://huggingface.co/datasets/fei213/SurveillanceVQA-589K

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.10562 2025-05-16 cs.CV 57%

End-to-End Vision Tokenizer Tuning

Wenxuan Wang, Fan Zhang, Yufeng Cui, Haiwen Diao, Zhuoyan Luo, Huchuan Lu, Jing Liu, Xinlong Wang

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Beijing Academy of Artificial Intelligence(北京人工智能研究院) Dalian University of Technology(大连理工大学) Tsinghua University(清华大学)

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.06898 2025-05-13 cs.CV cs.CL 57%

Multi-Modal Explainable Medical AI Assistant for Trustworthy Human-AI Collaboration

Honglong Yang, Shanshan Song, Yi Qin, Lehan Wang, Haonan Wang, Xinpeng Ding, Qixiang Zhang, Bodong Du, Xiaomeng Li

机构 * Department of Electronic and Computer Engineering, The Hong Kong University of Science and Technology(电子与计算机工程系,香港科学与技术大学) Department of Computer Science and Engineering, The Hong Kong University of Science and Technology(计算机科学与工程系,香港科学与技术大学)

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.06328 2025-05-13 cs.AI 57%

A Grounded Memory System For Smart Personal Assistants

Felix Ocker, Jörg Deigmöller, Pavel Smirnov, Julian Eggert

机构 * Honda Research Institute Europe(本田研究院欧洲分部)

专题命中 视觉问答 :vision language model(abstract);分类 cs.AI

Comments 8 pages, 5 figures, accepted for the ESWC 2025 TEXT2KG workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.03046 2025-05-07 cs.RO cs.CV 57%

Sim2Real Transfer for Vision-Based Grasp Verification

Pau Amargant, Peter Hönig, Markus Vincze

机构 * Faculty of Electrical Engineering, Technical University of Vienna(维也纳技术大学电子工程学院) Polytechnic University of Catalonia(加泰罗尼亚理工大学)

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

Comments Accepted at Austrian Robotics Workshop 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.01711 2025-05-06 cs.CV 57%

Knowledge-Augmented Language Models Interpreting Structured Chest X-Ray Findings

Alexander Davis, Rafael Souza, Jia-Hao Lim

机构 * University of Brasilia(巴西大学)

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.08585 2025-04-25 cs.CV 57%

HierarQ: Task-Aware Hierarchical Q-Former for Enhanced Video Understanding

Shehreen Azad, Vibhav Vineet, Yogesh Singh Rawat

机构 * Center for Research in Computer Vision, University of Central Florida(计算机视觉研究中心,中央佛罗里达大学) Microsoft Research(微软研究院)

专题命中 视觉问答 :multimodal large language model(abstract);分类 cs.CV

Comments Accepted in CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.15135 2025-04-22 cs.IR cs.AI cs.CL 57%

KGMEL: Knowledge Graph-Enhanced Multimodal Entity Linking

Juyeon Kim, Geon Lee, Taeuk Kim, Kijung Shin

机构 * KAIST(韩国科学技术院) Hanyang University(翰林大学)

专题命中 视觉问答 :vision-language model(abstract);分类 cs.AI

Comments SIGIR 2025 (Short)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.10074 2025-04-22 cs.AI 57%

MMKB-RAG: A Multi-Modal Knowledge-Based Retrieval-Augmented Generation Framework

Zihan Ling, Zhiyao Guo, Yixuan Huang, Yi An, Shuai Xiao, Jinsong Lan, Xiaoyong Zhu, Bo Zheng

机构 * Peking University(北京大学) Alibaba Group(阿里巴巴集团)

专题命中 视觉问答 :MLLM(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.13112 2025-04-18 cs.LG 57%

Hadamard product in deep learning: Introduction, Advances and Challenges

Grigorios G Chrysos, Yongtao Wu, Razvan Pascanu, Philip Torr, Volkan Cevher

专题命中 视觉问答 :visual question answering(abstract);分类 cs.LG

Comments Accepted in IEEE T-PAMI

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.01798 2025-04-18 cs.CV 57%

SEAL: Semantic Attention Learning for Long Video Representation

Lan Wang, Yujia Chen, Du Tran, Vishnu Naresh Boddeti, Wen-Sheng Chu

专题命中 视觉问答 :grounding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.11858 2025-04-14 cs.CV cs.CL 57%

EmbodiedEval: Evaluate Multimodal LLMs as Embodied Agents

Zhili Cheng, Yuge Tu, Ran Li, Shiqi Dai, Jinyi Hu, Shengding Hu, Jiahao Li, Yang Shi, Tianyu Yu, Weize Chen, Lei Shi, Maosong Sun

专题命中 视觉问答 :multimodal large language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.05463 2025-04-09 cs.CV 57%

REVEAL: Relation-based Video Representation Learning for Video-Question-Answering

Sofian Chaybouti, Walid Bousselham, Moritz Wolter, Hilde Kuehne

专题命中 视觉问答 :VLM(abstract);分类 cs.CV

Comments 18 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.03641 2025-04-08 cs.CV 57%

MME-Unify: A Comprehensive Benchmark for Unified Multimodal Understanding and Generation Models

Wulin Xie, Yi-Fan Zhang, Chaoyou Fu, Yang Shi, Bingyan Nie, Hongkai Chen, Zhang Zhang, Liang Wang, Tieniu Tan

专题命中 视觉问答 :MLLM(abstract);分类 cs.CV

Comments Project page: https://mme-unify.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.04789 2025-04-08 cs.AI 57%

Multimodal Agricultural Agent Architecture (MA3): A New Paradigm for Intelligent Agricultural Decision-Making

Zhuoning Xu, Jian Xu, Mingqing Zhang, Peijie Wang, Chao Deng, Cheng-Lin Liu

专题命中 视觉问答 :visual question answering(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.23130 2025-04-07 cs.CV cs.CL cs.RO 57%

Can DeepSeek Reason Like a Surgeon? An Empirical Evaluation for Vision-Language Understanding in Robotic-Assisted Surgery

Boyi Ma, Yanguang Zhao, Jie Wang, Guankun Wang, Kun Yuan, Tong Chen, Long Bai, Hongliang Ren

专题命中 视觉问答 :multimodal large language model(abstract);分类 cs.CV

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.00487 2025-04-03 cs.MM cs.CL cs.CV 57%

FortisAVQA and MAVEN: a Benchmark Dataset and Debiasing Framework for Robust Multimodal Reasoning

Jie Ma, Zhitao Gao, Qi Chai, Jun Liu, Pinghui Wang, Jing Tao, Zhou Su

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.01017 2025-04-02 cs.CV 57%

Scaling Language-Free Visual Representation Learning

David Fan, Shengbang Tong, Jiachen Zhu, Koustuv Sinha, Zhuang Liu, Xinlei Chen, Michael Rabbat, Nicolas Ballas, Yann LeCun, Amir Bar, Saining Xie

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

Comments Project page at https://davidfan.io/webssl/

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.00379 2025-04-02 cs.CV 57%

MPDrive: Improving Spatial Understanding with Marker-Based Prompt Learning for Autonomous Driving

Zhiyuan Zhang, Xiaofan Li, Zhihao Xu, Wenjie Peng, Zijian Zhou, Miaojing Shi, Shuangping Huang

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

Comments Accepted by CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.22420 2025-04-02 cs.CV 57%

Unveiling the Mist over 3D Vision-Language Understanding: Object-centric Evaluation with Chain-of-Analysis

Jiangyong Huang, Baoxiong Jia, Yan Wang, Ziyu Zhu, Xiongkun Linghu, Qing Li, Song-Chun Zhu, Siyuan Huang

专题命中 视觉问答 :grounding(abstract);分类 cs.CV

Comments CVPR 2025. Project page: https://beacon-3d.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏