arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 3129 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 3129 篇

2503.20776 2025-03-31 cs.CV 57%

Feature4X: Bridging Any Monocular Video to 4D Agentic AI with Versatile Gaussian Feature Fields

Shijie Zhou, Hui Ren, Yijia Weng, Shuwang Zhang, Zhen Wang, Dejia Xu, Zhiwen Fan, Suya You, Zhangyang Wang, Leonidas Guibas, Achuta Kadambi

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.19120 2025-03-26 cs.CL cs.AI 57%

Where is this coming from? Making groundedness count in the evaluation of Document VQA models

Armineh Nourbakhsh, Siddharth Parekh, Pranav Shetty, Zhao Jin, Sameena Shah, Carolyn Rose

专题命中 视觉问答 :visual question answering(abstract);分类 cs.AI

Comments Accepted to NAACL Findings 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.18536 2025-03-25 cs.CV 57%

DiN: Diffusion Model for Robust Medical VQA with Semantic Noisy Labels

Erjian Guo, Zhen Zhao, Zicheng Wang, Tong Chen, Yunyi Liu, Luping Zhou

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.20972 2025-03-25 cs.CV 57%

Attention Overlap Is Responsible for The Entity Missing Problem in Text-to-image Diffusion Models!

Arash Marioriyad, Mohammadali Banayeeanzade, Reza Abbasi, Mohammad Hossein Rohban, Mahdieh Soleymani Baghshah

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

Comments TMLR - 2025

Journal ref Transactions on Machine Learning Research, 2025, 2835-8856

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.17827 2025-03-25 cs.CV 57%

4D-Bench: Benchmarking Multi-modal Large Language Models for 4D Object Understanding

Wenxuan Zhu, Bing Li, Cheng Zheng, Jinjie Mai, Jun Chen, Letian Jiang, Abdullah Hamdi, Sara Rojas Martinez, Chia-Wen Lin, Mohamed Elhoseiny, Bernard Ghanem

专题命中 视觉问答 :multimodal large language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.16032 2025-03-21 cs.CV 57%

Agentic Keyframe Search for Video Question Answering

Sunqi Fan, Meng-Hao Guo, Shuojin Yang

专题命中 视觉问答 :visual reasoning(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.15887 2025-03-21 cs.CV 57%

DocVideoQA: Towards Comprehensive Understanding of Document-Centric Videos through Question Answering

Haochen Wang, Kai Hu, Liangcai Gao

专题命中 视觉问答 :MLLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10586 2025-03-18 cs.CV 57%

Unlock the Power of Unlabeled Data in Language Driving Model

Chaoqun Wang, Jie Yang, Xiaobin Hong, Ruimao Zhang

专题命中 视觉问答 :InternVL(abstract);分类 cs.CV

Comments Accepted by ICRA2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.11481 2025-03-17 cs.CV 57%

T2I-FineEval: Fine-Grained Compositional Metric for Text-to-Image Evaluation

Seyed Mohammad Hadi Hosseini, Amir Mohammad Izadi, Ali Abdollahi, Armin Saghafian, Mahdieh Soleymani Baghshah

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

Comments Accepted at ECCV 2024 Workshop EVAL-FoMo

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.09590 2025-03-14 cs.CV 57%

BIMBA: Selective-Scan Compression for Long-Range Video Question Answering

Md Mohaiminul Islam, Tushar Nagarajan, Huiyu Wang, Gedas Bertasius, Lorenzo Torresani

专题命中 视觉问答 :MLLM(abstract);分类 cs.CV

Comments Accepted by CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.05780 2025-03-12 cs.LG stat.ML 57%

Breaking Neural Network Scaling Laws with Modularity

Akhilan Boopathy, Sunshine Jiang, William Yue, Jaedong Hwang, Abhiram Iyer, Ila Fiete

专题命中 视觉问答 :visual question answering(abstract);分类 cs.LG

Comments ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.07429 2025-03-11 cs.AI 57%

From Text to Visuals: Using LLMs to Generate Math Diagrams with Vector Graphics

Jaewook Lee, Jeongah Lee, Wanyong Feng, Andrew Lan

专题命中 视觉问答 :visual question answering(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06380 2025-03-11 cs.CV cs.CL 57%

TI-JEPA: An Innovative Energy-based Joint Embedding Strategy for Text-Image Multimodal Systems

Khang H. N. Vo, Duc P. T. Nguyen, Thong Nguyen, Tho T. Quan

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06296 2025-03-11 cs.CL cs.LG 57%

MoEMoE: Question Guided Dense and Scalable Sparse Mixture-of-Expert for Multi-source Multi-modal Answering

Vinay Kumar Verma, Shreyas Sunil Kulkarni, Happy Mittal, Deepak Gupta

专题命中 视觉问答 :visual question answering(abstract);分类 cs.LG

Comments To appear at NAACL Industry Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.04095 2025-03-10 cs.CL cs.AI 57%

Chart-HQA: A Benchmark for Hypothetical Question Answering in Charts

Xiangnan Chen, Yuancheng Fang, Qian Xiao, Juncheng Li, Jun Lin, Siliang Tang, Yi Yang, Yueting Zhuang

专题命中 视觉问答 :multimodal large language model(abstract);分类 cs.AI

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.11006 2025-03-07 cs.CR cs.AI 57%

BackdoorMBTI: A Backdoor Learning Multimodal Benchmark Tool Kit for Backdoor Defense Evaluation

Haiyang Yu, Tian Xie, Jiaping Gui, Pengyang Wang, Ping Yi, Yue Wu

专题命中 视觉问答 :visual question answering(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.16486 2025-02-27 cs.CV 57%

MQADet: A Plug-and-Play Paradigm for Enhancing Open-Vocabulary Object Detection via Multimodal Question Answering

Caixiong Li, Xiongwei Zhao, Jinhang Zhang, Xing Zhang, Qihao Sun, Zhou Wu

专题命中 视觉问答 :multimodal large language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.09906 2025-02-17 cs.CV 57%

Insect-Foundation: A Foundation Model and Large Multimodal Dataset for Vision-Language Insect Understanding

Thanh-Dat Truong, Hoang-Quan Nguyen, Xuan-Bac Nguyen, Ashley Dowling, Xin Li, Khoa Luu

专题命中 视觉问答 :LLaVA(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.09285 2025-02-14 cs.CV cs.CY 57%

EmoAssist: Emotional Assistant for Visual Impairment Community

Xingyu Qi, He Li, Linjie Li, Zhenyu Wu

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.05738 2025-02-11 cs.CV 57%

Performance Analysis of Traditional VQA Models Under Limited Computational Resources

Jihao Gu

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

Comments 6 pages, 1 figure, 5 tabels, the paper has been accepted by the PRML'25 conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.15453 2025-02-07 cs.CL cs.CV 57%

CROPE: Evaluating In-Context Adaptation of Vision and Language Models to Culture-Specific Concepts

Malvina Nikandrou, Georgios Pantazopoulos, Nikolas Vitsakis, Ioannis Konstas, Alessandro Suglia

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.02449 2025-02-05 cs.CV 57%

TUMTraffic-VideoQA: A Benchmark for Unified Spatio-Temporal Video Understanding in Traffic Scenes

Xingcheng Zhou, Konstantinos Larintzakis, Hao Guo, Walter Zimmer, Mingyu Liu, Hu Cao, Jiajie Zhang, Venkatnarayanan Lakshminarasimhan, Leah Strand, Alois C. Knoll

专题命中 视觉问答 :grounding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.01292 2025-02-04 cs.CV 57%

LSceneLLM: Enhancing Large 3D Scene Understanding Using Adaptive Visual Preferences

Hongyan Zhi, Peihao Chen, Junyan Li, Shuailei Ma, Xinyu Sun, Tianhang Xiang, Yinjie Lei, Mingkui Tan, Chuang Gan

专题命中 视觉问答 :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.14520 2025-01-27 eess.SP cs.CV 57%

Scene Understanding Enabled Semantic Communication with Open Channel Coding

Zhe Xiang, Fei Yu, Quan Deng, Yuandi Li, Zhiguo Wan

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.07214 2025-01-14 cs.CV 57%

TimeLogic: A Temporal Logic Benchmark for Video QA

Sirnam Swetha, Hilde Kuehne, Mubarak Shah

专题命中 视觉问答 :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.06189 2025-01-14 cs.AI cs.CL 57%

A Multimodal Social Agent

Athina Bikaki, Ioannis A. Kakadiaris

专题命中 视觉问答 :visual question answering(abstract);分类 cs.AI

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.12926 2025-01-14 cs.AI 57%

MM-PhyRLHF: Reinforcement Learning Framework for Multimodal Physics Question-Answering

Janak Kapuriya, Chhavi Kirtani, Apoorv Singh, Jay Saraf, Naman Lal, Jatin Kumar, Adarsh Raj Shivam, Astha Verma, Avinash Anand, Rajiv Ratn Shah

专题命中 视觉问答 :LLaVA(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.19304 2024-12-30 cs.CV 57%

Perceive, Query & Reason: Enhancing Video QA with Question-Guided Temporal Queries

Roberto Amoroso, Gengyuan Zhang, Rajat Koner, Lorenzo Baraldi, Rita Cucchiara, Volker Tresp

专题命中 视觉问答 :multimodal large language model(abstract);分类 cs.CV

Comments WACV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.15574 2024-12-23 cs.CV 57%

J-EDI QA: Benchmark for deep-sea organism-specific multimodal LLM

Takero Yoshida, Yuikazu Ito, Yoshihiro Fujiwara, Shinji Tsuchida, Daisuke Sugiyama, Daisuke Matsuoka

专题命中 视觉问答 :multimodal large language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.15514 2024-12-23 cs.CV cs.MM 57%

PolySmart @ TRECVid 2024 Medical Video Question Answering

Jiaxin Wu, Yiyang Jiang, Xiao-Yong Wei, Qing Li

专题命中 视觉问答 :LLaVA(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏