arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 3126 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 3126 篇

2503.06271 2025-08-05 cs.CV 70%

SplatTalk: 3D VQA with Gaussian Splatting

Anh Thai, Songyou Peng, Kyle Genova, Leonidas Guibas, Thomas Funkhouser

机构 * Georgia Institute of Technology(佐治亚理工学院) Google DeepMind(谷歌DeepMind)

专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract);分类 cs.CV

Comments Accepted at ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.13411 2025-07-21 cs.CL cs.AI 70%

Aligning Knowledge Graphs and Language Models for Factual Accuracy

Nur A Zarin Nishat, Andrea Coletta, Luigi Bellomarini, Kossi Amouzouvi, Jens Lehmann, Sahar Vahdati

机构 * TIB – Leibniz Information Centre for Science and Technology(莱比锡信息科学与技术研究中心) Amazon, Germany(亚马逊公司)

专题命中 视觉问答 :LLaVA(abstract);grounding(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.05928 2025-07-14 cs.CV 70%

ClinKD: Cross-Modal Clinical Knowledge Distiller For Multi-Task Medical Images

Hongyu Ge, Longkun Hao, Zihui Xu, Zhenxin Lin, Bin Li, Shoujun Zhou, Hongjin Zhao, Yihang Liu

机构 * The Hong Kong University of Sciences and Technology, Guangzhou(香港科学与技术大学(广州)) Beihang University(北航大学) Shandong University(山东大学) Hubei University(湖北大学) Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究所) Australian National University(澳大利亚国立大学)

专题命中 视觉问答 :visual question answering(abstract);multimodal large language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.07902 2025-07-11 cs.CV 70%

MIRA: A Novel Framework for Fusing Modalities in Medical RAG

Jinhong Wang, Tajamul Ashraf, Zongyan Han, Jorma Laaksonen, Rao Mohammad Anwer

机构 * Department of Computer Vision, MBZUAI(视觉计算系,MBZUAI) Department of Computer Science, Aalto University(计算机科学系,阿alto大学)

专题命中 视觉问答 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

Comments ACM Multimedia 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.07079 2025-07-10 cs.CV 70%

Evaluating Attribute Confusion in Fashion Text-to-Image Generation

Ziyue Liu, Federico Girella, Yiming Wang, Davide Talon

机构 * University of Verona(威尼斯大学) Polytechnic University of Turin(都灵理工大学) Fondazione Bruno Kessler(布鲁诺·科塞勒基金会)

专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract);分类 cs.CV

Comments Accepted to ICIAP25. Project page: site [https://intelligolabs.github.io/L-VQAScore/\

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.15484 2025-07-08 cs.CV 70%

Toward Robust Hyper-Detailed Image Captioning: A Multiagent Approach and Dual Evaluation Metrics for Factuality and Coverage

Saehyung Lee, Seunghyun Yoon, Trung Bui, Jing Shi, Sungroh Yoon

机构 * Department of Electrical and Computer Engineering, Seoul National University(电气与计算机工程系,首尔国立大学) Interdisciplinary Program in Artificial Intelligence, Seoul National University(人工智能交叉学科项目,首尔国立大学) Adobe Research(Adobe研究)

专题命中 视觉问答 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

Comments ICML 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.02001 2025-07-04 cs.LG 70%

Temporal Chain of Thought: Long-Video Understanding by Thinking in Frames

Anurag Arnab, Ahmet Iscen, Mathilde Caron, Alireza Fathi, Cordelia Schmid

机构 * Google DeepMind(谷歌DeepMind)

专题命中 视觉问答 :vision-language model(abstract);VLM(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.17664 2025-06-24 cs.CV 70%

MDSAM:Memory-Driven Sparse Attention Matrix for LVLMs Hallucination Mitigation

Shuaiye Lu, Linjiang Zhou, Xiaochuan Shi

机构 * Wuhan University(武汉大学)

专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07837 2025-06-10 cs.AI 70%

HAIBU-ReMUD: Reasoning Multimodal Ultrasound Dataset and Model Bridging to General Specific Domains

Shijie Wang, Yilun Zhang, Zeyu Lai, Dexing Kong

机构 * School of Mathematical Sciences, Zhejiang University(浙江大学数学科学学院)

专题命中 视觉问答 :visual question answering(abstract);multimodal large language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06279 2025-06-09 cs.CV 70%

CoMemo: LVLMs Need Image Context with Image Memory

Shi Liu, Weijie Su, Xizhou Zhu, Wenhai Wang, Jifeng Dai

机构 * Shi Liu Weijie Su Xizhou Zhu Wenhai Wang Jifeng Dai

专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract);分类 cs.CV

Comments ICML 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.18034 2025-06-02 cs.CV cs.CL 70%

Expanding the Boundaries of Vision Prior Knowledge in Multi-modal Large Language Models

Qiao Liang, Yanjiang Liu, Weixiang Zhou, Ben He, Yaojie Lu, Hongyu Lin, Jia Zheng, Xianpei Han, Le Sun, Yingfei Sun

机构 * University of Chinese Academy of Sciences(中国科学院大学) Chinese Information Processing Laboratory, Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所信息处理实验室)

专题命中 视觉问答 :visual question answering(abstract);MLLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.13199 2025-05-28 cs.CR cs.AI 70%

Building Trustworthy Multimodal AI: A Review of Fairness, Transparency, and Ethics in Vision-Language Tasks

Mohammad Saleh, Azadeh Tabatabaei

专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract);分类 cs.AI

Journal ref International Journal of Web Research, vol.8, no.2,pp.11-24, 2025,

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15529 2025-05-22 cs.CV 70%

Clapper: Compact Learning and Video Representation in VLMs

Lingyu Kong, Hongzhi Zhang, Jingyuan Zhang, Jianzhao Huang, Kunze Li, Qi Wang, Fuzheng Zhang

机构 * University of Chinese Academy of Sciences(中国科学院大学) Kuaishou Technology(快手科技) Xi’an Jiaotong University(西安交通大学)

专题命中 视觉问答 :vision-language model(abstract);VLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.15477 2025-05-22 cs.CV 70%

MediConfusion: Can you trust your AI radiologist? Probing the reliability of multimodal medical foundation models

Mohammad Shahab Sepehri, Zalan Fabian, Maryam Soltanolkotabi, Mahdi Soltanolkotabi

机构 * Department of Electrical and Computer Engineering, University of Southern California(电气与计算机工程系,南加州大学) Department of Radiology and Imaging Sciences, University of Utah(放射学与影像科学系,犹他大学)

专题命中 视觉问答 :visual question answering(abstract);multimodal large language model(abstract);分类 cs.CV

Comments 24 Pages, 9 figures, The Thirteenth International Conference on Learning Representations (ICLR) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14627 2025-05-21 cs.AI cs.CL 70%

Debating for Better Reasoning: An Unsupervised Multimodal Approach

Ashutosh Adhikari, Mirella Lapata

专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.02413 2025-05-06 cs.AI 70%

Task-Oriented Semantic Communication in Large Multimodal Models-based Vehicle Networks

Baoxia Du, Hongyang Du, Dusit Niyato, Ruidong Li

机构 * Institute of Science and Engineering, Kanazawa University(金泽大学科学与工程研究所) Department of Electrical and Electronic Engineering, University of Hong Kong(香港大学电子与电气工程系) College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院)

专题命中 视觉问答 :LLaVA(abstract);visual question answering(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.09809 2025-04-23 cs.HC cs.AI 70%

See or Recall: A Sanity Check for the Role of Vision in Solving Visualization Question Answer Tasks with Multimodal LLMs

Zhimin Li, Haichao Miao, Xinyuan Yan, Valerio Pascucci, Matthew Berger, Shusen Liu

机构 * Vanderbilt University(范德比大学) Lawrence Livermore National Laboratory(劳伦斯利弗莫尔国家实验室) University of Utah(犹他大学)

专题命中 视觉问答 :multimodal large language model(abstract);MLLM(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.07556 2025-04-11 cs.CV 70%

TokenFocus-VQA: Enhancing Text-to-Image Alignment with Position-Aware Focus and Multi-Perspective Aggregations on LVLMs

Zijian Zhang, Xuhui Zheng, Xuecheng Wu, Chong Peng, Xuezhi Cao

专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract);分类 cs.CV

Comments 10 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.02244 2025-04-04 cs.CV 70%

SocialGesture: Delving into Multi-person Gesture Understanding

Xu Cao, Pranav Virupaksha, Wenqi Jia, Bolin Lai, Fiona Ryan, Sangmin Lee, James M. Rehg

专题命中 视觉问答 :vision language model(abstract);visual question answering(abstract);分类 cs.CV

Comments CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.00654 2025-04-02 cs.CV 70%

QG-VTC: Question-Guided Visual Token Compression in MLLMs for Efficient VQA

Shuai Li, Jian Xu, Xiao-Hui Li, Chao Deng, Lin-Lin Huang

专题命中 视觉问答 :visual question answering(abstract);MLLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.13164 2025-04-02 cs.LG 70%

VL-ICL Bench: The Devil in the Details of Multimodal In-Context Learning

Yongshuo Zong, Ondrej Bohdal, Timothy Hospedales

专题命中 视觉问答 :visual question answering(abstract);grounding(abstract);分类 cs.LG

Comments ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.21910 2025-03-31 cs.CL cs.AI 70%

JEEM: Vision-Language Understanding in Four Arabic Dialects

Karima Kadaoui, Hanin Atwany, Hamdan Al-Ali, Abdelrahman Mohamed, Ali Mekky, Sergei Tilga, Natalia Fedorova, Ekaterina Artemova, Hanan Aldarmaki, Yova Kementchedjhieva

专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.07411 2025-03-24 cs.CV cs.MM 70%

EgoTextVQA: Towards Egocentric Scene-Text Aware Video Question Answering

Sheng Zhou, Junbin Xiao, Qingyun Li, Yicong Li, Xun Yang, Dan Guo, Meng Wang, Tat-Seng Chua, Angela Yao

专题命中 视觉问答 :grounding(abstract);multimodal large language model(abstract);分类 cs.CV

Comments Accepted by CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.08144 2025-03-21 cs.CV 70%

Bring Remote Sensing Object Detect Into Nature Language Model: Using SFT Method

Fei Wang, Chengcheng Chen, Hongyu Chen, Yugang Chang, Weiming Zeng

专题命中 视觉问答 :vision-language model(abstract);VLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.10638 2025-03-20 cs.CV 70%

Unveiling the Ignorance of MLLMs: Seeing Clearly, Answering Incorrectly

Yexin Liu, Zhengyang Liang, Yueze Wang, Xianfeng Wu, Feilong Tang, Muyang He, Jian Li, Zheng Liu, Harry Yang, Sernam Lim, Bo Zhao

专题命中 视觉问答 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.13317 2025-03-14 cs.CV 70%

Teaching VLMs to Localize Specific Objects from In-context Examples

Sivan Doveh, Nimrod Shabtay, Wei Lin, Eli Schwartz, Hilde Kuehne, Raja Giryes, Rogerio Feris, Leonid Karlinsky, James Glass, Assaf Arbelle, Shimon Ullman, M. Jehanzeb Mirza

专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.00901 2025-03-04 cs.CV 70%

FunBench: Benchmarking Fundus Reading Skills of MLLMs

Qijie Wei, Kaiheng Qian, Xirong Li

专题命中 视觉问答 :visual question answering(abstract);multimodal large language model(abstract);分类 cs.CV

Comments 7 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.18725 2025-02-27 cs.AI cs.CL q-bio.NC 70%

Talking to the brain: Using Large Language Models as Proxies to Model Brain Semantic Representation

Xin Liu, Ziyue Zhang, Jingxin Nie

专题命中 视觉问答 :visual question answering(abstract);multimodal large language model(abstract);分类 cs.AI

Comments 20 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.10674 2025-02-19 cs.CV cs.CL 70%

Can Multimodal LLMs do Visual Temporal Understanding and Reasoning? The answer is No!

Mohamed Fazli Imam, Chenyang Lyu, Alham Fikri Aji

专题命中 视觉问答 :visual question answering(abstract);multimodal large language model(abstract);分类 cs.CV

Comments Our dataset can be found at \url{https://huggingface.co/datasets/fazliimam/temporal-vqa}

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.08862 2025-02-11 cs.LG 70%

Visual Agents as Fast and Slow Thinkers

Guangyan Sun, Mingyu Jin, Zhenting Wang, Cheng-Long Wang, Siqi Ma, Qifan Wang, Tong Geng, Ying Nian Wu, Yongfeng Zhang, Dongfang Liu

专题命中 视觉问答 :LLaVA(abstract);visual question answering(abstract);分类 cs.LG

Comments International Conference on Learning Representations (ICLR 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏