arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 4454 信号源:cs.CV, cs.AI, cs.LG

1. 视觉推理 4454 篇

2508.17714 2025-11-11 cs.CV 79%

F2RVLM: Boosting Fine-grained Fragment Retrieval for Multi-Modal Long-form Dialogue with Vision Language Model

Hanbo Bi, Zhiqiang Yuan, Zexi Jia, Jiapei Zhang, Chongyang Li, Peixiang Luo, Ying Deng, Xiaoyue Duan, Jinchao Zhang

专题命中 视觉推理 :vision language model(title);vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05551 2025-11-11 cs.CV 79%

In-Context-Learning-Assisted Quality Assessment Vision-Language Models for Metal Additive Manufacturing

Qiaojie Zheng, Jiucai Zhang, Xiaoli Zhang

机构 * Colorado School of Mines(科罗拉多矿业学院)

专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.CV

Comments 8 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11190 2025-11-07 cs.CV 79%

FlexAC: Towards Flexible Control of Associative Reasoning in Multimodal Large Language Models

Shengming Yuan, Xinyu Lyu, Shuailong Wang, Beitao Chen, Jingkuan Song, Lianli Gao

机构 * University of Electronic Science and Technology of China(电子科学与技术大学) Southwestern University of Finance and Economics(西南财经大学) Tongji University(同济大学)

专题命中 视觉推理 :multimodal large language model(title,abstract);分类 cs.CV

Comments 19 pages, 11 figures. Accepted by the 39th Conference on Neural Information Processing Systems (NeurIPS 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.12795 2025-11-07 cs.CV 79%

EarthGPT-X: A Spatial MLLM for Multi-level Multi-Source Remote Sensing Imagery Understanding with Visual Prompting

Wei Zhang, Miaoxin Cai, Yaqian Ning, Tong Zhang, Yin Zhuang, Shijian Lu, He Chen, Jun Li, Xuerui Mao

机构 * School of Interdisciplinary Science, Beijing Institute of Technology(交叉科学学院,北京理工大学) College of Computing and Data Science, Nanyang Technological University(计算与数据科学学院,南洋理工大学) National Key Laboratory of Science and Technology on Space-Born Intelligent Information Processing, Beijing Institute of Technology(空间智能信息处理国家重点实验室,北京理工大学) School of Optics and Photonics, Beijing Institute of Technology(光学与 photonics 学院,北京理工大学) State Key Laboratory of Explosion Science and Safety Protection, Beijing(爆炸科学与安全防护国家重点实验室,北京)

专题命中 视觉推理 :MLLM(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21448 2025-11-06 eess.AS cs.CV cs.SD 79%

ThinkSound: Chain-of-Thought Reasoning in Multimodal Large Language Models for Audio Generation and Editing

Huadai Liu, Kaicheng Luo, Jialei Wang, Wen Wang, Qian Chen, Zhou Zhao, Wei Xue

机构 * Hong Kong University of Science and Technology (HKUST)(香港理工大学) Tongyi Fun Team, Alibaba Group(阿里云团队) Zhejiang University(浙江大学)

专题命中 视觉推理 :multimodal large language model(title,abstract);分类 cs.CV

Comments Accepted by NeurIPS 2025 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01340 2025-11-04 cs.CV cs.CL 79%

$\left|\,\circlearrowright\,\boxed{\text{BUS}}\,\right|$: A Large and Diverse Multimodal Benchmark for evaluating the ability of Vision-Language Models to understand Rebus Puzzles

Trishanu Das, Abhilash Nandy, Khush Bajaj, Deepiha S

机构 * Tredence Inc.(特伦德公司) Indian Institute of Technology Kharagpur(印度理工学院克拉格浦尔分校) Inria Paris-Rocquencourt(巴黎-罗克琴库特研究所) Rajiv Gandhi University(拉吉夫·甘地大学) Tsinghua University(清华大学) Palmer Research Laboratories(帕勒姆研究实验室)

专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.CV

Comments 7 pages, 5 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26937 2025-11-03 cs.LG 79%

MM-OPERA: Benchmarking Open-ended Association Reasoning for Large Vision-Language Models

Zimeng Huang, Jinxin Ke, Xiaoxuan Fan, Yufeng Yang, Yang Liu, Liu Zhonghan, Zedi Wang, Junteng Dai, Haoyi Jiang, Yuyu Zhou, Keze Wang, Ziliang Chen

机构 * Sun Yat-sen University(中山大学) Peng Cheng Laboratory(鹏城实验室) Jinan University(暨南大学)

专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.LG

Comments NeurIPS 2025 Datasets and Benchmarks Track poster

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.13055 2025-11-03 cs.CV 79%

NoisyRollout: Reinforcing Visual Reasoning with Data Augmentation

Xiangyan Liu, Jinjie Ni, Zijian Wu, Chao Du, Longxu Dou, Haonan Wang, Tianyu Pang, Michael Qizhe Shieh

机构 * National University of Singapore(新加坡国立大学) Sea AI Lab(Sea AI实验室)

专题命中 视觉推理 :visual reasoning(title);vision-language model(abstract);分类 cs.CV

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23968 2025-10-31 cs.CV 79%

Reasoning Visual Language Model for Chest X-Ray Analysis

Andriy Myronenko, Dong Yang, Baris Turkbey, Mariam Aboian, Sena Azamat, Esra Akcicek, Hongxu Yin, Pavlo Molchanov, Marc Edgar, Yufan He, Pengfei Guo, Yucheng Tang, Daguang Xu

机构 * NVIDIA NIH/NCI CHOP/UPenn Basaksehir Cam and Sakura City Hospital

专题命中 视觉推理 :visual language model(title);vision-language model(abstract);分类 cs.CV

Comments NV-Reason-CXR-3B

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23925 2025-10-31 cs.AI cs.CL 79%

Latent Chain-of-Thought for Visual Reasoning

Guohao Sun, Hang Hua, Jian Wang, Jiebo Luo, Sohail Dianat, Majid Rabbani, Raghuveer Rao, Zhiqiang Tao

机构 * Rochester Institute of Technology(罗切斯特技术研究所) Snap Inc.(Snap公司) University of Rochester(罗切斯特大学) DEVCOM Army Research Laboratory(陆军研究实验室)

专题命中 视觉推理 :visual reasoning(title);vision-language model(abstract);分类 cs.AI

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.11094 2025-10-31 cs.CV 79%

Open3D-VQA: A Benchmark for Comprehensive Spatial Reasoning with Multimodal Large Language Model in Open Space

Weichen Zhang, Zile Zhou, Xin Zeng, Xuchen Liu, Jianjie Fang, Chen Gao, Yong Li, Jinqiang Cui, Xinlei Chen, Xiao-Ping Zhang

机构 * Tsinghua University(清华大学) Pengcheng Laboratory(鹏城实验室) Sun Yat-sen University(中山大学)

专题命中 视觉推理 :multimodal large language model(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25179 2025-10-30 cs.AI 79%

Agentic Moderation: Multi-Agent Design for Safer Vision-Language Models

Juan Ren, Mark Dras, Usman Naseem

机构 * School of Computing, Macquarie University, Australia(计算机学院,麦考瑞大学,澳大利亚)

专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.13939 2025-10-28 cs.CV 79%

Med-R1: Reinforcement Learning for Generalizable Medical Reasoning in Vision-Language Models

Yuxiang Lai, Jike Zhong, Ming Li, Shitian Zhao, Yuheng Li, Konstantinos Psounis, Xiaofeng Yang

机构 * Department of Computer Science and Informatics, Emory University(计算机科学与信息学系,埃默里大学) Department of Computer Science and Department of Electrical and Computer Engineering, University of Southern California(计算机科学系和电气与计算机工程系,南加州大学) Department of Computer Science, University of Tokyo(计算机科学系,东京大学) Department of Computer Science, Johns Hopkins University(计算机科学系,约翰霍普金斯大学) Department of Biomedical Engineering, Georgia Institute of Technology and Emory University(生物医学工程系,佐治亚理工学院和埃默里大学)

专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22798 2025-10-28 cs.CL cs.LG 79%

VEHME: A Vision-Language Model For Evaluating Handwritten Mathematics Expressions

Thu Phuong Nguyen, Duc M. Nguyen, Hyotaek Jeon, Hyunwook Lee, Hyunmin Song, Sungahn Ko, Taehwan Kim

专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.LG

Comments EMNLP 2025. Project Website: https://vehme.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22455 2025-10-28 cs.SD cs.AI eess.AS 79%

Evaluating Multimodal Large Language Models on Core Music Perception Tasks

Brandon James Carone, Iran R. Roman, Pablo Ripollés

机构 * Department of Psychology, Music and Audio Research Laboratory(心理学系、音乐与音频研究实验室) Department of Electronic Engineering and Computer Science(电子工程与计算机科学系)

专题命中 视觉推理 :multimodal large language model(title,abstract);分类 cs.AI

Comments Accepted to the NeurIPS 2025 Workshop on AI for Music (AI4Music), 16 pages, 1 figure, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02745 2025-10-28 cs.CV 79%

Retrv-R1: A Reasoning-Driven MLLM Framework for Universal and Efficient Multimodal Retrieval

Lanyun Zhu, Deyi Ji, Tianrun Chen, Haiyang Wu, Shiqi Wang

机构 * City University of Hong Kong(香港城市大学) Tencent(腾讯) Zhejiang University(浙江大学)

专题命中 视觉推理 :MLLM(title,abstract);分类 cs.CV

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.11261 2025-10-24 cs.AI cs.CL 79%

Sycophancy in Vision-Language Models: A Systematic Analysis and an Inference-Time Mitigation Framework

Yunpu Zhao, Rui Zhang, Junbin Xiao, Changxin Ke, Ruibo Hou, Yifan Hao, Ling Li

机构 * School of Computer Science and Technology, University of Science and Technology of China(计算机科学与技术学院,中国科学技术大学) State Key Lab of Processors, Institute of Computing Technology, Chinese Academy of Sciences(处理器国家重点实验室,中国科学院计算技术研究所) Department of Computer Science, National University of Singapore(计算机科学系,新加坡国立大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Intelligent Software Research Center, Institute of Software, Chinese Academy of Sciences(软件智能研究中心,中国科学院软件研究所)

专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.AI

Journal ref Neurocomputing, Volume 659, 2026, 131217

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19451 2025-10-23 cs.CV cs.MM 79%

Reasoning Like Experts: Leveraging Multimodal Large Language Models for Drawing-based Psychoanalysis

Xueqi Ma, Yanbei Jiang, Sarah Erfani, James Bailey, Weifeng Liu, Krista A. Ehinger, Jey Han Lau

机构 * The University of Melbourne(墨尔本大学) China University of Petroleum (East China)(中国石油大学(华东))

专题命中 视觉推理 :multimodal large language model(title,abstract);分类 cs.CV

Comments Accepted by ACM Multimedia 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18303 2025-10-22 cs.CV 79%

Proactive Reasoning-with-Retrieval Framework for Medical Multimodal Large Language Models

Lehan Wang, Yi Qin, Honglong Yang, Xiaomeng Li

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学)

专题命中 视觉推理 :multimodal large language model(title,abstract);分类 cs.CV

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17274 2025-10-21 cs.CV 79%

Enhanced Motion Forecasting with Plug-and-Play Multimodal Large Language Models

Katie Luo, Jingwei Ji, Tong He, Runsheng Xu, Yichen Xie, Dragomir Anguelov, Mingxing Tan

机构 * Computer and Information Sciences Department, Cornell University(康奈尔大学计算机与信息科学系) Waymo LLC(Waymo公司) UC Berkeley(伯克利大学)

专题命中 视觉推理 :multimodal large language model(title,abstract);分类 cs.CV

Comments In proceedings of IROS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25373 2025-10-17 cs.AI 79%

From Perception to Cognition: A Survey of Vision-Language Interactive Reasoning in Multimodal Large Language Models

Chenyue Zhou, Mingxuan Wang, Yanbiao Ma, Chenxu Wu, Wanyi Chen, Zhe Qian, Xinyu Liu, Yiwei Zhang, Junhao Wang, Hengbo Xu, Fei Luo, Xiaohua Chen, Xiaoshuai Hao, Hehan Li, Andi Zhang, Wenxuan Wang, Kaiyan Zhang, Guoli Jia, Lingling Li, Zhiwu Lu, Yang Lu, Yike Guo

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学北京校区人工智能学院) Xiamen University(厦门大学) The Hong Kong University of Science and Technology(香港理工大学) Nanyang Technological University(南洋理工大学)

专题命中 视觉推理 :multimodal large language model(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12190 2025-10-15 cs.CV 79%

Hierarchical Reasoning with Vision-Language Models for Incident Reports from Dashcam Videos

Shingo Yokoi, Kento Sasaki, Yu Yamaguchi

机构 * Turing Inc.(图灵公司)

专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.CV

Comments 2nd Place Winner, ICCV 2025 2COOOL Competition

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10117 2025-10-14 cs.AI 79%

DixitWorld: Evaluating Multimodal Abductive Reasoning in Vision-Language Models with Multi-Agent Dixit Gameplay

Yunxiang Mo, Tianshi Zheng, Qing Zong, Jiayu Liu, Baixuan Xu, Yauwai Yim, Chunkit Chan, Jiaxin Bai, Yangqiu Song

机构 * Department of Computer Science and Engineering, HKUST, Hong Kong SAR, China(计算机科学与工程系,香港科技大学,香港特别行政区,中国)

专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.AI

Comments EMNLP 2025 Wordplay (Spotlight)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09358 2025-10-13 cs.CV 79%

Boosting Multi-modal Keyphrase Prediction with Dynamic Chain-of-Thought in Vision-Language Models

Qihang Ma, Shengyu Li, Jie Tang, Dingkang Yang, Shaodong Chen, Yingyi Zhang, Chao Feng, Jiao Ran

机构 * ByteDance Douyin Content Group(字节跳动抖音内容团队)

专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.CV

Comments EMNLP2025. Code is avaible at https://github.com/bytedance/DynamicCoT

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.10610 2025-10-07 cs.CV cs.CL 79%

MMLongBench: Benchmarking Long-Context Vision-Language Models Effectively and Thoroughly

Zhaowei Wang, Wenhao Yu, Xiyu Ren, Jipeng Zhang, Yu Zhao, Rohit Saxena, Liang Cheng, Ginny Wong, Simon See, Pasquale Minervini, Yangqiu Song, Mark Steedman

机构 * CSE Department, HKUST(香港科技大学计算机科学与工程系) Tencent AI Seattle Lab(腾讯AI西雅图实验室) University of Edinburgh(爱丁堡大学) NVIDIA AI Technology Center (NVAITC), NVIDIA, Santa Clara, USA(英伟达圣克拉拉人工智能技术中心)

专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.CV

Comments Accepted as a spotlight at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.16162 2025-10-03 cs.CV cs.CL 79%

Sparkle: Mastering Basic Spatial Capabilities in Vision Language Models Elicits Generalization to Spatial Reasoning

Yihong Tang, Ao Qu, Zhaokai Wang, Dingyi Zhuang, Zhaofeng Wu, Wei Ma, Shenhao Wang, Yunhan Zheng, Zhan Zhao, Jinhua Zhao

机构 * McGill University(麦吉尔大学) Massachusetts Institute of Technology(麻省理工学院) Shanghai Jiao Tong University(上海交通大学) The Hong Kong Polytechnic University(香港理工大学) University of Florida(佛罗里达大学) The University of Hong Kong(香港大学)

专题命中 视觉推理 :vision language model(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00690 2025-10-02 cs.AI 79%

ACPO: Adaptive Curriculum Policy Optimization for Aligning Vision-Language Models in Complex Reasoning

Yunhao Wang, Ziting Li, Shuai Chen, Tao Liu, Chao Song, Junjie Jiang, Jian Zhu, Peng Gao, Bin Qin

机构 * Xiaomi Inc.(小米公司)

专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.19778 2025-10-02 cs.AI 79%

Multimodal Large Language Models for Bioimage Analysis

Shanghang Zhang, Gaole Dai, Tiejun Huang, Jianxu Chen

专题命中 视觉推理 :multimodal large language model(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.19825 2025-09-30 cs.AI cs.CL 79%

Evaluating Compliance with Visualization Guidelines in Diagrams for Scientific Publications Using Large Vision Language Models

Johannes Rückert, Louise Bloch, Christoph M. Friedrich

机构 * Department of Computer Science, University of Applied Sciences and Arts Dortmund(应用科学与艺术大学多特蒙德计算机科学系) Institute for Medical Informatics, Biometry and Epidemiology (IMIBE)(医学信息学、生物统计与流行病学研究所) Institute for Artificial Intelligence in Medicine (IKIM), University Hospital Essen(医学人工智能研究所,埃森大学医院)

专题命中 视觉推理 :vision language model(title,abstract);分类 cs.AI

Comments Accepted at ICDAR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15298 2025-09-30 cs.RO cs.CL cs.CV 79%

AgentThink: A Unified Framework for Tool-Augmented Chain-of-Thought Reasoning in Vision-Language Models for Autonomous Driving

Kangan Qian, Sicong Jiang, Yang Zhong, Ziang Luo, Zilin Huang, Tianze Zhu, Kun Jiang, Mengmeng Yang, Zheng Fu, Jinyu Miao, Yining Shi, He Zhe Lim, Li Liu, Tianbao Zhou, Huang Yu, Yifei Hu, Guang Li, Guang Chen, Hao Ye, Lijun Sun, Diange Yang

机构 * School of Vehicle and Mobility, Tsinghua University(清华大学车辆与移动学院) McGill University(麦吉尔大学) Automotive and Robotics, Xiaomi Corporation(小米公司汽车与机器人部门) University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.CV

Comments 19 pages, 8 figures

Journal ref EMNLP2025 Fundings

详情

展开后加载摘要…

URL PDF HTML 收藏