arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 4447 信号源:cs.CV, cs.AI, cs.LG

1. 视觉推理 4447 篇

2511.01618 2025-11-04 cs.CV cs.CL 83%

Actial: Activate Spatial Reasoning Ability of Multimodal Large Language Models

Xiaoyu Zhan, Wenxuan Huang, Hao Sun, Xinyu Fu, Changfeng Ma, Shaosheng Cao, Bohan Jia, Shaohui Lin, Zhenfei Yin, Lei Bai, Wanli Ouyang, Yuanqi Li, Jie Guo, Yanwen Guo

机构 * Nanjing University(南京大学) Xiaohongshu Inc.(小红书公司) East China Normal University(华东师范大学) The Chinese University of Hong Kong(香港中文大学) Shanghai Jiao Tong University(上海交通大学) University of Oxford(牛津大学)

专题命中 视觉推理 :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21881 2025-10-28 cs.AI cs.CL 83%

GeoThought: A Dataset for Enhancing Mathematical Geometry Reasoning in Vision-Language Models

Nannan Shi, Chuanyu Qin, Shipeng Song, Man Luo

机构 * Baidu Inc.(百度公司) Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) Intel Lab, Intel(英特尔实验室)

专题命中 视觉推理 :vision-language model(title);visual reasoning(abstract);MLLM(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.14674 2025-10-27 cs.CV 83%

Recognition through Reasoning: Reinforcing Image Geo-localization with Large Vision-Language Models

Ling Li, Yao Zhou, Yuxuan Liang, Fugee Tsung, Jiaheng Wei

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) The Hong Kong University of Science and Technology(香港科学与技术大学)

专题命中 视觉推理 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21069 2025-10-27 cs.CV cs.RO 83%

ZING-3D: Zero-shot Incremental 3D Scene Graphs via Vision-Language Models

Pranav Saxena, Jimmy Chiun

机构 * Birla Institute of Technology and Science Pilani, K.K Birla Goa Campus(比拉理工学院和科学学院,比拉戈阿校园) Department of Mechanical Engineering, College of Design and Engineering, National University of Singapore(设计与工程学院机械工程系,新加坡国立大学)

专题命中 视觉推理 :vision-language model(title);VLM(abstract);grounding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19358 2025-10-23 cs.CL cs.AI 83%

M3-SLU: Evaluating Speaker-Attributed Reasoning in Multimodal Large Language Models

Yejin Kwon, Taewoo Kang, Hyunsoo Yoon, Changouk Kim

专题命中 视觉推理 :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.AI

Comments Submitted to LREC 2026. 11 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18424 2025-10-22 cs.AI 83%

Med-VRAgent: A Framework for Medical Visual Reasoning-Enhanced Agents

Guangfu Guo, Xiaoqian Lu, Yue Feng

专题命中 视觉推理 :visual reasoning(title,abstract);visual language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16907 2025-10-21 cs.AI cs.CL 83%

VAGEN: Reinforcing World Model Reasoning for Multi-Turn VLM Agents

Kangrui Wang, Pingyue Zhang, Zihan Wang, Yaning Gao, Linjie Li, Qineng Wang, Hanyang Chen, Chi Wan, Yiping Lu, Zhengyuan Yang, Lijuan Wang, Ranjay Krishna, Jiajun Wu, Li Fei-Fei, Yejin Choi, Manling Li

机构 * Northwestern University(西北大学) University of Washington(华盛顿大学) Stanford University(斯坦福大学) Microsoft(微软) University of Wisconsin-Madison(威斯康星大学麦迪逊分校) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 视觉推理 :VLM(title,abstract);vision-language model(abstract);分类 cs.AI

Comments Accepted to NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12400 2025-10-15 cs.CV 83%

Towards General Urban Monitoring with Vision-Language Models: A Review, Evaluation, and a Research Agenda

André Torneiro, Diogo Monteiro, Paulo Novais, Pedro Rangel Henriques, Nuno F. Rodrigues

机构 * ALGORITMI Research Centre/LASI(ALGORITMI研究机构/LASI) University of Minho(明霍大学) Logimade(Logimade公司) INESC TEC(INESC TEC研究机构) Ai, School of Technology(2Ai技术学院) IPCA

专题命中 视觉推理 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV

Comments 44 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11012 2025-10-14 cs.CV 83%

COCO-Tree: Compositional Hierarchical Concept Trees for Enhanced Reasoning in Vision Language Models

Sanchit Sinha, Guangzhi Xiong, Aidong Zhang

机构 * University of Virginia(弗吉尼亚大学)

专题命中 视觉推理 :vision language model(title,abstract);VLM(abstract);分类 cs.CV

Comments EMNLP 2025 (main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08485 2025-10-10 cs.CV 83%

InstructX: Towards Unified Visual Editing with MLLM Guidance

Chong Mou, Qichao Sun, Yanze Wu, Pengze Zhang, Xinghui Li, Fulong Ye, Songtao Zhao, Qian He

机构 * Intelligent Creation Team, ByteDance(字节跳动智能创作团队)

专题命中 视觉推理 :MLLM(title,abstract);multimodal large language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07778 2025-10-07 cs.CV 83%

A Neurosymbolic Agent System for Compositional Visual Reasoning

Yichang Xu, Gaowen Liu, Ramana Rao Kompella, Sihao Hu, Fatih Ilhan, Selim Furkan Tekin, Zachary Yahn, Ling Liu

机构 * Georgia Institute of Technology(佐治亚理工学院) Cisco Systems(思科系统)

专题命中 视觉推理 :visual reasoning(title,abstract);vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02780 2025-10-06 cs.CV 83%

Reasoning Riddles: How Explainability Reveals Cognitive Limits in Vision-Language Models

Prahitha Movva

机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校)

专题命中 视觉推理 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV

Journal ref COLM 2025: First Workshop on the Application of LLM Explainability to Reasoning and Planning

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.06266 2025-10-01 cs.CV 83%

Spatial Reasoning with Vision-Language Models in Ego-Centric Multi-View Scenes

Mohsen Gholami, Ahmad Rezaei, Zhou Weimin, Sitong Mao, Shunbo Zhou, Yong Zhang, Mohammad Akbari

机构 * Huawei Technologies Canada(华为技术加拿大分公司) Huawei Cloud Project Page Code Ego3D-Bench(华为云项目页面代码Ego3D-Bench)

专题命中 视觉推理 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24888 2025-09-30 cs.CV cs.CL 83%

MMRQA: Signal-Enhanced Multimodal Large Language Models for MRI Quality Assessment

Fankai Jia, Daisong Gan, Zhe Zhang, Zhaochi Wen, Chenchen Dan, Dong Liang, Haifeng Wang

机构 * Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(深圳先进技术研究院,中国科学院) University of Chinese Academy of Sciences(中国科学院大学) ShanghaiTech University(上海理工大学) Southern University of Science and Technology(南方科技大学)

专题命中 视觉推理 :multimodal large language model(title,abstract);LLaVA(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06856 2025-09-30 cs.CV 83%

Vision-EKIPL: External Knowledge-Infused Policy Learning for Visual Reasoning

Chaoyang Wang, Zeyu Zhang, Meng Meng, Xu Zhou, Haiyun Jiang

机构 * Sangfor Technologies The Australian National University(澳大利亚国立大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 视觉推理 :visual reasoning(title,abstract);multimodal large language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21854 2025-09-29 cs.MM cs.CV 83%

Perception-Consistency Multimodal Large Language Models Reasoning via Caption-Regularized Policy Optimization

Songjun Tu, Qichao Zhang, Jingbo Sun, Yuqian Fu, Linjing Li, Xiangyuan Lan, Dongmei Jiang, Yaowei Wang, Dongbin Zhao

机构 * State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences(多模态人工智能系统国家重点实验室,自动化研究所,中国科学院) Pengcheng Laboratory(鹏城实验室) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳))

专题命中 视觉推理 :multimodal large language model(title,abstract);grounding(abstract);分类 cs.CV

Comments 12pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20890 2025-09-29 cs.CV cs.CL 83%

$A^2R^2$: Advancing Img2LaTeX Conversion via Visual Reasoning with Attention-Guided Refinement

Zhecheng Li, Guoxian Song, Yiwei Wang, Zhen Xiong, Junsong Yuan, Yujun Cai

机构 * University of California, San Diego(加州大学圣地亚哥分校) ByteDance(字节跳动) University of California, Merced(加州大学默塞德分校) University of Southern California(南加州大学) University at Buffalo(布法罗大学) The University of Queensland(昆士兰大学)

专题命中 视觉推理 :visual reasoning(title,abstract);vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19841 2025-09-25 cs.CV 83%

ThinkFake: Reasoning in Multimodal Large Language Models for AI-Generated Image Detection

Tai-Ming Huang, Wei-Tung Lin, Kai-Lung Hua, Wen-Huang Cheng, Junichi Yamagishi, Jun-Cheng Chen

专题命中 视觉推理 :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16149 2025-09-22 cs.CV 83%

Pointing to a Llama and Call it a Camel: On the Sycophancy of Multimodal Large Language Models

Renjie Pi, Kehao Miao, Li Peihang, Runtao Liu, Jiahui Gao, Jipeng Zhang, Xiaofang Zhou

机构 * HKUST(香港科技大学) HKU(香港大学)

专题命中 视觉推理 :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15772 2025-09-22 cs.CV 83%

Vision-Language Models as Differentiable Semantic and Spatial Rewards for Text-to-3D Generation

Weimin Bai, Yubo Li, Weijian Luo, Wenzheng Chen, He Sun

机构 * Peking University(北京大学) Xiaohongshu Inc(小红书公司)

专题命中 视觉推理 :vision-language model(title,abstract);vision language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.20587 2025-09-22 cs.LG 83%

Cache-of-Thought: Master-Apprentice Framework for Cost-Effective Vision Language Model Reasoning

Mingyuan Wu, Jize Jiang, Haozhen Zheng, Meitang Li, Zhaoheng Li, Beitong Tian, Bo Chen, Yongjoo Park, Minjia Zhang, Chengxiang Zhai, Klara Nahrstedt

机构 * University of Illinois Urbana Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Michigan Ann Arbor(密歇根大学安娜堡分校)

专题命中 视觉推理 :vision language model(title,abstract);VLM(abstract);分类 cs.LG

Comments EMNLP 2025 Main Conference. Mingyuan, Jize, and Haozhen contributed equally, while Minjia, Chengxiang, and Klara advised equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13773 2025-09-18 cs.AI cs.IR 83%

MIRA: Empowering One-Touch AI Services on Smartphones with MLLM-based Instruction Recommendation

Zhipeng Bian, Jieming Zhu, Xuyang Xie, Quanyu Dai, Zhou Zhao, Zhenhua Dong

机构 * Shenzhen University(深圳大学) Huawei Noah’s Ark Lab(华为诺亚实验室) Zhejiang University(浙江大学)

专题命中 视觉推理 :MLLM(title,abstract);multimodal large language model(abstract);分类 cs.AI

Comments Published in Proceedings of the 63rd Annual Meeting of the Association for Computational Linguistics (Volume 6: Industry Track), ACL 2025. Official version: https://doi.org/10.18653/v1/2025.acl-industry.103

Journal ref Proceedings of the 63rd Annual Meeting of the Association for Computational Linguistics (Volume 6: Industry Track) ACL 2025 1457-1465

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12060 2025-09-17 cs.AI 83%

When Safe Unimodal Inputs Collide: Optimizing Reasoning Chains for Cross-Modal Safety in Multimodal Large Language Models

Wei Cai, Shujuan Liu, Jian Zhao, Ziyan Shi, Yusheng Zhao, Yuchen Yuan, Tianle Zhang, Chi Zhang, Xuelong Li

专题命中 视觉推理 :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12132 2025-09-16 cs.CV cs.CL 83%

Look Again, Think Slowly: Enhancing Visual Reflection in Vision-Language Models

Pu Jian, Junhong Wu, Wei Sun, Chen Wang, Shuo Ren, Jiajun Zhang

专题命中 视觉推理 :vision-language model(title,abstract);visual reasoning(abstract);分类 cs.CV

Comments EMNLP2025 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.03521 2025-09-11 cs.CV 83%

Have Large Vision-Language Models Mastered Art History?

Ombretta Strafforello, Derya Soydaner, Michiel Willems, Anne-Sofie Maerten, Stefanie De Winter

机构 * KU Leuven(库勒韦恩大学) Leiden University(莱顿大学)

专题命中 视觉推理 :vision-language model(title,abstract);LLaVA(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.06312 2025-09-09 eess.SY cs.LG cs.SY 83%

Enhancing Low-Altitude Airspace Security: MLLM-Enabled UAV Intent Recognition

Guangyu Lei, Tianhao Liang, Yuqi Ping, Xinglin Chen, Longyu Zhou, Junwei Wu, Xiyuan Zhang, Huahao Ding, Xingjian Zhang, Weijie Yuan, Tingting Zhang, Qinyu Zhang

机构 * School of Information Science and Technology, Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)信息科学与技术学院) Guangdong Provincial Key Laboratory of Space-Aerial Networking and Intelligent Sensing(广东省空间-航空网络与智能感知重点实验室) Information Systems Technology and Design, Singapore University of Technology and Design(新加坡科技设计大学信息系统技术与设计) School of System Design and Intelligent Manufacturing, Southern University of Science and Technology(南方科技大学系统设计与智能制造学院)

专题命中 视觉推理 :MLLM(title,abstract);multimodal large language model(abstract);分类 cs.LG

Comments The paper has been submitted to IEEE Internet of Things Magazine

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15802 2025-08-25 cs.CL cs.AI 83%

MAC: A Live Benchmark for Multimodal Large Language Models in Scientific Understanding

Mohan Jiang, Jin Gao, Jiahao Zhan, Dequan Wang

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院) Fudan University(复旦大学)

专题命中 视觉推理 :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10287 2025-08-21 cs.CV 83%

JRDB-Reasoning: A Difficulty-Graded Benchmark for Visual Reasoning in Robotics

Simindokht Jahangard, Mehrzad Mohammadi, Yi Shen, Zhixi Cai, Hamid Rezatofighi

专题命中 视觉推理 :visual reasoning(title,abstract);vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01057 2025-08-13 cs.AI cs.RO 83%

Edge-Based Multimodal Sensor Data Fusion with Vision Language Models (VLMs) for Real-time Autonomous Vehicle Accident Avoidance

Fengze Yang, Bo Yu, Yang Zhou, Xuewen Luo, Zhengzhong Tu, Chenxi Liu

机构 * Department of Civil & Environmental Engineering University of Utah(土木与环境工程系 犹他大学) Zachry Department of Civil and Environmental Engineering Texas A&M University(扎克里系 土木与环境工程系 德克萨斯农工大学) Department of Computer Science & Engineering Texas A&M University(计算机科学与工程系 德克萨斯农工大学)

专题命中 视觉推理 :vision language model(title);vision-language model(abstract);VLM(abstract);分类 cs.AI

Comments 24 pages, 6 tables, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07260 2025-08-12 cs.CV 83%

Small-Large Collaboration: Training-efficient Concept Personalization for Large VLM using a Meta Personalized Small VLM

Sihan Yang, Huitong Ji, Shaolin Lu, Jiayi Chen, Binxiao Xu, Ming Lu, Yuanxing Zhang, Wenhui Dong, Wentao Zhang

机构 * Peking University(北京大学)

专题命中 视觉推理 :VLM(title,abstract);vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏