arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 26117 信号源:cs.CV, cs.AI, cs.LG

1. 视觉推理 4478 篇

2509.17042 2025-09-23 cs.RO 82%

Orchestrate, Generate, Reflect: A VLM-Based Multi-Agent Collaboration Framework for Automated Driving Policy Learning

Zengqi Peng, Yusen Xie, Yubin Wang, Rui Yang, Qifeng Chen, Jun Ma

机构 * Robotics and Autonomous Systems Thrust, The Hong Kong University of Science and Technology (Guangzhou)(机器人与自主系统方向,香港科学与技术大学(广州)) Department of Computer Science and Engineering, The Hong Kong University of Science and Technology(计算机科学与工程系,香港科学与技术大学) Cheng Kar-Shun Robotics Institute, The Hong Kong University of Science and Technology(陈家骏机器人研究所,香港科学与技术大学)

专题命中 视觉推理 :VLM(title,abstract);vision-language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.06729 2025-09-17 cs.RO 82%

STRIVE: Structured Representation Integrating VLM Reasoning for Efficient Object Navigation

Haokun Zhu, Zongtai Li, Zhixuan Liu, Wenshan Wang, Ji Zhang, Jonathan Francis, Jean Oh

机构 * Carnegie Mellon University(卡内基梅隆大学) Bosch Center for AI(博世人工智能中心)

专题命中 视觉推理 :VLM(title,abstract);vision-language model(abstract)

Comments We remove OSG and CogNav from Table. 1 for a fair comparison

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18381 2025-08-27 cs.CL 82%

Language-Specific Layer Matters: Efficient Multilingual Enhancement for Large Vision-Language Models

Yuchun Fan, Yilin Wang, Yongyu Mu, Lei Huang, Bei Li, Xiaocheng Feng, Tong Xiao, Jingbo Zhu

专题命中 视觉推理 :vision-language model(title,abstract);visual reasoning(abstract)

Comments Accepted by EMNLP 2025 findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11918 2025-08-19 cs.RO 82%

ExploreVLM: Closed-Loop Robot Exploration Task Planning with Vision-Language Models

Zhichen Lou, Kechun Xu, Zhongxiang Zhou, Rong Xiong

机构 * State Key Laboratory of Industrial Control Technology(工业控制技术国家重点实验室) Institute of Cyber-Systems and Control(网络系统与控制研究所) Zhejiang University(浙江大学) Zhejiang Humanoid Robot Innovation Center Co., Ltd.(浙江人形机器人创新中心有限公司)

专题命中 视觉推理 :vision-language model(title,abstract);VLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10371 2025-08-15 cs.RO 82%

Few-shot Vision-based Human Activity Recognition with MLLM-based Visual Reinforcement Learning

Wenqi Zheng, Yutaka Arakawa

机构 * Graduate School(研究生院) Faculty of Information Science(信息科学系) Electrical Engineering(电气工程) Kyushu University(九州大学) JAPAN(日本)

专题命中 视觉推理 :MLLM(title,abstract);multimodal large language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.14805 2025-08-13 cs.CV cs.AI cs.CL cs.LG cs.MM 82%

Argus Inspection: Do Multimodal Large Language Models Possess the Eye of Panoptes?

Yang Yao, Lingyu Li, Jiaxin Song, Chiyu Chen, Zhenqi He, Yixu Wang, Xin Wang, Tianle Gu, Jie Li, Yan Teng, Yingchun Wang

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) The University of Hong Kong(香港大学) Shanghai Jiao Tong University(上海交通大学) The Hong Kong University of Science and Technology(香港科学与技术大学) Fudan University(复旦大学) Tsinghua University(清华大学)

专题命中 视觉推理 :multimodal large language model(title,abstract);分类 cs.CV、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03733 2025-08-07 cs.LG cs.AI cs.CL cs.CV 82%

CX-Mind: A Pioneering Multimodal Large Language Model for Interleaved Reasoning in Chest X-ray via Curriculum-Guided Reinforcement Learning

Wenjie Li, Yujie Zhang, Haoran Sun, Yueqi Li, Fanrui Zhang, Mengzhe Xu, Victoria Borja Clausich, Sade Mellin, Renhao Yang, Chenrun Wang, Jethro Zih-Shuo Wang, Shiyi Yao, Gen Li, Yidong Xu, Hanyu Wang, Yilin Huang, Angela Lin Wang, Chen Shi, Yin Zhang, Jianan Guo, Luqi Yang, Renxuan Li, Yang Xu, Jiawei Liu, Yao Zhang, Lei Liu, Carlos Gutiérrez SanRomán, Lei Wang

机构 * College of Health Science and Technology, Shanghai Jiao Tong University School of Medicine(上海交通大学医学院健康科学与技术学院) Shanghai Innovation Institute(上海创新研究院) Clinical Center for Sports Medicine, Department of Orthopaedics, Ruijin Hospital, Shanghai Jiao Tong University School of Medicine(上海交通大学医学院骨科临床中心) School of Basic Medical Sciences, Intelligent Medicine Institute, Fudan University(复旦大学基础医学学院) Department of Hematology, The First Affiliated Hospital, College of Medicine, Zhejiang University(浙江大学医学院第一附属医院血液科) MoE Key Laboratory of Brain-Inspired Intelligent Perception and Cognition, University of Science and Technology of China(中国科学技术大学脑启发智能感知与认知教育部重点实验室) Department of Public Health and Primary Care, University of Cambridge(剑桥大学公共卫生与初级保健学院) Department of Medicine, Faculty of Health Sciences, Universidad CEU Cardenal Herrera(CEU卡德纳尔-赫尔曼大学健康科学学院医学系) Faculty of Medicine, University of Helsinki(赫尔辛基大学医学院) X-LANCE Lab, School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院X-LANCE实验室) Department of Hepatobiliary Surgery, National Cancer Center / National Clinical Research Center for Cancer / Cancer Hospital, Chinese Academy of Medical Sciences and Peking Union Medical College(中国医学科学院肿瘤医院肝胆外科) Department of Surgery, The Ohio State University Wexner Medical Center, The James Comprehensive Cancer Center(俄亥俄州立大学韦克斯纳医学中心外科部,詹姆斯综合癌症中心) Ningbo Institute of Technology, Beihang University(北航宁波理工学院)

专题命中 视觉推理 :multimodal large language model(title,abstract);分类 cs.CV、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02886 2025-08-06 cs.CL 82%

Coherent Multimodal Reasoning with Iterative Self-Evaluation for Vision-Language Models

Wenjie Luo, Ruocheng Li, Shanshan Zhu, Julian Perry

机构 * Fujian University of Technology(福建工程大学) Delta University for Science and Technology(科技大学)

专题命中 视觉推理 :vision-language model(title,abstract);LLaVA(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.15266 2025-07-22 cs.RO cs.SY eess.SY 82%

VLM-UDMC: VLM-Enhanced Unified Decision-Making and Motion Control for Urban Autonomous Driving

Haichao Liu, Haoren Guo, Pei Liu, Benshan Ma, Yuxiang Zhang, Jun Ma, Tong Heng Lee

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) National University of Singapore(新加坡国立大学) The Hong Kong University of Science and Technology(香港科学与技术大学)

专题命中 视觉推理 :VLM(title,abstract);vision-language model(abstract)

Comments 14 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.09535 2025-07-15 eess.SP 82%

Reframing SAR Target Recognition as Visual Reasoning: A Chain-of-Thought Dataset with Multimodal LLMs

Chaoran Li, Xingguo Xu, Siyuan Mu

专题命中 视觉推理 :visual reasoning(title,abstract);multimodal large language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.00928 2025-07-08 cs.LG cs.AI cs.CV 82%

Learning Differentiable Logic Programs for Abstract Visual Reasoning

Hikaru Shindo, Viktor Pfanschilling, Devendra Singh Dhami, Kristian Kersting

专题命中 视觉推理 :visual reasoning(title,abstract);分类 cs.CV、cs.AI、cs.LG

Comments Published at Machine Learning

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07936 2025-06-10 cs.CV cs.AI cs.CL cs.LG 82%

Mimicking or Reasoning: Rethinking Multi-Modal In-Context Learning in Vision-Language Models

Chengyue Huang, Yuchen Zhu, Sichen Zhu, Jingyun Xiao, Moises Andrade, Shivang Chopra, Zsolt Kira

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.CV、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.17641 2025-06-10 cs.RO 82%

Scene Exploration by Vision-Language Models

Venkatesh Sripada, Samuel Carter, Frank Guerin, Amir Ghalamzan

机构 * University of Surrey(萨里大学)

专题命中 视觉推理 :vision-language model(title,abstract);VLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06034 2025-06-09 cs.CL 82%

MATP-BENCH: Can MLLM Be a Good Automated Theorem Prover for Multimodal Problems?

Zhitao He, Zongwei Lyu, Dazhong Chen, Dadi Guo, Yi R. Fung

机构 * Hong Kong University of Science and Technology(香港理工大学) Chinese University of Hong Kong (Shenzhen)(香港中文大学(深圳))

专题命中 视觉推理 :MLLM(title);visual reasoning(abstract);multimodal large language model(abstract)

Comments 29 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13062 2025-05-29 cs.MM cs.SD eess.AS 82%

Hearing from Silence: Reasoning Audio Descriptions from Silent Videos via Vision-Language Model

Yong Ren, Chenxing Li, Le Xu, Hao Gu, Duzhen Zhang, Yujie Chen, Manjie Xu, Ruibo Fu, Shan Yang, Dong Yu

机构 * Chinese Academy of Sciences(中国科学院) University of Chinese Academy of Sciences(中国科学院大学) Tencent AI Lab(腾讯AI实验室) Institute of Automation School of Artificial Intelligence(自动化研究所人工智能学院)

专题命中 视觉推理 :vision-language model(title,abstract);multimodal large language model(abstract)

Comments Accepted by Interspeech 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13391 2025-05-20 cs.AI cs.CV cs.LG 82%

Advancing Generalization Across a Variety of Abstract Visual Reasoning Tasks

Mikołaj Małkiński, Jacek Mańdziuk

专题命中 视觉推理 :visual reasoning(title,abstract);分类 cs.CV、cs.AI、cs.LG

Comments Accepted to the 34th International Joint Conference on Artificial Intelligence (IJCAI 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.11061 2025-05-19 cs.AI cs.CV cs.LG 82%

A-I-RAVEN and I-RAVEN-Mesh: Two New Benchmarks for Abstract Visual Reasoning

Mikołaj Małkiński, Jacek Mańdziuk

专题命中 视觉推理 :visual reasoning(title,abstract);分类 cs.CV、cs.AI、cs.LG

Comments Accepted to the 34th International Joint Conference on Artificial Intelligence (IJCAI 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.06418 2025-05-13 cs.CL 82%

Is your multimodal large language model a good science tutor?

Ming Liu, Liwen Wang, Wensheng Zhang

专题命中 视觉推理 :multimodal large language model(title,abstract);MLLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.06631 2025-04-22 cs.CL 82%

IFShip: Interpretable Fine-grained Ship Classification with Domain Knowledge-Enhanced Vision-Language Models

Mingning Guo, Mengwei Wu, Yuxiang Shen, Haifeng Li, Chao Tao

专题命中 视觉推理 :vision-language model(title,abstract);LLaVA(abstract)

Journal ref Pattern Recognition, 166, 111672 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.00238 2025-04-18 cs.AI cs.CV cs.LG q-bio.NC 82%

Understanding the Limits of Vision Language Models Through the Lens of the Binding Problem

Declan Campbell, Sunayana Rane, Tyler Giallanza, Nicolò De Sabbata, Kia Ghods, Amogh Joshi, Alexander Ku, Steven M. Frankland, Thomas L. Griffiths, Jonathan D. Cohen, Taylor W. Webb

专题命中 视觉推理 :vision language model(title,abstract);分类 cs.CV、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.11468 2025-04-17 cs.CL 82%

SFT or RL? An Early Investigation into Training R1-Like Reasoning Large Vision-Language Models

Hardy Chen, Haoqin Tu, Fali Wang, Hui Liu, Xianfeng Tang, Xinya Du, Yuyin Zhou, Cihang Xie

专题命中 视觉推理 :vision-language model(title,abstract);visual reasoning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.11009 2025-04-16 cs.MM 82%

MMC: Iterative Refinement of VLM Reasoning via MCTS-based Multimodal Critique

Shuhang Liu, Zhenrong Zhang, Pengfei Hu, Jiefeng Ma, Jun Du, Qing Wang, Jianshu Zhang, Quan Liu, Jianqing Gao, Feng Ma

专题命中 视觉推理 :VLM(title,abstract);visual language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.23503 2025-04-01 cs.CL 82%

Evolutionary Prompt Optimization Discovers Emergent Multimodal Reasoning Strategies in Vision-Language Models

Sid Bharthulwar, John Rho, Katrina Brown

专题命中 视觉推理 :vision-language model(title,abstract);VLM(abstract)

Comments Published at ICLR 2025 Workshop on Reasoning and Planning for LLMs

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10427 2025-03-18 cs.CL 82%

VisTW: Benchmarking Vision-Language Models for Traditional Chinese in Taiwan

Zhi Rui Tam, Ya-Ting Pai, Yen-Wei Lee, Yun-Nung Chen

专题命中 视觉推理 :vision-language model(title);VLM(abstract);visual language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.16412 2025-03-18 cs.RO 82%

SARO: Space-Aware Robot System for Terrain Crossing via Vision-Language Model

Shaoting Zhu, Derun Li, Linzhan Mou, Yong Liu, Ningyi Xu, Hang Zhao

专题命中 视觉推理 :vision-language model(title,abstract);VLM(abstract)

Comments 12 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.09024 2025-03-13 cs.RO cs.SY eess.IV eess.SY 82%

Traffic Regulation-aware Path Planning with Regulation Databases and Vision-Language Models

Xu Han, Zhiwen Wu, Xin Xia, Jiaqi Ma

专题命中 视觉推理 :vision-language model(title,abstract);VLM(abstract)

Comments 7 pages, 7 figures, submitted to ICRA

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06553 2025-03-11 cs.AI cs.CV cs.LG 82%

ProJudge: A Multi-Modal Multi-Discipline Benchmark and Instruction-Tuning Dataset for MLLM-based Process Judges

Jiaxin Ai, Pengfei Zhou, Zhaopan Xu, Ming Li, Fanrui Zhang, Zizhen Li, Jianwen Sun, Yukang Feng, Baojin Huang, Zhongyuan Wang, Kaipeng Zhang

专题命中 视觉推理 :MLLM(title,abstract);分类 cs.CV、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2201.12382 2025-02-24 cs.AI cs.CV cs.LG 82%

Deep Learning Methods for Abstract Visual Reasoning: A Survey on Raven's Progressive Matrices

Mikołaj Małkiński, Jacek Mańdziuk

专题命中 视觉推理 :visual reasoning(title,abstract);分类 cs.CV、cs.AI、cs.LG

Journal ref ACM Computing Surveys, Volume 57, Issue 7, Article No.: 166, February 2025, Pages 1-36

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.13832 2025-02-20 cs.HC 82%

ArtMentor: AI-Assisted Evaluation of Artworks to Explore Multimodal Large Language Models Capabilities

Chanjin Zheng, Zengyi Yu, Yilin Jiang, Mingzi Zhang, Xunuo Lu, Jing Jin, Liteng Gao

专题命中 视觉推理 :multimodal large language model(title,abstract);MLLM(abstract)

Comments 18 pages, 12 figures. Accepted by CHI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.01404 2025-02-11 cs.CL 82%

What Is Missing in Multilingual Visual Reasoning and How to Fix It

Yueqi Song, Simran Khanuja, Graham Neubig

专题命中 视觉推理 :visual reasoning(title,abstract);LLaVA(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏