arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 4454 信号源:cs.CV, cs.AI, cs.LG

1. 视觉推理 4454 篇

2506.06034 2025-06-09 cs.CL 82%

MATP-BENCH: Can MLLM Be a Good Automated Theorem Prover for Multimodal Problems?

Zhitao He, Zongwei Lyu, Dazhong Chen, Dadi Guo, Yi R. Fung

机构 * Hong Kong University of Science and Technology(香港理工大学) Chinese University of Hong Kong (Shenzhen)(香港中文大学(深圳))

专题命中 视觉推理 :MLLM(title);visual reasoning(abstract);multimodal large language model(abstract)

Comments 29 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13062 2025-05-29 cs.MM cs.SD eess.AS 82%

Hearing from Silence: Reasoning Audio Descriptions from Silent Videos via Vision-Language Model

Yong Ren, Chenxing Li, Le Xu, Hao Gu, Duzhen Zhang, Yujie Chen, Manjie Xu, Ruibo Fu, Shan Yang, Dong Yu

机构 * Chinese Academy of Sciences(中国科学院) University of Chinese Academy of Sciences(中国科学院大学) Tencent AI Lab(腾讯AI实验室) Institute of Automation School of Artificial Intelligence(自动化研究所人工智能学院)

专题命中 视觉推理 :vision-language model(title,abstract);multimodal large language model(abstract)

Comments Accepted by Interspeech 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13391 2025-05-20 cs.AI cs.CV cs.LG 82%

Advancing Generalization Across a Variety of Abstract Visual Reasoning Tasks

Mikołaj Małkiński, Jacek Mańdziuk

专题命中 视觉推理 :visual reasoning(title,abstract);分类 cs.CV、cs.AI、cs.LG

Comments Accepted to the 34th International Joint Conference on Artificial Intelligence (IJCAI 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.11061 2025-05-19 cs.AI cs.CV cs.LG 82%

A-I-RAVEN and I-RAVEN-Mesh: Two New Benchmarks for Abstract Visual Reasoning

Mikołaj Małkiński, Jacek Mańdziuk

专题命中 视觉推理 :visual reasoning(title,abstract);分类 cs.CV、cs.AI、cs.LG

Comments Accepted to the 34th International Joint Conference on Artificial Intelligence (IJCAI 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.06418 2025-05-13 cs.CL 82%

Is your multimodal large language model a good science tutor?

Ming Liu, Liwen Wang, Wensheng Zhang

专题命中 视觉推理 :multimodal large language model(title,abstract);MLLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.06631 2025-04-22 cs.CL 82%

IFShip: Interpretable Fine-grained Ship Classification with Domain Knowledge-Enhanced Vision-Language Models

Mingning Guo, Mengwei Wu, Yuxiang Shen, Haifeng Li, Chao Tao

专题命中 视觉推理 :vision-language model(title,abstract);LLaVA(abstract)

Journal ref Pattern Recognition, 166, 111672 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.00238 2025-04-18 cs.AI cs.CV cs.LG q-bio.NC 82%

Understanding the Limits of Vision Language Models Through the Lens of the Binding Problem

Declan Campbell, Sunayana Rane, Tyler Giallanza, Nicolò De Sabbata, Kia Ghods, Amogh Joshi, Alexander Ku, Steven M. Frankland, Thomas L. Griffiths, Jonathan D. Cohen, Taylor W. Webb

专题命中 视觉推理 :vision language model(title,abstract);分类 cs.CV、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.11468 2025-04-17 cs.CL 82%

SFT or RL? An Early Investigation into Training R1-Like Reasoning Large Vision-Language Models

Hardy Chen, Haoqin Tu, Fali Wang, Hui Liu, Xianfeng Tang, Xinya Du, Yuyin Zhou, Cihang Xie

专题命中 视觉推理 :vision-language model(title,abstract);visual reasoning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.11009 2025-04-16 cs.MM 82%

MMC: Iterative Refinement of VLM Reasoning via MCTS-based Multimodal Critique

Shuhang Liu, Zhenrong Zhang, Pengfei Hu, Jiefeng Ma, Jun Du, Qing Wang, Jianshu Zhang, Quan Liu, Jianqing Gao, Feng Ma

专题命中 视觉推理 :VLM(title,abstract);visual language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.23503 2025-04-01 cs.CL 82%

Evolutionary Prompt Optimization Discovers Emergent Multimodal Reasoning Strategies in Vision-Language Models

Sid Bharthulwar, John Rho, Katrina Brown

专题命中 视觉推理 :vision-language model(title,abstract);VLM(abstract)

Comments Published at ICLR 2025 Workshop on Reasoning and Planning for LLMs

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10427 2025-03-18 cs.CL 82%

VisTW: Benchmarking Vision-Language Models for Traditional Chinese in Taiwan

Zhi Rui Tam, Ya-Ting Pai, Yen-Wei Lee, Yun-Nung Chen

专题命中 视觉推理 :vision-language model(title);VLM(abstract);visual language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.16412 2025-03-18 cs.RO 82%

SARO: Space-Aware Robot System for Terrain Crossing via Vision-Language Model

Shaoting Zhu, Derun Li, Linzhan Mou, Yong Liu, Ningyi Xu, Hang Zhao

专题命中 视觉推理 :vision-language model(title,abstract);VLM(abstract)

Comments 12 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.09024 2025-03-13 cs.RO cs.SY eess.IV eess.SY 82%

Traffic Regulation-aware Path Planning with Regulation Databases and Vision-Language Models

Xu Han, Zhiwen Wu, Xin Xia, Jiaqi Ma

专题命中 视觉推理 :vision-language model(title,abstract);VLM(abstract)

Comments 7 pages, 7 figures, submitted to ICRA

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06553 2025-03-11 cs.AI cs.CV cs.LG 82%

ProJudge: A Multi-Modal Multi-Discipline Benchmark and Instruction-Tuning Dataset for MLLM-based Process Judges

Jiaxin Ai, Pengfei Zhou, Zhaopan Xu, Ming Li, Fanrui Zhang, Zizhen Li, Jianwen Sun, Yukang Feng, Baojin Huang, Zhongyuan Wang, Kaipeng Zhang

专题命中 视觉推理 :MLLM(title,abstract);分类 cs.CV、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2201.12382 2025-02-24 cs.AI cs.CV cs.LG 82%

Deep Learning Methods for Abstract Visual Reasoning: A Survey on Raven's Progressive Matrices

Mikołaj Małkiński, Jacek Mańdziuk

专题命中 视觉推理 :visual reasoning(title,abstract);分类 cs.CV、cs.AI、cs.LG

Journal ref ACM Computing Surveys, Volume 57, Issue 7, Article No.: 166, February 2025, Pages 1-36

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.13832 2025-02-20 cs.HC 82%

ArtMentor: AI-Assisted Evaluation of Artworks to Explore Multimodal Large Language Models Capabilities

Chanjin Zheng, Zengyi Yu, Yilin Jiang, Mingzi Zhang, Xunuo Lu, Jing Jin, Liteng Gao

专题命中 视觉推理 :multimodal large language model(title,abstract);MLLM(abstract)

Comments 18 pages, 12 figures. Accepted by CHI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.01404 2025-02-11 cs.CL 82%

What Is Missing in Multilingual Visual Reasoning and How to Fix It

Yueqi Song, Simran Khanuja, Graham Neubig

专题命中 视觉推理 :visual reasoning(title,abstract);LLaVA(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.16411 2025-01-30 cs.CV cs.AI cs.CL cs.LG cs.RO 82%

PhysBench: Benchmarking and Enhancing Vision-Language Models for Physical World Understanding

Wei Chow, Jiageng Mao, Boyi Li, Daniel Seita, Vitor Guizilini, Yue Wang

专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.CV、cs.AI、cs.LG

Comments ICLR 2025. Project page: https://physbench.github.io/ Dataset: https://huggingface.co/datasets/USC-GVL/PhysBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.09997 2025-01-22 cs.AI cs.CV cs.LG 82%

One Self-Configurable Model to Solve Many Abstract Visual Reasoning Problems

Mikołaj Małkiński, Jacek Mańdziuk

专题命中 视觉推理 :visual reasoning(title,abstract);分类 cs.CV、cs.AI、cs.LG

Comments Accepted to The 38th Annual AAAI Conference on Artificial Intelligence (AAAI 2024)

Journal ref Proceedings of the AAAI Conference on Artificial Intelligence, Volume 38, Number 13, March 2024, Pages 14297-14305

详情

展开后加载摘要…

URL PDF HTML 收藏
2012.01944 2025-01-22 cs.AI cs.CV cs.LG 82%

Multi-Label Contrastive Learning for Abstract Visual Reasoning

Mikołaj Małkiński, Jacek Mańdziuk

专题命中 视觉推理 :visual reasoning(title,abstract);分类 cs.CV、cs.AI、cs.LG

Journal ref IEEE Transactions on Neural Networks and Learning Systems, Volume 35, Issue 2, February 2024, Pages 1941-1953

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.12652 2025-01-15 cs.CV cs.AI cs.CL cs.LG 82%

Pre-trained Vision-Language Models Learn Discoverable Visual Concepts

Yuan Zang, Tian Yun, Hao Tan, Trung Bui, Chen Sun

专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.CV、cs.AI、cs.LG

Comments Transactions on Machine Learning Research, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.05840 2025-01-03 cs.CL 82%

MMEvol: Empowering Multimodal Large Language Models with Evol-Instruct

Run Luo, Haonan Zhang, Longze Chen, Ting-En Lin, Xiong Liu, Yuchuan Wu, Min Yang, Minzheng Wang, Pengpeng Zeng, Lianli Gao, Heng Tao Shen, Yunshui Li, Xiaobo Xia, Fei Huang, Jingkuan Song, Yongbin Li

专题命中 视觉推理 :multimodal large language model(title,abstract);visual reasoning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.18826 2024-12-30 cs.CL 82%

RapGuard: Safeguarding Multimodal Large Language Models via Rationale-aware Defensive Prompting

Yilei Jiang, Yingshui Tan, Xiangyu Yue

专题命中 视觉推理 :multimodal large language model(title,abstract);MLLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.03548 2024-12-10 cs.CV cs.AI cs.LG 82%

Perception Tokens Enhance Visual Reasoning in Multimodal Language Models

Mahtab Bigverdi, Zelun Luo, Cheng-Yu Hsieh, Ethan Shen, Dongping Chen, Linda G. Shapiro, Ranjay Krishna

专题命中 视觉推理 :visual reasoning(title,abstract);分类 cs.CV、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.13754 2024-11-22 cs.LG cs.AI cs.CV 82%

Learning to Reason Iteratively and Parallelly for Complex Visual Reasoning Scenarios

Shantanu Jaiswal, Debaditya Roy, Basura Fernando, Cheston Tan

专题命中 视觉推理 :visual reasoning(title,abstract);分类 cs.CV、cs.AI、cs.LG

Comments NeurIPS 2024 camera ready; source code to be released at: https://github.com/shantanuj/IPRM_Iterative_and_Parallel_Reasoning_Mechanism

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.02810 2024-11-06 cs.CE cs.IR 82%

Leveraging Vision-Language Models for Manufacturing Feature Recognition in CAD Designs

Muhammad Tayyab Khan, Lequn Chen, Ye Han Ng, Wenhe Feng, Nicholas Yew Jin Tan, Seung Ki Moon

专题命中 视觉推理 :vision-language model(title,abstract);LLaVA(abstract)

Comments Paper has been submitted to The ASME Journal of Computing and Information Science in Engineering (JCISE)

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.01307 2024-11-05 cs.CL 82%

Can Multimodal Large Language Model Think Analogically?

Diandian Guo, Cong Cao, Fangfang Yuan, Dakui Wang, Wei Ma, Yanbing Liu, Jianhui Fu

专题命中 视觉推理 :multimodal large language model(title,abstract);MLLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.06798 2024-10-16 cs.RO 82%

Reasoning Grasping via Multimodal Large Language Model

Shiyu Jin, Jinxuan Xu, Yutian Lei, Liangjun Zhang

专题命中 视觉推理 :multimodal large language model(title,abstract);LLaVA(abstract)

Comments CoRL 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.14133 2024-09-13 cs.CL 82%

I Know About "Up"! Enhancing Spatial Reasoning in Visual Language Models Through 3D Reconstruction

Zaiqiao Meng, Hao Zhou, Yifang Chen

专题命中 视觉推理 :visual language model(title,abstract);visual reasoning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.11068 2024-06-18 cs.AI cs.CV cs.LG 82%

A Unified View of Abstract Visual Reasoning Problems

Mikołaj Małkiński, Jacek Mańdziuk

专题命中 视觉推理 :visual reasoning(title,abstract);分类 cs.CV、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏