arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 4454 信号源:cs.CV, cs.AI, cs.LG

1. 视觉推理 4454 篇

2503.13947 2025-04-14 cs.CV 79%

Conformal Prediction and MLLM aided Uncertainty Quantification in Scene Graph Generation

Sayak Nag, Udita Ghosh, Calvin-Khang Ta, Sarosij Bose, Jiachen Li, Amit K Roy Chowdhury

专题命中 视觉推理 :MLLM(title,abstract);分类 cs.CV

Comments Accepted at CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.10442 2025-04-08 cs.CL cs.CV 79%

Enhancing the Reasoning Ability of Multimodal Large Language Models via Mixed Preference Optimization

Weiyun Wang, Zhe Chen, Wenhai Wang, Yue Cao, Yangzhou Liu, Zhangwei Gao, Jinguo Zhu, Xizhou Zhu, Lewei Lu, Yu Qiao, Jifeng Dai

专题命中 视觉推理 :multimodal large language model(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.23064 2025-04-03 cs.CV 79%

VGRP-Bench: Visual Grid Reasoning Puzzle Benchmark for Large Vision-Language Models

Yufan Ren, Konstantinos Tertikas, Shalini Maiti, Junlin Han, Tong Zhang, Sabine Süsstrunk, Filippos Kokkinos

专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.CV

Comments 8 pages; Project page: https://yufan-ren.com/subpage/VGRP-Bench/

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.13543 2025-04-02 cs.AI 79%

BALROG: Benchmarking Agentic LLM and VLM Reasoning On Games

Davide Paglieri, Bartłomiej Cupiał, Samuel Coward, Ulyana Piterbarg, Maciej Wolczyk, Akbir Khan, Eduardo Pignatelli, Łukasz Kuciński, Lerrel Pinto, Rob Fergus, Jakob Nicolaus Foerster, Jack Parker-Holder, Tim Rocktäschel

专题命中 视觉推理 :VLM(title);vision language model(abstract);分类 cs.AI

Comments Published as a conference paper at ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.20213 2025-04-02 cs.CV 79%

Mind the GAP: Glimpse-based Active Perception improves generalization and sample efficiency of visual reasoning

Oleh Kolner, Thomas Ortner, Stanisław Woźniak, Angeliki Pantazi

专题命中 视觉推理 :visual reasoning(title,abstract);分类 cs.CV

Comments 10 pages of main text and 8 pages appendices

Journal ref The Thirteenth International Conference on Learning Representations (ICLR) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.12496 2025-03-31 cs.CV 79%

Does Your Vision-Language Model Get Lost in the Long Video Sampling Dilemma?

Tianyuan Qu, Longxiang Tang, Bohao Peng, Senqiao Yang, Bei Yu, Jiaya Jia

专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.08614 2025-03-27 cs.CV 79%

Benchmarking Large Vision-Language Models via Directed Scene Graph for Comprehensive Image Captioning

Fan Lu, Wei Wu, Kecheng Zheng, Shuailei Ma, Biao Gong, Jiawei Liu, Wei Zhai, Yang Cao, Yujun Shen, Zheng-Jun Zha

专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.CV

Comments Accepted by CVPR2025. Code and Dataset: https://github.com/LuFan31/CompreCap

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.18533 2025-03-25 cs.AI 79%

MMCR: Advancing Visual Language Model in Multimodal Multi-Turn Contextual Reasoning

Dawei Yan, Yang Li, Qing-Guo Chen, Weihua Luo, Peng Wang, Haokui Zhang, Chunhua Shen

专题命中 视觉推理 :visual language model(title);vision-language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.14161 2025-03-19 cs.CV 79%

CoSpace: Benchmarking Continuous Space Perception Ability for Vision-Language Models

Yiqi Zhu, Ziyue Wang, Can Zhang, Peng Li, Yang Liu

专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.13440 2025-03-19 cs.CV 79%

MaTVLM: Hybrid Mamba-Transformer for Efficient Vision-Language Modeling

Yingyue Li, Bencheng Liao, Wenyu Liu, Xinggang Wang

专题命中 视觉推理 :vision-language model(title);VLM(abstract);分类 cs.CV

Comments Code and model are available at http://github.com/hustvl/MaTVLM

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.07601 2025-03-18 cs.CV cs.CL 79%

Towards Zero-Shot Anomaly Detection and Reasoning with Multimodal Large Language Models

Jiacong Xu, Shao-Yuan Lo, Bardia Safaei, Vishal M. Patel, Isht Dwivedi

专题命中 视觉推理 :multimodal large language model(title,abstract);分类 cs.CV

Comments 19 pages, 10 figures, accepted by CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.11347 2025-03-18 cs.CV 79%

EndoChat: Grounded Multimodal Large Language Model for Endoscopic Surgery

Guankun Wang, Long Bai, Junyi Wang, Kun Yuan, Zhen Li, Tianxu Jiang, Xiting He, Jinlin Wu, Zhen Chen, Zhen Lei, Hongbin Liu, Jiazheng Wang, Fan Zhang, Nicolas Padoy, Nassir Navab, Hongliang Ren

专题命中 视觉推理 :multimodal large language model(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.11342 2025-03-17 cs.CV 79%

Road Rage Reasoning with Vision-language Models (VLMs): Task Definition and Evaluation Dataset

Yibing Weng, Yu Gu, Fuji Ren

专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.20312 2025-03-13 cs.CV 79%

Learn "No" to Say "Yes" Better: Improving Vision-Language Models via Negations

Jaisidh Singh, Ishaan Shrivastava, Mayank Vatsa, Richa Singh, Aparna Bharati

专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.CV

Comments 14 pages + 6 figures in main manuscript (excluding references)

Journal ref WACV 2025 pages(7991-8001)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.07065 2025-03-11 cs.CV 79%

Boosting the Generalization and Reasoning of Vision Language Models with Curriculum Reinforcement Learning

Huilin Deng, Ding Zou, Rui Ma, Hongchen Luo, Yang Cao, Yu Kang

专题命中 视觉推理 :vision language model(title);vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.04801 2025-03-10 cs.CL cs.AI 79%

Exploring and Evaluating Multimodal Knowledge Reasoning Consistency of Multimodal Large Language Models

Boyu Jia, Junzhe Zhang, Huixuan Zhang, Xiaojun Wan

专题命中 视觉推理 :multimodal large language model(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.01632 2025-03-04 cs.AI 79%

CoT-VLM4Tar: Chain-of-Thought Guided Vision-Language Models for Traffic Anomaly Resolution

Tianchi Ren, Haibo Hu, Jiacheng Zuo, Xinhong Chen, Jianping Wang, Chun Jason Xue, Jen-Ming Wu, Nan Guan

专题命中 视觉推理 :vision-language model(title);VLM(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.05660 2025-02-11 cs.CV cs.CL 79%

Evaluating Vision-Language Models for Emotion Recognition

Sree Bhattacharyya, James Z. Wang

专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.CV

Comments Accepted to NAACL 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.08992 2025-02-03 cs.CV 79%

Contextual Emotion Recognition using Large Vision Language Models

Yasaman Etesam, Özge Nilay Yalçın, Chuxuan Zhang, Angelica Lim

专题命中 视觉推理 :vision language model(title,abstract);分类 cs.CV

Comments 8 pages, website: https://yasaman-etesam.github.io/Contextual-Emotion-Recognition/. arXiv admin note: text overlap with arXiv:2310.19995

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.09502 2025-01-17 cs.CV 79%

Omni-Emotion: Extending Video MLLM with Detailed Face and Audio Modeling for Multimodal Emotion Analysis

Qize Yang, Detao Bai, Yi-Xing Peng, Xihan Wei

专题命中 视觉推理 :MLLM(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.21534 2025-01-08 cs.CV 79%

ControlMLLM: Training-Free Visual Prompt Learning for Multimodal Large Language Models

Mingrui Wu, Xinyue Cai, Jiayi Ji, Jiale Li, Oucheng Huang, Gen Luo, Hao Fei, Guannan Jiang, Xiaoshuai Sun, Rongrong Ji

专题命中 视觉推理 :multimodal large language model(title,abstract);分类 cs.CV

Comments Accepted to NeurIPS 2024; Code:https://github.com/mrwu-mac/ControlMLLM

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.17339 2024-12-24 cs.AI cs.CL 79%

MineAgent: Towards Remote-Sensing Mineral Exploration with Multimodal Large Language Models

Beibei Yu, Tao Shen, Hongbin Na, Ling Chen, Denqi Li

专题命中 视觉推理 :multimodal large language model(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.19732 2024-12-23 cs.CL cs.CV 79%

Rethinking Visual Dependency in Long-Context Reasoning for Large Vision-Language Models

Yucheng Zhou, Zhi Rao, Jun Wan, Jianbing Shen

专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.11391 2024-12-17 cs.CV 79%

Temporal Contrastive Learning for Video Temporal Reasoning in Large Vision-Language Models

Rafael Souza, Jia-Hao Lim, Alexander Davis

专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.09817 2024-12-16 cs.CV cs.CL 79%

Enhancing Multimodal Large Language Models Complex Reason via Similarity Computation

Xiaofeng Zhang, Fanshuo Zeng, Yihao Quan, Zheng Hui, Jiawei Yao

专题命中 视觉推理 :multimodal large language model(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.00243 2024-12-03 cs.RO cs.AI 79%

Realistic Corner Case Generation for Autonomous Vehicles with Multimodal Large Language Model

Qiujing Lu, Meng Ma, Ximiao Dai, Xuanhan Wang, Shuo Feng

专题命中 视觉推理 :multimodal large language model(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.19716 2024-11-26 cs.CV cs.CL 79%

Enhancing Large Vision Language Models with Self-Training on Image Comprehension

Yihe Deng, Pan Lu, Fan Yin, Ziniu Hu, Sheng Shen, Quanquan Gu, James Zou, Kai-Wei Chang, Wei Wang

专题命中 视觉推理 :vision language model(title,abstract);分类 cs.CV

Comments 22 pages, 14 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.18570 2024-10-25 cs.RO cs.AI 79%

Zero-shot Object Navigation with Vision-Language Models Reasoning

Congcong Wen, Yisiyuan Huang, Hao Huang, Yanjia Huang, Shuaihang Yuan, Yu Hao, Hui Lin, Yu-Shen Liu, Yi Fang

专题命中 视觉推理 :vision-language model(title);vision language model(abstract);分类 cs.AI

Comments Accepted by the International Conference on Pattern Recognition (ICPR) for Oral presentation

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.15549 2024-10-22 cs.RO cs.CV 79%

A Dual Process VLA: Efficient Robotic Manipulation Leveraging VLM

ByungOk Han, Jaehong Kim, Jinhyeok Jang

专题命中 视觉推理 :VLM(title);vision-language model(abstract);分类 cs.CV

Comments 10 page

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.13510 2024-10-18 cs.CL cs.CV 79%

GeoCoder: Solving Geometry Problems by Generating Modular Code through Vision-Language Models

Aditya Sharma, Aman Dalmia, Mehran Kazemi, Amal Zouaq, Christopher J. Pal

专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏