arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 26117 信号源:cs.CV, cs.AI, cs.LG

1. 视觉推理 4478 篇

2507.17539 2025-07-24 cs.AI cs.CV eess.IV 84%

Constructing Ophthalmic MLLM for Positioning-diagnosis Collaboration Through Clinical Cognitive Chain Reasoning

Xinyao Liu, Diping Song

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) University of Science and Technology of China(中国科学技术大学)

专题命中 视觉推理 :MLLM(title,abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.13362 2025-07-21 cs.CV cs.AI cs.CL 84%

Enhancing Spatial Reasoning in Vision-Language Models via Chain-of-Thought Prompting and Reinforcement Learning

Binbin Ji, Siddharth Agrawal, Qiance Tang, Yvonne Wu

机构 * Courant New York University New York, United States(Courant 新 York 大学 新 York,美国)

专题命中 视觉推理 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV、cs.AI

Comments 10 pages, 5 figures, submitted to a conference (IEEE formate). Authored by students from the Courant Institute, NYU

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.12644 2025-07-18 cs.RO cs.AI cs.LG 84%

VLMgineer: Vision Language Models as Robotic Toolsmiths

George Jiayuan Gao, Tianyu Li, Junyao Shi, Yihan Li, Zizhe Zhang, Nadia Figueroa, Dinesh Jayaraman

专题命中 视觉推理 :vision language model(title,abstract);VLM(abstract);分类 cs.AI、cs.LG

Comments Project Website: https://vlmgineer.github.io/release

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.03019 2025-07-08 cs.CV cs.LG 84%

Look-Back: Implicit Visual Re-focusing in MLLM Reasoning

Shuo Yang, Yuwei Niu, Yuyang Liu, Yang Ye, Bin Lin, Li Yuan

机构 * Peking University(北京大学) Shenzhen Graduate School(深圳研究生院) Peng Cheng Laboratory(鹏城实验室)

专题命中 视觉推理 :MLLM(title,abstract);multimodal large language model(abstract);分类 cs.CV、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.20832 2025-07-01 cs.CV cs.AI 84%

Leveraging Vision-Language Models to Select Trustworthy Super-Resolution Samples Generated by Diffusion Models

Cansu Korkmaz, Ahmet Murat Tekalp, Zafer Dogan

机构 * Department of Electrical and Electronics Engineering and KUIS AI Center, Koç University(电气与电子工程系和KUIS人工智能中心,科克大学)

专题命中 视觉推理 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV、cs.AI

Comments 14 pages, 9 figures, 5 tables, accepted to IEEE Transactions on Circuits and Systems for Video Technology

Journal ref IEEE Transactions on Circuits and Systems for Video Technology 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.14824 2025-06-19 cs.LG cs.AI cs.MM 84%

FedNano: Toward Lightweight Federated Tuning for Pretrained Multimodal Large Language Models

Yao Zhang, Hewei Gao, Haokun Chen, Weiguo Li, Yunpu Ma, Volker Tresp

机构 * LMU Munich(慕尼黑莱布尼茨大学) Technical University of Munich(慕尼黑技术大学) Siemens Technology(西门子技术) Munich Center for Machine Learning(慕尼黑机器学习中心) University Heidelberg(海德堡大学)

专题命中 视觉推理 :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.AI、cs.LG

Comments 12 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.12693 2025-06-10 cs.CV cs.AI 84%

SPHERE: Unveiling Spatial Blind Spots in Vision-Language Models Through Hierarchical Evaluation

Wenyu Zhang, Wei En Ng, Lixin Ma, Yuwen Wang, Junqi Zhao, Allison Koenecke, Boyang Li, Lu Wang

机构 * National University of Singapore (NUS)(新加坡国立大学) Nanyang Technological University (NTU)(南洋理工大学) Cornell University(康奈尔大学)

专题命中 视觉推理 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV、cs.AI

Comments Accepted to ACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24238 2025-06-03 cs.CV cs.LG 84%

MIRAGE: Assessing Hallucination in Multimodal Reasoning Chains of MLLM

Bowen Dong, Minheng Ni, Zitong Huang, Guanglei Yang, Wangmeng Zuo, Lei Zhang

机构 * Harbin Institute of Technology(哈尔滨工业大学) The Hong Kong Polytechnic University(香港理工大学)

专题命中 视觉推理 :MLLM(title);visual reasoning(abstract);multimodal large language model(abstract);分类 cs.CV、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21850 2025-06-02 cs.CV cs.AI 84%

Beyond Perception: Evaluating Abstract Visual Reasoning through Multi-Stage Task

Yanbei Jiang, Yihao Ding, Chao Lei, Jiayang Ao, Jey Han Lau, Krista A. Ehinger

专题命中 视觉推理 :visual reasoning(title,abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI

Comments Accepted at ACL Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.17261 2025-06-02 cs.CV cs.AI 84%

HEIE: MLLM-Based Hierarchical Explainable AIGC Image Implausibility Evaluator

Fan Yang, Ru Zhen, Jianing Wang, Yanhao Zhang, Haoxiang Chen, Haonan Lu, Sicheng Zhao, Guiguang Ding

机构 * Tsinghua University(清华大学) BNRist OPPO AI Center(OPPO人工智能中心) Peking University(北京大学) Hangzhou Zhuoxi Institute of Brain and Intelligence(杭州智行脑科学与人工智能研究所)

专题命中 视觉推理 :MLLM(title,abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI

Comments Accepted by CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20753 2025-05-28 cs.CV cs.AI 84%

Understand, Think, and Answer: Advancing Visual Reasoning with Large Multimodal Models

Yufei Zhan, Hongyin Zhao, Yousong Zhu, Shurong Zheng, Fan Yang, Ming Tang, Jinqiao Wang

机构 * Foundation Model Research Center, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所基础模型研究中心) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Peng Cheng Laboratory, Shenzhen, China(鹏城实验室) Wuhan AI Research, Wuhan, China(武汉人工智能研究所)

专题命中 视觉推理 :visual reasoning(title,abstract);grounding(abstract);分类 cs.CV、cs.AI

Comments Tech report

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16673 2025-05-23 cs.CV cs.AI cs.CL 84%

R1-ShareVL: Incentivizing Reasoning Capability of Multimodal Large Language Models via Share-GRPO

Huanjin Yao, Qixiang Yin, Jingyi Zhang, Min Yang, Yibo Wang, Wenhao Wu, Fei Su, Li Shen, Minghui Qiu, Dacheng Tao, Jiaxing Huang

机构 * Nanyang Technological University(南洋理工大学) ByteDance(字节跳动) Tsinghua University(清华大学) Beijing University of Posts and Telecommunications(北京邮电大学) The University of Sydney(悉尼大学)

专题命中 视觉推理 :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.CV、cs.AI

Comments Technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.03654 2025-05-20 cs.CV cs.AI 84%

ReGraP-LLaVA: Reasoning enabled Graph-based Personalized Large Language and Vision Assistant

Yifan Xiang, Zhenxi Zhang, Bin Li, Yixuan Weng, Shoujun Zhou, Yangfan He, Keqin Li

机构 * Shenzhen Institute of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究所) School of Engineering, Westlake University(西湖大学工程学院) University of Minnesota – Twin Cities(明尼苏达大学双城分校) University of Toronto(多伦多大学)

专题命中 视觉推理 :LLaVA(title,abstract);MLLM(abstract);分类 cs.CV、cs.AI

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.00150 2025-05-02 cs.CV cs.AI cs.CL 84%

Detecting and Mitigating Hateful Content in Multimodal Memes with Vision-Language Models

Minh-Hao Van, Xintao Wu

机构 * Department of EECS University of Arkanasas Fayetteville(电子工程与科学系阿肯色大学法洛维尔分校)

专题命中 视觉推理 :vision-language model(title,abstract);LLaVA(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.08772 2025-04-15 cs.LG cs.AI 84%

Reward Generation via Large Vision-Language Model in Offline Reinforcement Learning

Younghwan Lee, Tung M. Luu, Donghoon Lee, Chang D. Yoo

专题命中 视觉推理 :vision-language model(title,abstract);VLM(abstract);分类 cs.AI、cs.LG

Comments 5 pages, ICASSP 2025. First two authors are equally contributed

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.03164 2025-04-08 cs.CV cs.AI 84%

NuScenes-SpatialQA: A Spatial Understanding and Reasoning Benchmark for Vision-Language Models in Autonomous Driving

Kexin Tian, Jingrui Mao, Yunlong Zhang, Jiwan Jiang, Yang Zhou, Zhengzhong Tu

专题命中 视觉推理 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.00938 2025-04-02 cs.AI cs.LG 84%

AI Judges in Design: Statistical Perspectives on Achieving Human Expert Equivalence With Vision-Language Models

Kristen M. Edwards, Farnaz Tehranchi, Scarlett R. Miller, Faez Ahmed

专题命中 视觉推理 :vision-language model(title,abstract);VLM(abstract);分类 cs.AI、cs.LG

Comments 21 pages, 8 tables, 6 figures, 8 tables in the appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.17142 2025-03-24 cs.CV cs.LG 84%

Not Only Text: Exploring Compositionality of Visual Representations in Vision-Language Models

Davide Berasi, Matteo Farina, Massimiliano Mancini, Elisa Ricci, Nicola Strisciuglio

专题命中 视觉推理 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV、cs.LG

Comments Camera-ready version for CVPR 2025 (with Supp.Mat.)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06026 2025-03-11 cs.RO cs.AI cs.CV 84%

Zero-Shot Peg Insertion: Identifying Mating Holes and Estimating SE(2) Poses with Vision-Language Models

Masaru Yajima, Kei Ota, Asako Kanezaki, Rei Kawakami

专题命中 视觉推理 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV、cs.AI

Comments Under submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.03840 2025-03-07 cs.CV cs.LG 84%

Decoupling the components of geometric understanding in Vision Language Models

Eliza Kosoy, Annya Dahmani, Andrew K. Lampinen, Iulia M. Comsa, Soojin Jeong, Ishita Dasgupta, Kelsey Allen

专题命中 视觉推理 :vision language model(title,abstract);VLM(abstract);分类 cs.CV、cs.LG

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.15683 2025-03-07 cs.CV cs.AI cs.CL 84%

Visual Description Grounding Reduces Hallucinations and Boosts Reasoning in LVLMs

Sreyan Ghosh, Chandra Kiran Reddy Evuru, Sonal Kumar, Utkarsh Tyagi, Oriol Nieto, Zeyu Jin, Dinesh Manocha

专题命中 视觉推理 :grounding(title);vision-language model(abstract);visual reasoning(abstract);分类 cs.CV、cs.AI

Comments Accepted to ICLR 2025. Project: https://sreyan88.github.io/VDGD/

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.16707 2025-02-25 cs.RO cs.AI cs.LG 84%

Reflective Planning: Vision-Language Models for Multi-Stage Long-Horizon Robotic Manipulation

Yunhai Feng, Jiaming Han, Zhuoran Yang, Xiangyu Yue, Sergey Levine, Jianlan Luo

专题命中 视觉推理 :vision-language model(title,abstract);VLM(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.16428 2025-02-25 cs.CV cs.AI 84%

Visual Reasoning Evaluation of Grok, Deepseek Janus, Gemini, Qwen, Mistral, and ChatGPT

Nidhal Jegham, Marwan Abdelatti, Abdeltawab Hendawi

专题命中 视觉推理 :visual reasoning(title,abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.09809 2025-02-25 cs.CV cs.AI 84%

A Stepwise Distillation Learning Strategy for Non-differentiable Visual Programming Frameworks on Visual Reasoning Tasks

Wentao Wan, Nan Kang, Zeqing Wang, Zhuojie Yang, Liang Lin, Keze Wang

专题命中 视觉推理 :visual reasoning(title,abstract);vision-language model(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.18409 2025-02-14 cs.AI cs.CL cs.CV 84%

A Cognitive Evaluation Benchmark of Image Reasoning and Description for Large Vision-Language Models

Xiujie Song, Mengyue Wu, Kenny Q. Zhu, Chunhao Zhang, Yanyi Chen

专题命中 视觉推理 :vision-language model(title,abstract);visual question answering(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.15606 2025-02-04 cs.AI cs.CV 84%

Multi-modal Agent Tuning: Building a VLM-Driven Agent for Efficient Tool Usage

Zhi Gao, Bofei Zhang, Pengxiang Li, Xiaojian Ma, Tao Yuan, Yue Fan, Yuwei Wu, Yunde Jia, Song-Chun Zhu, Qing Li

专题命中 视觉推理 :VLM(title,abstract);vision-language model(abstract);分类 cs.CV、cs.AI

Comments ICLR 2025, https://mat-agent.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.13187 2024-12-19 cs.CV cs.LG 84%

HandsOnVLM: Vision-Language Models for Hand-Object Interaction Prediction

Chen Bao, Jiarui Xu, Xiaolong Wang, Abhinav Gupta, Homanga Bharadhwaj

专题命中 视觉推理 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV、cs.LG

Comments Preprint. Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.18938 2024-12-04 cs.CV cs.AI 84%

From Seconds to Hours: Reviewing MultiModal Large Language Models on Comprehensive Long Video Understanding

Heqing Zou, Tianze Luo, Guiyang Xie, Victor, Zhang, Fengmao Lv, Guangcong Wang, Junyang Chen, Zhuochen Wang, Hansheng Zhang, Huaijian Zhang

专题命中 视觉推理 :multimodal large language model(title,abstract);visual reasoning(abstract);分类 cs.CV、cs.AI

Comments 11 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.15201 2024-11-26 cs.CV cs.AI 84%

Beyond Visual Understanding: Introducing PARROT-360V for Vision Language Model Benchmarking

Harsha Vardhan Khurdula, Basem Rizk, Indus Khaitan, Janit Anjaria, Aviral Srivastava, Rajvardhan Khaitan

专题命中 视觉推理 :vision language model(title,abstract);visual reasoning(abstract);分类 cs.CV、cs.AI

Comments 7 pages, 4 figures, Accepted at COLING 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.11548 2024-11-19 cs.RO cs.AI cs.CV 84%

AIC MLLM: Autonomous Interactive Correction MLLM for Robust Robotic Manipulation

Chuyan Xiong, Chengyu Shen, Xiaoqi Li, Kaichen Zhou, Jeremy Liu, Ruiping Wang, Hao Dong

专题命中 视觉推理 :MLLM(title,abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏