arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 4447 信号源:cs.CV, cs.AI, cs.LG

1. 视觉推理 4447 篇

2504.00938 2025-04-02 cs.AI cs.LG 84%

AI Judges in Design: Statistical Perspectives on Achieving Human Expert Equivalence With Vision-Language Models

Kristen M. Edwards, Farnaz Tehranchi, Scarlett R. Miller, Faez Ahmed

专题命中 视觉推理 :vision-language model(title,abstract);VLM(abstract);分类 cs.AI、cs.LG

Comments 21 pages, 8 tables, 6 figures, 8 tables in the appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.17142 2025-03-24 cs.CV cs.LG 84%

Not Only Text: Exploring Compositionality of Visual Representations in Vision-Language Models

Davide Berasi, Matteo Farina, Massimiliano Mancini, Elisa Ricci, Nicola Strisciuglio

专题命中 视觉推理 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV、cs.LG

Comments Camera-ready version for CVPR 2025 (with Supp.Mat.)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06026 2025-03-11 cs.RO cs.AI cs.CV 84%

Zero-Shot Peg Insertion: Identifying Mating Holes and Estimating SE(2) Poses with Vision-Language Models

Masaru Yajima, Kei Ota, Asako Kanezaki, Rei Kawakami

专题命中 视觉推理 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV、cs.AI

Comments Under submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.03840 2025-03-07 cs.CV cs.LG 84%

Decoupling the components of geometric understanding in Vision Language Models

Eliza Kosoy, Annya Dahmani, Andrew K. Lampinen, Iulia M. Comsa, Soojin Jeong, Ishita Dasgupta, Kelsey Allen

专题命中 视觉推理 :vision language model(title,abstract);VLM(abstract);分类 cs.CV、cs.LG

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.15683 2025-03-07 cs.CV cs.AI cs.CL 84%

Visual Description Grounding Reduces Hallucinations and Boosts Reasoning in LVLMs

Sreyan Ghosh, Chandra Kiran Reddy Evuru, Sonal Kumar, Utkarsh Tyagi, Oriol Nieto, Zeyu Jin, Dinesh Manocha

专题命中 视觉推理 :grounding(title);vision-language model(abstract);visual reasoning(abstract);分类 cs.CV、cs.AI

Comments Accepted to ICLR 2025. Project: https://sreyan88.github.io/VDGD/

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.16707 2025-02-25 cs.RO cs.AI cs.LG 84%

Reflective Planning: Vision-Language Models for Multi-Stage Long-Horizon Robotic Manipulation

Yunhai Feng, Jiaming Han, Zhuoran Yang, Xiangyu Yue, Sergey Levine, Jianlan Luo

专题命中 视觉推理 :vision-language model(title,abstract);VLM(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.16428 2025-02-25 cs.CV cs.AI 84%

Visual Reasoning Evaluation of Grok, Deepseek Janus, Gemini, Qwen, Mistral, and ChatGPT

Nidhal Jegham, Marwan Abdelatti, Abdeltawab Hendawi

专题命中 视觉推理 :visual reasoning(title,abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.09809 2025-02-25 cs.CV cs.AI 84%

A Stepwise Distillation Learning Strategy for Non-differentiable Visual Programming Frameworks on Visual Reasoning Tasks

Wentao Wan, Nan Kang, Zeqing Wang, Zhuojie Yang, Liang Lin, Keze Wang

专题命中 视觉推理 :visual reasoning(title,abstract);vision-language model(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.18409 2025-02-14 cs.AI cs.CL cs.CV 84%

A Cognitive Evaluation Benchmark of Image Reasoning and Description for Large Vision-Language Models

Xiujie Song, Mengyue Wu, Kenny Q. Zhu, Chunhao Zhang, Yanyi Chen

专题命中 视觉推理 :vision-language model(title,abstract);visual question answering(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.15606 2025-02-04 cs.AI cs.CV 84%

Multi-modal Agent Tuning: Building a VLM-Driven Agent for Efficient Tool Usage

Zhi Gao, Bofei Zhang, Pengxiang Li, Xiaojian Ma, Tao Yuan, Yue Fan, Yuwei Wu, Yunde Jia, Song-Chun Zhu, Qing Li

专题命中 视觉推理 :VLM(title,abstract);vision-language model(abstract);分类 cs.CV、cs.AI

Comments ICLR 2025, https://mat-agent.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.13187 2024-12-19 cs.CV cs.LG 84%

HandsOnVLM: Vision-Language Models for Hand-Object Interaction Prediction

Chen Bao, Jiarui Xu, Xiaolong Wang, Abhinav Gupta, Homanga Bharadhwaj

专题命中 视觉推理 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV、cs.LG

Comments Preprint. Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.18938 2024-12-04 cs.CV cs.AI 84%

From Seconds to Hours: Reviewing MultiModal Large Language Models on Comprehensive Long Video Understanding

Heqing Zou, Tianze Luo, Guiyang Xie, Victor, Zhang, Fengmao Lv, Guangcong Wang, Junyang Chen, Zhuochen Wang, Hansheng Zhang, Huaijian Zhang

专题命中 视觉推理 :multimodal large language model(title,abstract);visual reasoning(abstract);分类 cs.CV、cs.AI

Comments 11 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.15201 2024-11-26 cs.CV cs.AI 84%

Beyond Visual Understanding: Introducing PARROT-360V for Vision Language Model Benchmarking

Harsha Vardhan Khurdula, Basem Rizk, Indus Khaitan, Janit Anjaria, Aviral Srivastava, Rajvardhan Khaitan

专题命中 视觉推理 :vision language model(title,abstract);visual reasoning(abstract);分类 cs.CV、cs.AI

Comments 7 pages, 4 figures, Accepted at COLING 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.11548 2024-11-19 cs.RO cs.AI cs.CV 84%

AIC MLLM: Autonomous Interactive Correction MLLM for Robust Robotic Manipulation

Chuyan Xiong, Chengyu Shen, Xiaoqi Li, Kaichen Zhou, Jeremy Liu, Ruiping Wang, Hao Dong

专题命中 视觉推理 :MLLM(title,abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.16198 2024-10-22 cs.AI cs.CV 84%

Improve Vision Language Model Chain-of-thought Reasoning

Ruohong Zhang, Bowen Zhang, Yanghao Li, Haotian Zhang, Zhiqing Sun, Zhe Gan, Yinfei Yang, Ruoming Pang, Yiming Yang

专题命中 视觉推理 :vision language model(title,abstract);VLM(abstract);分类 cs.CV、cs.AI

Comments 10 pages + appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.03551 2024-10-07 cs.CV cs.AI cs.HC 84%

Constructive Apraxia: An Unexpected Limit of Instructible Vision-Language Models and Analog for Human Cognitive Disorders

David Noever, Samantha E. Miller Noever

专题命中 视觉推理 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.21439 2024-09-26 cs.AI cs.CL cs.LG 84%

MLLM Is a Strong Reranker: Advancing Multimodal Retrieval-augmented Generation via Knowledge-enhanced Reranking and Noise-injected Training

Zhanpeng Chen, Chengjin Xu, Yiyan Qi, Jian Guo

专题命中 视觉推理 :MLLM(title,abstract);multimodal large language model(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.15769 2024-08-29 cs.CV cs.AI cs.CL 84%

A Survey on Evaluation of Multimodal Large Language Models

Jiaxing Huang, Jingyi Zhang

专题命中 视觉推理 :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.03729 2024-08-13 cs.CV cs.AI 84%

TinyLVLM-eHub: Towards Comprehensive and Efficient Evaluation for Large Vision-Language Models

Wenqi Shao, Meng Lei, Yutao Hu, Peng Gao, Kaipeng Zhang, Fanqing Meng, Peng Xu, Siyuan Huang, Hongsheng Li, Yu Qiao, Ping Luo

专题命中 视觉推理 :vision-language model(title,abstract);visual reasoning(abstract);分类 cs.CV、cs.AI

Comments accepted to IEEE Transactions on Big Data. Project Page: http://lvlm-ehub.opengvlab.com/

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.07922 2024-07-17 cs.CL cs.CV cs.LG 84%

LaVy: Vietnamese Multimodal Large Language Model

Chi Tran, Huong Le Thanh

专题命中 视觉推理 :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.CV、cs.LG

Comments 5 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.11069 2024-06-18 cs.CV cs.AI cs.CL 84%

WildVision: Evaluating Vision-Language Models in the Wild with Human Preferences

Yujie Lu, Dongfu Jiang, Wenhu Chen, William Yang Wang, Yejin Choi, Bill Yuchen Lin

专题命中 视觉推理 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV、cs.AI

Comments link: https://hf.co/spaces/WildVision/vision-arena

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.04461 2024-03-21 cs.CL cs.CV cs.LG 84%

Measuring and Improving Chain-of-Thought Reasoning in Vision-Language Models

Yangyi Chen, Karan Sikka, Michael Cogswell, Heng Ji, Ajay Divakaran

专题命中 视觉推理 :vision-language model(title,abstract);visual reasoning(abstract);分类 cs.CV、cs.LG

Comments NAACL 2024 Main Conference. The data is released at https://github.com/Yangyi-Chen/CoTConsistency

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.12921 2024-03-15 cs.LG cs.AI 84%

Vision-Language Models are Zero-Shot Reward Models for Reinforcement Learning

Juan Rocamonde, Victoriano Montesinos, Elvis Nava, Ethan Perez, David Lindner

专题命中 视觉推理 :vision-language model(title,abstract);VLM(abstract);分类 cs.AI、cs.LG

Comments Presented at International Conference on Learning Representations (ICLR) 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.09778 2024-03-07 cs.CV cs.CL cs.LG 84%

Towards Grounded Visual Spatial Reasoning in Multi-Modal Vision Language Models

Navid Rajabi, Jana Kosecka

专题命中 视觉推理 :vision language model(title);visual question answering(abstract);grounding(abstract);分类 cs.CV、cs.LG

Comments Accepted to DMLR @ ICLR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.17661 2024-01-01 cs.CL cs.AI cs.CV 84%

Gemini in Reasoning: Unveiling Commonsense in Multimodal Large Language Models

Yuqing Wang, Yun Zhao

专题命中 视觉推理 :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.CV、cs.AI

Comments Data and results are available at: https://github.com/EternityYW/Gemini-Commonsense-Evaluation/

详情

展开后加载摘要…

URL PDF HTML 收藏
2212.10292 2022-12-21 cs.CV cs.AI 84%

Towards Unsupervised Visual Reasoning: Do Off-The-Shelf Features Know How to Reason?

Monika Wysoczańska, Tom Monnier, Tomasz Trzciński, David Picard

专题命中 视觉推理 :visual reasoning(title,abstract);visual question answering(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2007.04670 2020-07-13 cs.AI cs.CV 84%

Multi-Granularity Modularized Network for Abstract Visual Reasoning

Xiangru Tang, Haoyuan Wang, Xiang Pan, Jiyang Qi

专题命中 视觉推理 :visual reasoning(title,abstract);grounding(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
1809.01943 2018-09-07 cs.IR cs.AI cs.CL cs.CV 84%

Cascaded Mutual Modulation for Visual Reasoning

Yiqun Yao, Jiaming Xu, Feng Wang, Bo Xu

专题命中 视觉推理 :visual reasoning(title,abstract);visual question answering(abstract);分类 cs.CV、cs.AI

Comments to appear in EMNLP 2018

详情

展开后加载摘要…

URL PDF HTML 收藏
1612.06890 2016-12-22 cs.CV cs.CL cs.LG 84%

CLEVR: A Diagnostic Dataset for Compositional Language and Elementary Visual Reasoning

Justin Johnson, Bharath Hariharan, Laurens van der Maaten, Li Fei-Fei, C. Lawrence Zitnick, Ross Girshick

专题命中 视觉推理 :visual reasoning(title,abstract);visual question answering(abstract);分类 cs.CV、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29496 2026-05-29 cs.CL cs.CV 84%

On Asymmetric Optimization of Reasoning and Perception in Vision-Language Model Post-Training

视觉语言模型后训练中推理与感知的非对称优化研究

Xueqing Wu, Yu-Chi Lin, Kai-Wei Chang, Nanyun Peng

机构 * University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 视觉推理 :vision-language model(title,abstract);visual reasoning(abstract);分类 cs.CV;VLM(comments)

AI总结 通过合成任务诊断发现,后训练中推理提升显著优于感知,SFT源于感知token少导致训练信号弱,RL源于奖励耦合,提出动态重加权损失和感知奖励可缓解不平衡并提升端到端性能。

Comments Project: https://asymmetric-vlm-post-training.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏