arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 26117 信号源:cs.CV, cs.AI, cs.LG

1. 视觉推理 4478 篇

2509.09332 2026-01-29 cs.RO cs.AI cs.CL cs.CV 79%

OmniEVA: Embodied Versatile Planner via Task-Adaptive 3D-Grounded and Embodiment-aware Reasoning

OmniEVA:通过任务自适应3D grounded和 embodiment-aware推理实现具身 versatile规划

Yuecheng Liu, Dafeng Chi, Shiguang Wu, Zhanguang Zhang, Yuzheng Zhuang, Bowen Yang, He Zhu, Lingfeng Zhang, Pengwei Xie, David Gamaliel Arcos Bravo, Yingxue Zhang, Jianye Hao, Xingyue Quan

机构 * Huawei Noah’s Ark Lab(华为诺亚实验室)

专题命中 视觉推理 :grounding(abstract);multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.AI

AI总结 OmniEVA通过任务自适应3D grounding和具身aware推理,解决具身系统中几何适应性和具身约束的限制,实现先进的具身推理和任务规划。

Comments Published as a conference paper at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09049 2026-01-23 cs.AI cs.CV cs.RO 79%

VIKI-R: Coordinating Embodied Multi-Agent Cooperation via Reinforcement Learning

VIKI-R: 通过强化学习协调具身多智能体合作

Li Kang, Xiufeng Song, Heng Zhou, Yiran Qin, Jie Yang, Xiaohong Liu, Philip Torr, Lei Bai, Zhenfei Yin

专题命中 视觉推理 :vision-language model(abstract);VLM(abstract);visual reasoning(abstract);分类 cs.CV、cs.AI

AI总结 VIKI-R通过强化学习协调多智能体合作,提出分层基准VIKI-Bench,显著提升多智能体视觉驱动合作性能。

Comments Accepted by NeurIPS 2025 Track on Datasets and Benchmarks. Project page: https://faceong.github.io/VIKI-R/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05600 2026-01-12 cs.CV cs.CL cs.LG 79%

SceneAlign: Aligning Multimodal Reasoning to Scene Graphs in Complex Visual Scenes

SceneAlign: 在复杂视觉场景中将多模态推理对齐到场景图

Chuhan Wang, Xintong Li, Jennifer Yuntong Zhang, Junda Wu, Chengkai Huang, Lina Yao, Julian McAuley, Jingbo Shang

机构 * University of California, San Diego(加州大学圣地亚哥分校) University of Toronto(多伦多大学) University of New South Wales(新南威尔士大学)

专题命中 视觉推理 :visual reasoning(abstract);grounding(abstract);multimodal large language model(abstract);分类 cs.CV、cs.LG

AI总结 SceneAlign通过利用场景图进行结构干预,提升多模态推理在复杂视觉场景中的准确性和忠实性。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01798 2026-01-06 cs.CV cs.AI 79%

VerLM: Explaining Face Verification Using Natural Language

通过自然语言解释面部验证

Syed Abdul Hannan, Hazim Bukhari, Thomas Cantalapiedra, Eman Ansar, Massa Baali, Rita Singh, Bhiksha Raj

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 视觉推理 :vision-language model(abstract);vision language model(abstract);VLM(abstract);分类 cs.CV、cs.AI

AI总结 本文提出一种视觉-语言模型用于面部验证,通过自然语言解释决策过程,提升验证的透明度和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08889 2025-12-10 cs.CV cs.AI 79%

No Labels, No Problem: Training Visual Reasoners with Multimodal Verifiers

无标签,无问题:利用多模态验证器训练视觉推理器

Damiano Marsili, Georgia Gkioxari

机构 * California Institute of Technology(加州理工学院)

专题命中 视觉推理 :VLM(abstract);visual reasoning(abstract);grounding(abstract);分类 cs.CV、cs.AI

AI总结 本文提出无需标注的视觉推理训练框架,结合AI驱动的验证器提升推理与定位能力,超越现有开源和专有模型。

Comments Project webpage: https://glab-caltech.github.io/valor/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08228 2025-12-10 cs.CV cs.AI 79%

MM-CoT:A Benchmark for Probing Visual Chain-of-Thought Reasoning in Multimodal Models

MM-CoT:一种用于探测多模态模型中视觉链式推理的基准测试

Jusheng Zhang, Kaitong Cai, Xiaoyang Guo, Sidi Liu, Qinhan Lv, Ruiqi Chen, Jing Yang, Yijia Fan, Xiaofei Sun, Jian Wang, Ziliang Chen, Liang Lin, Keze Wang

机构 * Sun Yat-sen University(中山大学) Alibaba Group(阿里巴巴集团) Snap Inc(Snap公司)

专题命中 视觉推理 :vision-language model(abstract);visual reasoning(abstract);grounding(abstract);分类 cs.CV、cs.AI

AI总结 MM-CoT是一种用于评估多模态模型视觉链式推理能力的基准测试,通过验证推理链的视觉一致性和逻辑一致性,揭示生成模型在真实推理上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22586 2025-12-01 cs.CV cs.AI 79%

Revisiting the Necessity of Lengthy Chain-of-Thought in Vision-centric Reasoning Generalization

重新审视基于视觉推理泛化性的长链式推理的必要性

Yifan Du, Kun Zhou, Yingqian Min, Yue Ling, Wayne Xin Zhao, Youbin Wu

机构 * Renmin University of China(中国人民大学)

专题命中 视觉推理 :vision-language model(abstract);visual reasoning(abstract);grounding(abstract);分类 cs.CV、cs.AI

AI总结 本文研究了不同链式推理设计对视觉推理泛化能力的影响,发现简洁的链式推理在不同迷宫规模中表现最佳,提出'短即长'效应。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19773 2025-11-26 cs.AI cs.CL cs.CV 79%

Scaling Agentic Reinforcement Learning for Tool-Integrated Reasoning in VLMs

在视觉语言模型中实现工具集成推理的规模化代理强化学习

Meng Lu, Ran Xu, Yi Fang, Wenxuan Zhang, Yue Yu, Gaurav Srivastava, Yuchen Zhuang, Mohamed Elhoseiny, Charles Fleming, Carl Yang, Zhengzhong Tu, Yang Xie, Guanghua Xiao, Hanrui Wang, Di Jin, Wenqi Shi, Xuan Wang

机构 * Virginia Tech(弗吉尼亚理工大学) Emory University(埃默里大学) KAUST(阿联酋卡塔尔大学) Georgia Tech(佐治亚理工学院) Cisco(思科系统) TAMU(德克萨斯大学奥斯汀分校) UT Southwestern Medical Center(德克萨斯西南医学中心) Eigen AI

专题命中 视觉推理 :vision-language model(abstract);visual reasoning(abstract);grounding(abstract);分类 cs.CV、cs.AI

AI总结 本文提出VISTA-Gym,通过多轮轨迹采样和端到端强化学习,提升视觉语言模型的工具集成推理能力,在多个基准测试中取得显著优势。

Comments 17 pages, 9 figures, work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.00844 2025-11-18 cs.CV cs.LG 79%

PRISM-0: A Predicate-Rich Scene Graph Generation Framework for Zero-Shot Open-Vocabulary Tasks

Abdelrahman Elskhawy, Mengze Li, Nassir Navab, Benjamin Busam

专题命中 视觉推理 :vision-language model(abstract);VLM(abstract);visual question answering(abstract);分类 cs.CV、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21538 2025-11-14 cs.CV cs.AI 79%

Caption This, Reason That: VLMs Caught in the Middle

Zihan Weng, Lucas Gomez, Taylor Whittington Webb, Pouya Bashivan

机构 * Integrated Program in Neuroscience (IPN) McGill University(神经科学联合计划 麦吉尔大学) Mila, University of Montreal(蒙特利尔大学Mila) Microsoft Research USA(微软研究院美国总部) Department of Physiology McGill University(生理学系 麦吉尔大学)

专题命中 视觉推理 :vision-language model(abstract);VLM(abstract);visual reasoning(abstract);分类 cs.CV、cs.AI

Comments Paper accepted by nips 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15966 2025-10-27 cs.CV cs.AI cs.CL 79%

Pixel Reasoner: Incentivizing Pixel-Space Reasoning with Curiosity-Driven Reinforcement Learning

Haozhe Wang, Alex Su, Weiming Ren, Fangzhen Lin, Wenhu Chen

机构 * University of Waterloo(多伦多大学) Hong Kong University of Science and Technology(香港科技大学) University of Science and Technology of China(中国科学技术大学) Vector Institute(向量研究所)

专题命中 视觉推理 :vision-language model(abstract);VLM(abstract);visual reasoning(abstract);分类 cs.CV、cs.AI

Comments Project Page: https://tiger-ai-lab.github.io/Pixel-Reasoner/, Hands-on Demo: https://huggingface.co/spaces/TIGER-Lab/Pixel-Reasoner

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05258 2025-10-16 cs.CV cs.LG 79%

Spatio-Temporal LLM: Reasoning about Environments and Actions

Haozhen Zheng, Beitong Tian, Mingyuan Wu, Zhenggang Tang, Klara Nahrstedt, Alex Schwing

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 视觉推理 :grounding(abstract);multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.LG

Comments Code and data are available at https://zoezheng126.github.io/STLLM-website/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23250 2025-10-08 cs.AI cs.CV 79%

Training Vision-Language Process Reward Models for Test-Time Scaling in Multimodal Reasoning: Key Insights and Lessons Learned

Brandon Ong, Tej Deep Pala, Vernon Toh, William Chandra Tjhi, Soujanya Poria

机构 * AI Singapore(AI新加坡) Nanyang Technological University(南洋理工大学)

专题命中 视觉推理 :vision language model(abstract);VLM(abstract);grounding(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25757 2025-10-01 cs.AI cs.CL cs.CV cs.SC 79%

NePTune: A Neuro-Pythonic Framework for Tunable Compositional Reasoning on Vision-Language

Danial Kamali, Parisa Kordjamshidi

机构 * Michigan State University(密歇根州立大学)

专题命中 视觉推理 :vision-language model(abstract);VLM(abstract);visual reasoning(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.00711 2025-09-03 cs.CV cs.AI 79%

VIKSER: Visual Knowledge-Driven Self-Reinforcing Reasoning Framework

Chao Wang, Chunbai Zhang, Yongxiao Tian, Yang Zhou, Yan Peng

机构 * School of Future Technology, Shanghai University(未来技术学院,上海大学) School of Mechatronic Engineering and Automation, Shanghai University(机械电子工程与自动化学院,上海大学)

专题命中 视觉推理 :vision-language model(abstract);VLM(abstract);visual reasoning(abstract);分类 cs.CV、cs.AI

Comments 14 pages,17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12109 2025-08-19 cs.CV cs.AI 79%

Simple o3: Towards Interleaved Vision-Language Reasoning

Ye Wang, Qianglong Chen, Zejun Li, Siyuan Wang, Shijie Guo, Zhirui Zhang, Zhongyu Wei

机构 * Independent Researcher(独立研究者)

专题命中 视觉推理 :visual reasoning(abstract);grounding(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04280 2025-06-06 cs.CV cs.AI 79%

Evaluating MLLMs with Multimodal Multi-image Reasoning Benchmark

Ziming Cheng, Binrui Xu, Lisheng Gong, Zuhe Song, Tianshuo Zhou, Shiqi Zhong, Siyu Ren, Mingxiang Chen, Xiangchao Meng, Yuxin Zhang, Yanlin Li, Lei Ren, Wei Chen, Zhiyuan Huang, Mingjie Zhan, Xiaojie Wang, Fangxiang Feng

机构 * BUPT China(北京邮电大学) YSU China(云南大学) NUS Singapore(新加坡国立大学) Li Auto Inc. China(利汽车公司) SenseTime Research China(商汤研究)

专题命中 视觉推理 :visual reasoning(abstract);multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.AI

Comments 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.00569 2025-04-15 cs.CV cs.LG 79%

Probing Visual Language Priors in VLMs

Tiange Luo, Ang Cao, Gunhee Lee, Justin Johnson, Honglak Lee

专题命中 视觉推理 :vision-language model(abstract);LLaVA(abstract);visual reasoning(abstract);分类 cs.CV、cs.LG

Comments Project Page: https://vilp-team.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.01324 2025-04-03 cs.CV cs.AI cs.CL 79%

On Data Synthesis and Post-training for Visual Abstract Reasoning

Ke Zhu, Yu Wang, Jiangjiang Liu, Qunyi Xie, Shanshan Liu, Gang Zhang

专题命中 视觉推理 :vision-language model(abstract);LLaVA(abstract);visual reasoning(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.15392 2025-02-24 cs.AI cs.CL cs.CV 79%

Chitrarth: Bridging Vision and Language for a Billion People

Shaharukh Khan, Ayush Tarun, Abhinav Ravi, Ali Faraz, Akshat Patidar, Praveen Kumar Pokala, Anagha Bhangare, Raja Kolla, Chandra Khatri, Shubham Agarwal

专题命中 视觉推理 :vision-language model(abstract);VLM(abstract);visual reasoning(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.04155 2025-01-09 cs.CV cs.CL cs.LG 79%

MM-GEN: Enhancing Task Performance Through Targeted Multimodal Data Curation

Siddharth Joshi, Besmira Nushi, Vidhisha Balachandran, Varun Chandrasekaran, Vibhav Vineet, Neel Joshi, Baharan Mirzasoleiman

专题命中 视觉推理 :vision-language model(abstract);VLM(abstract);LLaVA(abstract);分类 cs.CV、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.03230 2025-01-08 cs.AI cs.CV 79%

Video-of-Thought: Step-by-Step Video Reasoning from Perception to Cognition

Hao Fei, Shengqiong Wu, Wei Ji, Hanwang Zhang, Meishan Zhang, Mong-Li Lee, Wynne Hsu

专题命中 视觉推理 :grounding(abstract);multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.AI

Comments Accepted by ICML 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.06579 2024-10-18 cs.CL cs.AI cs.CV 79%

From Redundancy to Relevance: Information Flow in LVLMs Across Reasoning Tasks

Xiaofeng Zhang, Yihao Quan, Chen Shen, Xiaosong Yuan, Shaotian Yan, Liang Xie, Wenxiao Wang, Chaochen Gu, Hao Tang, Jieping Ye

专题命中 视觉推理 :vision language model(abstract);LLaVA(abstract);visual question answering(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.04102 2024-10-03 cs.CV cs.AI 79%

ArtVLM: Attribute Recognition Through Vision-Based Prefix Language Modeling

William Yicheng Zhu, Keren Ye, Junjie Ke, Jiahui Yu, Leonidas Guibas, Peyman Milanfar, Feng Yang

专题命中 视觉推理 :vision-language model(abstract);VLM(abstract);visual reasoning(abstract);分类 cs.CV、cs.AI

Comments Accepted at ECCV 2024. Contact: zhuwilliam[at]google[dot]com. GitHub: https://github.com/google-research/google-research/tree/master/attribute_with_prefixlm

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.08025 2024-02-23 cs.AI cs.CL cs.LG 79%

Self-Imagine: Effective Unimodal Reasoning with Multimodal Models using Self-Imagination

Syeda Nahida Akter, Aman Madaan, Sangwu Lee, Yiming Yang, Eric Nyberg

专题命中 视觉推理 :vision-language model(abstract);VLM(abstract);LLaVA(abstract);分类 cs.AI、cs.LG

Comments 18 pages, 9 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.05332 2023-11-29 cs.CV cs.AI cs.CL cs.RO 79%

On the Road with GPT-4V(ision): Early Explorations of Visual-Language Model on Autonomous Driving

Licheng Wen, Xuemeng Yang, Daocheng Fu, Xiaofeng Wang, Pinlong Cai, Xin Li, Tao Ma, Yingxuan Li, Linran Xu, Dengke Shang, Zheng Zhu, Shaoyan Sun, Yeqi Bai, Xinyu Cai, Min Dou, Shuanglu Hu, Botian Shi, Yu Qiao

专题命中 视觉推理 :VLM(abstract);visual language model(abstract);grounding(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16595 2026-07-21 q-bio.OT 新提交 78%

Orientation Reading by Production Vision-Language Models on Optotype Charts: A Controlled Multi-Model Evaluation Across Reasoning Modes, Prompts, and Access Modalities

通过生产视觉语言模型在视标图表上进行方向读取:跨推理模式、提示和访问方式的受控多模型评估

Shahryar Wasif, Avneek Sandhu, Bin Hu

专题命中 视觉推理 :vision-language model(title,abstract)

AI总结 研究通过消费者聊天界面评估四个视觉语言模型在视标图表上读取方向的能力,在多种推理模式、提示变体下运行,发现各模型准确率有差异,错误有特定方向,单一准确率掩盖问题,强调应多轴评估视觉语言模型。

Comments 4 figures, 4 supplementary figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07530 2026-07-21 cs.RO 版本更新 78%

ICLR: In-Context Imitation Learning with Visual Reasoning

ICLR: 基于视觉推理的上下文模仿学习

Toan Nguyen, Weiduo Yuan, Songlin Wei, Hui Li, Daniel Seita, Yue Wang

机构 * University of Southern California(南加州大学) Autodesk Research(Autodesk研究)

专题命中 视觉推理 :visual reasoning(title,abstract)

AI总结 ICLR通过结合视觉推理与上下文模仿学习,提升机器人在复杂任务中的适应性和泛化能力。

Comments Accepted to IROS 2026. Project website: https://toannguyen1904.github.io/ICLR

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09061 2026-07-13 cs.CV cs.AI cs.LG 新提交 78%

On Locality and Length Generalization in Visual Reasoning

关于视觉推理中的局部性和长度泛化

Pulkit Madan, Sanjay Haresh, Reza Ebrahimi, Sunny Panchal, Apratim Bhattacharyya, Roland Memisevic

机构 * Qualcomm AI Research(高通人工智能研究中心)

专题命中 视觉推理 :visual reasoning(title);分类 cs.CV、cs.AI、cs.LG

AI总结 研究从视觉状态跟踪和长度泛化角度,探讨局部、顺序视觉模型是否有计算优势。受语言模型启发,研究简单视觉任务中视觉模型行为。发现其会利用全局捷径,基于严格局部感知的策略可缓解此问题,表明局部注意力对稳健组合泛化很关键。

Comments Accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00260 2026-07-03 eess.AS 新提交 78%

Do Multimodal Large Language Models Need Reasoning to Classify Dementia from Speech?

多模态大语言模型是否需要推理来从语音中分类痴呆症?

Liming Wang, Neguine Rezaii, Bradford C. Dickerson, James Glass

专题命中 视觉推理 :multimodal large language model(title,abstract)

AI总结 本文评估了多模态大语言模型在自动痴呆症分类中的推理能力,发现基于文本理由的策略会导致幻觉和不一致,并提出DeTAiL框架,通过非线性适配器和强化学习利用内部表示,在两个数据集上优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏