arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 4447 信号源:cs.CV, cs.AI, cs.LG

1. 视觉推理 4447 篇

2512.23169 2026-02-24 cs.CV 85%

REVEALER: Reinforcement-Guided Visual Reasoning for Element-Level Text-Image Alignment Evaluation

REVEALER: 基于强化引导的视觉推理的元素级文本-图像对齐评估

Fulin Shi, Wenyi Xiao, Bin Chen, Liang Din, Leilei Gan

机构 * Zhejiang University(浙江大学) Alibaba Group(阿里巴巴集团)

专题命中 视觉推理 :visual reasoning(title,abstract);grounding(abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 REVEALER通过强化引导的视觉推理实现元素级文本-图像对齐评估,提升模型对齐判断的可解释性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18356 2026-01-27 cs.LG 85%

Making medical vision-language models think causally across modalities with retrieval-augmented cross-modal reasoning

通过检索增强的跨模态推理使医疗视觉-语言模型在多模态中实现因果推理

Weiqin Yang, Haowen Xue, Qingyi Peng, Hexuan Hu, Qian Huang, Tingbo Zhang

机构 * University of Adelaide(阿德莱德大学) Hohai University(河海大学) Amap

专题命中 视觉推理 :vision-language model(title,abstract);visual question answering(abstract);grounding(abstract);分类 cs.LG

AI总结 本文提出多模态因果检索增强生成框架,通过整合因果推理原理与多模态检索,提升医疗VLMs在诊断预测和视觉问答中的事实准确性与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09954 2026-01-26 cs.CV 85%

The Spatial Blindspot of Vision-Language Models

视觉-语言模型的空间盲区

Nahid Alam, Leema Krishna Murali, Siddhant Bharadwaj, Patrick Liu, Timothy Chung, Drishti Sharma, Akshata A, Kranthi Kiran, Wesley Tam, Bala Krishna S Vegesna

专题命中 视觉推理 :vision-language model(title,abstract);VLM(abstract);grounding(abstract);分类 cs.CV

AI总结 本文提出通过改进图像编码器和2D位置编码来提升视觉-语言模型的空间推理能力,以解决其在空间关系捕捉上的不足。

Comments Work done as part of the EleutherAI SOAR Program

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25142 2026-01-21 cs.AI 85%

Visual serial processing deficits explain divergences in human and VLM reasoning

视觉序列处理缺陷解释了人类与VLM推理之间的差异

Nicholas Budny, Kia Ghods, Declan Campbell, Raja Marjieh, Amogh Joshi, Sreejan Kumar, Jonathan D. Cohen, Taylor W. Webb, Thomas L. Griffiths

机构 * Princeton Neuroscience Institute(普林斯顿神经科学研究所) Department of Psychology, Princeton University(普林斯顿大学心理学系) Department of Psychology, Université de Montréal(蒙特利尔大学心理学系) Mila - Quebec AI Institute(魁北克AI研究所) Department of Computer Science, Princeton University(普林斯顿大学计算机科学系)

专题命中 视觉推理 :VLM(title,abstract);vision language model(abstract);visual reasoning(abstract);分类 cs.AI

AI总结 研究发现视觉语言模型在视觉序列处理能力上存在缺陷,导致其在不同领域中的推理表现与人类存在显著差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21194 2025-12-25 cs.CV 85%

VisRes Bench: On Evaluating the Visual Reasoning Capabilities of VLMs

VisRes Bench: 关于评估视觉语言模型的视觉推理能力

Brigitta Malagurski Törtei, Yasser Dahou, Ngoc Dung Huynh, Wamiq Reyaz Para, Phúc H. Lê Khac, Ankit Singh, Sofian Chaybouti, Sanath Narayan

机构 * Technology Innovation Institute, Abu Dhabi, UAE(阿布扎比技术创新研究所) Tuebingen AI Center/University of Tuebingen(图宾根人工智能中心/图宾根大学)

专题命中 视觉推理 :visual reasoning(title,abstract);vision-language model(abstract);visual question answering(abstract);分类 cs.CV

AI总结 VisRes Bench通过三个层次评估VLMs的视觉推理能力,揭示其在复杂任务中的局限性,并为多模态研究提供统一框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15701 2025-12-18 cs.CV 85%

VLIC: Vision-Language Models As Perceptual Judges for Human-Aligned Image Compression

VLIC: 基于视觉-语言模型的人类对齐图像压缩感知判官

Kyle Sargent, Ruiqi Gao, Philipp Henzler, Charles Herrmann, Aleksander Holynski, Li Fei-Fei, Jiajun Wu, Jason Zhang

机构 * Stanford University(斯坦福大学) Google Research(谷歌研究) Google DeepMind(谷歌DeepMind)

专题命中 视觉推理 :vision-language model(title,abstract);VLM(abstract);visual reasoning(abstract);分类 cs.CV

AI总结 VLIC利用视觉-语言模型进行图像压缩,通过零样本推理实现人类感知对齐,提升压缩性能。

Comments 14 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05524 2025-12-09 cs.CV 85%

VOST-SGG: VLM-Aided One-Stage Spatio-Temporal Scene Graph Generation

VOST-SGG:基于视觉语言模型的一阶段时空场景图生成

Chinthani Sugandhika, Chen Li, Deepu Rajan, Basura Fernando

机构 * College of Computing and Data Science, Nanyang Technological University, Singapore(南洋理工大学计算与数据科学学院) Institute of High-Performance Computing, Agency for Science, Technology and Research, Singapore(科学、技术与研究局高性能计算研究所) Centre for Frontier AI Research, Agency for Science, Technology and Research, Singapore(科学、技术与研究局前沿人工智能研究中心)

专题命中 视觉推理 :VLM(title,abstract);vision-language model(abstract);visual question answering(abstract);分类 cs.CV

AI总结 VOST-SGG通过整合视觉语言模型的常识推理能力,提出了一种基于多模态特征和双源查询初始化的一阶段时空场景图生成方法,实现了对视频中对象及其关系的高效建模。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19552 2025-12-08 cs.CV 85%

iFinder: Structured Zero-Shot Vision-Based LLM Grounding for Dash-Cam Video Reasoning

iFinder: 结构化零样本视觉基于LLM的地面定位用于行车记录仪视频推理

Manyi Yao, Bingbing Zhuang, Sparsh Garg, Amit Roy-Chowdhury, Christian Shelton, Manmohan Chandraker, Abhishek Aich

机构 * NEC Laboratories, America(NEC美国实验室) University of California, Riverside(加州大学河滨分校) University of California, San Diego(加州大学圣地亚哥分校)

专题命中 视觉推理 :grounding(title,abstract);vision-language model(abstract);VLM(abstract);分类 cs.CV

AI总结 iFinder通过结构化语义接地框架,利用行车记录仪视频中的关键线索提升LLM在驾驶视频推理中的性能。

Comments Accepted at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12365 2025-11-18 cs.CV 85%

Constructing and Interpreting Digital Twin Representations for Visual Reasoning via Reinforcement Learning

Yiqing Shen, Mathias Unberath

机构 * Department of Computer Science, Johns Hopkins University(计算机科学系,约翰霍普金斯大学)

专题命中 视觉推理 :visual reasoning(title,abstract);visual question answering(abstract);grounding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10279 2025-11-14 cs.CV 85%

PROPA: Toward Process-level Optimization in Visual Reasoning via Reinforcement Learning

Yanbei Jiang, Chao Lei, Yihao Ding, Krista Ehinger, Jey Han Lau

机构 * University of Melbourne(墨尔本大学)

专题命中 视觉推理 :visual reasoning(title,abstract);vision-language model(abstract);VLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10017 2025-11-14 cs.CV 85%

AffordBot: 3D Fine-grained Embodied Reasoning via Multimodal Large Language Models

Xinyi Wang, Xun Yang, Yanlong Xu, Yuchen Wu, Zhen Li, Na Zhao

机构 * University of Science and Technology of China(科学技术大学) Singapore University of Technology and Design(新加坡科技设计大学) Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

专题命中 视觉推理 :multimodal large language model(title,abstract);grounding(abstract);MLLM(abstract);分类 cs.CV

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14677 2025-10-28 cs.CV 85%

Visionary-R1: Mitigating Shortcuts in Visual Reasoning with Reinforcement Learning

Jiaer Xia, Yuhang Zang, Peng Gao, Sharon Li, Kaiyang Zhou

机构 * Hong Kong Baptist University(香港 Baptist 大学) Shanghai AI Lab(上海人工智能实验室) University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

专题命中 视觉推理 :visual reasoning(title,abstract);VLM(abstract);visual language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20696 2025-10-24 cs.CV 85%

Diagnosing Visual Reasoning: Challenges, Insights, and a Path Forward

Jing Bi, Guangyu Sun, Ali Vosoughi, Chen Chen, Chenliang Xu

机构 * University of Rochester(罗切斯特大学) University of Central Florida(中央佛罗里达大学)

专题命中 视觉推理 :visual reasoning(title,abstract);vision-language model(abstract);multimodal large language model(abstract);分类 cs.CV

Comments 5 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.17092 2025-10-20 cs.CV cs.CL 85%

Shakti-VLMs: Scalable Vision-Language Models for Enterprise AI

Syed Abdul Gaffar Shakhadri, Kruthika KR, Kartik Basavaraj Angadi

机构 * SandLogic Technologies Pvt Ltd(沙德逻辑技术 Pvt Ltd)

专题命中 视觉推理 :vision-language model(title,abstract);VLM(abstract);visual reasoning(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24251 2025-10-07 cs.CV cs.CL 85%

Latent Visual Reasoning

Bangzheng Li, Ximeng Sun, Jiang Liu, Ze Wang, Jialian Wu, Xiaodong Yu, Hao Chen, Emad Barsoum, Muhao Chen, Zicheng Liu

机构 * University of California, Davis(加州大学戴维斯分校) Advanced Micro Devices, Inc.(先进微器件公司)

专题命中 视觉推理 :visual reasoning(title,abstract);visual question answering(abstract);multimodal large language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25916 2025-10-01 cs.CV cs.CL 85%

VLM-FO1: Bridging the Gap Between High-Level Reasoning and Fine-Grained Perception in VLMs

Peng Liu, Haozhan Shen, Chunxin Fang, Zhicheng Sun, Jiajia Liao, Tiancheng Zhao

机构 * Om AI Research(Om AI研究机构) Binjiang Institute of Zhejiang University(浙江大学滨江研究院) College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院)

专题命中 视觉推理 :VLM(title,abstract);vision-language model(abstract);grounding(abstract);分类 cs.CV

Comments 22 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11433 2025-08-27 cs.CV 85%

MM-R1: Unleashing the Power of Unified Multimodal Large Language Models for Personalized Image Generation

Qian Liang, Yujia Wu, Kuncheng Li, Jiwei Wei, Shiyuan He, Jinyu Guo, Ning Xie

专题命中 视觉推理 :multimodal large language model(title,abstract);visual reasoning(abstract);grounding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18227 2025-08-26 cs.CV 85%

GM-Skip: Metric-Guided Transformer Block Skipping for Efficient Vision-Language Models

Lianming Huang, Haibo Hu, Qiao Li, Xin He, Nan Guan, Chun Jason Xue

机构 * City University of Hong Kong(香港城市大学) MBZUAI A*STAR

专题命中 视觉推理 :vision-language model(title,abstract);VLM(abstract);visual reasoning(abstract);分类 cs.CV

Comments 7 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.23009 2025-08-15 cs.CV 85%

MusiXQA: Advancing Visual Music Understanding in Multimodal Large Language Models

Jian Chen, Wenye Ma, Penghang Liu, Wei Wang, Tengwei Song, Ming Li, Chenguang Wang, Jiayu Qin, Ruiyi Zhang, Changyou Chen

专题命中 视觉推理 :multimodal large language model(title,abstract);visual reasoning(abstract);MLLM(abstract);分类 cs.CV

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21230 2025-07-03 cs.AI cs.RO 85%

World-aware Planning Narratives Enhance Large Vision-Language Model Planner

Junhao Shi, Zhaoye Fei, Siyin Wang, Qipeng Guo, Jingjing Gong, Xipeng Qiu

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 视觉推理 :vision-language model(title,abstract);visual reasoning(abstract);grounding(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.23481 2025-07-01 cs.CV eess.IV 85%

Evaluation of Geolocation Capabilities of Multimodal Large Language Models and Analysis of Associated Privacy Risks

Xian Zhang, Xiang Cheng

机构 * State Key Laboratory of Information Engineering in Surveying, Mapping and Remote Sensing(信息工程测绘遥感国家重点实验室)

专题命中 视觉推理 :multimodal large language model(title,abstract);visual reasoning(abstract);MLLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.07934 2025-06-02 cs.CV 85%

SoTA with Less: MCTS-Guided Sample Selection for Data-Efficient Visual Reasoning Self-Improvement

Xiyao Wang, Zhengyuan Yang, Chao Feng, Hongjin Lu, Linjie Li, Chung-Ching Lin, Kevin Lin, Furong Huang, Lijuan Wang

机构 * University of Maryland College Park(马里兰大学学院公园分校) Microsoft(微软) University of Michigan(密歇根大学)

专题命中 视觉推理 :visual reasoning(title,abstract);vision-language model(abstract);VLM(abstract);分类 cs.CV

Comments 27 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.10854 2025-04-16 cs.CV 85%

LVLM_CSP: Accelerating Large Vision Language Models via Clustering, Scattering, and Pruning for Reasoning Segmentation

Hanning Chen, Yang Ni, Wenjun Huang, Hyunwoo Oh, Yezi Liu, Tamoghno Das, Mohsen Imani

专题命中 视觉推理 :vision language model(title,abstract);visual reasoning(abstract);visual question answering(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.08687 2025-03-27 cs.CV 85%

VisionArena: 230K Real World User-VLM Conversations with Preference Labels

Christopher Chou, Lisa Dunlap, Koki Mashita, Krishna Mandal, Trevor Darrell, Ion Stoica, Joseph E. Gonzalez, Wei-Lin Chiang

专题命中 视觉推理 :VLM(title,abstract);vision-language model(abstract);LLaVA(abstract);分类 cs.CV

Comments updated for CVPR Camera Ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.08481 2025-03-14 cs.RO cs.CV 85%

PhysVLM: Enabling Visual Language Models to Understand Robotic Physical Reachability

Weijie Zhou, Manli Tao, Chaoyang Zhao, Haiyun Guo, Honghui Dong, Ming Tang, Jinqiao Wang

专题命中 视觉推理 :visual language model(title);vision-language model(abstract);VLM(abstract);visual reasoning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.06322 2024-12-10 cs.CV 85%

LLaVA-SpaceSGG: Visual Instruct Tuning for Open-vocabulary Scene Graph Generation with Enhanced Spatial Relations

Mingjie Xu, Mengyang Wu, Yuzhi Zhao, Jason Chun Lok Li, Weifeng Ou

专题命中 视觉推理 :LLaVA(title,abstract);multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

Comments Accepted by the WACV 2025, including supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.17851 2024-06-18 cs.CV 85%

Leveraging VLM-Based Pipelines to Annotate 3D Objects

Rishabh Kabra, Loic Matthey, Alexander Lerchner, Niloy J. Mitra

专题命中 视觉推理 :VLM(title,abstract);vision language model(abstract);visual reasoning(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.14233 2023-12-25 cs.CV 85%

VCoder: Versatile Vision Encoders for Multimodal Large Language Models

Jitesh Jain, Jianwei Yang, Humphrey Shi

专题命中 视觉推理 :multimodal large language model(title,abstract);visual reasoning(abstract);MLLM(abstract);分类 cs.CV

Comments Project Page: https://praeclarumjj3.github.io/vcoder/

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.15166 2023-10-24 cs.CV cs.CL 85%

Large Language Models are Visual Reasoning Coordinators

Liangyu Chen, Bo Li, Sheng Shen, Jingkang Yang, Chunyuan Li, Kurt Keutzer, Trevor Darrell, Ziwei Liu

专题命中 视觉推理 :visual reasoning(title,abstract);vision-language model(abstract);visual question answering(abstract);分类 cs.CV

Comments Accepted at NeurIPS 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.02937 2026-08-12 cs.LG cs.AI cs.CE 版本更新 85%

Proteo-R1: Reasoning Foundation Models for De Novo Protein Design

Proteo-R1:用于从头蛋白质设计的推理基础模型

Fang Wu, Weihao Xuan, Heli Qi, Hanqun Cao, Heng-Jui Chang, Zeqi Zhou, Haokai Zhao, Ma Jian, Carl Ma, Yu-Chi Cheng, Kuan Pang, Xiangru Tang, Zehong Wang, Guanlue Li, Hanchen Wang, Kejun Ying, Pan Lu, Chiho Im, Seungju Han, Peng Xia, Tinson Xu, Yinxi Li, Deyao Zhu, Pheng-Ann Heng, Naoto Yokoya, Masashi Sugiyama, Li Erran Li, Jure Leskovec, Yejin Choi

专题命中 视觉推理 :MLLM(summary_cn,abstract);multimodal large language model(abstract);分类 cs.AI、cs.LG

AI总结 针对现有从头蛋白质设计模型缺乏推理能力的问题,本文提出 Proteo-R1 双专家架构框架,通过 MLLM 识别关键功能残基作为硬约束,结合扩散模型实现稳定可解释的蛋白质设计。

Journal ref ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏