arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 26117 信号源:cs.CV, cs.AI, cs.LG

1. 视觉推理 4478 篇

2509.25916 2025-10-01 cs.CV cs.CL 85%

VLM-FO1: Bridging the Gap Between High-Level Reasoning and Fine-Grained Perception in VLMs

Peng Liu, Haozhan Shen, Chunxin Fang, Zhicheng Sun, Jiajia Liao, Tiancheng Zhao

机构 * Om AI Research(Om AI研究机构) Binjiang Institute of Zhejiang University(浙江大学滨江研究院) College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院)

专题命中 视觉推理 :VLM(title,abstract);vision-language model(abstract);grounding(abstract);分类 cs.CV

Comments 22 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11433 2025-08-27 cs.CV 85%

MM-R1: Unleashing the Power of Unified Multimodal Large Language Models for Personalized Image Generation

Qian Liang, Yujia Wu, Kuncheng Li, Jiwei Wei, Shiyuan He, Jinyu Guo, Ning Xie

专题命中 视觉推理 :multimodal large language model(title,abstract);visual reasoning(abstract);grounding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18227 2025-08-26 cs.CV 85%

GM-Skip: Metric-Guided Transformer Block Skipping for Efficient Vision-Language Models

Lianming Huang, Haibo Hu, Qiao Li, Xin He, Nan Guan, Chun Jason Xue

机构 * City University of Hong Kong(香港城市大学) MBZUAI A*STAR

专题命中 视觉推理 :vision-language model(title,abstract);VLM(abstract);visual reasoning(abstract);分类 cs.CV

Comments 7 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.23009 2025-08-15 cs.CV 85%

MusiXQA: Advancing Visual Music Understanding in Multimodal Large Language Models

Jian Chen, Wenye Ma, Penghang Liu, Wei Wang, Tengwei Song, Ming Li, Chenguang Wang, Jiayu Qin, Ruiyi Zhang, Changyou Chen

专题命中 视觉推理 :multimodal large language model(title,abstract);visual reasoning(abstract);MLLM(abstract);分类 cs.CV

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21230 2025-07-03 cs.AI cs.RO 85%

World-aware Planning Narratives Enhance Large Vision-Language Model Planner

Junhao Shi, Zhaoye Fei, Siyin Wang, Qipeng Guo, Jingjing Gong, Xipeng Qiu

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 视觉推理 :vision-language model(title,abstract);visual reasoning(abstract);grounding(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.23481 2025-07-01 cs.CV eess.IV 85%

Evaluation of Geolocation Capabilities of Multimodal Large Language Models and Analysis of Associated Privacy Risks

Xian Zhang, Xiang Cheng

机构 * State Key Laboratory of Information Engineering in Surveying, Mapping and Remote Sensing(信息工程测绘遥感国家重点实验室)

专题命中 视觉推理 :multimodal large language model(title,abstract);visual reasoning(abstract);MLLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.07934 2025-06-02 cs.CV 85%

SoTA with Less: MCTS-Guided Sample Selection for Data-Efficient Visual Reasoning Self-Improvement

Xiyao Wang, Zhengyuan Yang, Chao Feng, Hongjin Lu, Linjie Li, Chung-Ching Lin, Kevin Lin, Furong Huang, Lijuan Wang

机构 * University of Maryland College Park(马里兰大学学院公园分校) Microsoft(微软) University of Michigan(密歇根大学)

专题命中 视觉推理 :visual reasoning(title,abstract);vision-language model(abstract);VLM(abstract);分类 cs.CV

Comments 27 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.10854 2025-04-16 cs.CV 85%

LVLM_CSP: Accelerating Large Vision Language Models via Clustering, Scattering, and Pruning for Reasoning Segmentation

Hanning Chen, Yang Ni, Wenjun Huang, Hyunwoo Oh, Yezi Liu, Tamoghno Das, Mohsen Imani

专题命中 视觉推理 :vision language model(title,abstract);visual reasoning(abstract);visual question answering(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.08687 2025-03-27 cs.CV 85%

VisionArena: 230K Real World User-VLM Conversations with Preference Labels

Christopher Chou, Lisa Dunlap, Koki Mashita, Krishna Mandal, Trevor Darrell, Ion Stoica, Joseph E. Gonzalez, Wei-Lin Chiang

专题命中 视觉推理 :VLM(title,abstract);vision-language model(abstract);LLaVA(abstract);分类 cs.CV

Comments updated for CVPR Camera Ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.08481 2025-03-14 cs.RO cs.CV 85%

PhysVLM: Enabling Visual Language Models to Understand Robotic Physical Reachability

Weijie Zhou, Manli Tao, Chaoyang Zhao, Haiyun Guo, Honghui Dong, Ming Tang, Jinqiao Wang

专题命中 视觉推理 :visual language model(title);vision-language model(abstract);VLM(abstract);visual reasoning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.06322 2024-12-10 cs.CV 85%

LLaVA-SpaceSGG: Visual Instruct Tuning for Open-vocabulary Scene Graph Generation with Enhanced Spatial Relations

Mingjie Xu, Mengyang Wu, Yuzhi Zhao, Jason Chun Lok Li, Weifeng Ou

专题命中 视觉推理 :LLaVA(title,abstract);multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

Comments Accepted by the WACV 2025, including supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.17851 2024-06-18 cs.CV 85%

Leveraging VLM-Based Pipelines to Annotate 3D Objects

Rishabh Kabra, Loic Matthey, Alexander Lerchner, Niloy J. Mitra

专题命中 视觉推理 :VLM(title,abstract);vision language model(abstract);visual reasoning(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.14233 2023-12-25 cs.CV 85%

VCoder: Versatile Vision Encoders for Multimodal Large Language Models

Jitesh Jain, Jianwei Yang, Humphrey Shi

专题命中 视觉推理 :multimodal large language model(title,abstract);visual reasoning(abstract);MLLM(abstract);分类 cs.CV

Comments Project Page: https://praeclarumjj3.github.io/vcoder/

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.15166 2023-10-24 cs.CV cs.CL 85%

Large Language Models are Visual Reasoning Coordinators

Liangyu Chen, Bo Li, Sheng Shen, Jingkang Yang, Chunyuan Li, Kurt Keutzer, Trevor Darrell, Ziwei Liu

专题命中 视觉推理 :visual reasoning(title,abstract);vision-language model(abstract);visual question answering(abstract);分类 cs.CV

Comments Accepted at NeurIPS 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.02937 2026-08-12 cs.LG cs.AI cs.CE 版本更新 85%

Proteo-R1: Reasoning Foundation Models for De Novo Protein Design

Proteo-R1:用于从头蛋白质设计的推理基础模型

Fang Wu, Weihao Xuan, Heli Qi, Hanqun Cao, Heng-Jui Chang, Zeqi Zhou, Haokai Zhao, Ma Jian, Carl Ma, Yu-Chi Cheng, Kuan Pang, Xiangru Tang, Zehong Wang, Guanlue Li, Hanchen Wang, Kejun Ying, Pan Lu, Chiho Im, Seungju Han, Peng Xia, Tinson Xu, Yinxi Li, Deyao Zhu, Pheng-Ann Heng, Naoto Yokoya, Masashi Sugiyama, Li Erran Li, Jure Leskovec, Yejin Choi

专题命中 视觉推理 :MLLM(summary_cn,abstract);multimodal large language model(abstract);分类 cs.AI、cs.LG

AI总结 针对现有从头蛋白质设计模型缺乏推理能力的问题,本文提出 Proteo-R1 双专家架构框架,通过 MLLM 识别关键功能残基作为硬约束,结合扩散模型实现稳定可解释的蛋白质设计。

Journal ref ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18121 2026-08-11 cs.CV cs.AI 版本更新 85%

VCU-Bridge: Hierarchical Visual Connotation Understanding via Semantic Bridging

VCU-Bridge: 通过语义桥梁实现层次化视觉隐喻理解

Ming Zhong, Yuanlei Wang, Liuzhou Zhang, Ruichuan An, Renrui Zhang, Hao Liang, Ming Lu, Ying Shen, Wentao Zhang

机构 * Zhejiang University(浙江大学) Peking University(北京大学) Sun Yat-sen University(中山大学) CUHK(香港中文大学)

专题命中 视觉推理 :MLLM(summary_cn,abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 VCU-Bridge通过语义桥梁实现层次化视觉隐喻理解,构建了HVCU-Bench基准,并展示了提升MLLM能力的显著效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05729 2026-08-07 cs.AI cs.CL cs.CV cs.HC 新提交 85%

Unified Agent: Managing Interactions across Devices

统一智能体:管理跨设备交互

Xinshuang Liu, Runfa Blark Li, Shaoxiu Wei, Xin Lin, Truong Nguyen

机构 * University of California, San Diego(加利福尼亚大学圣迭戈分校)

专题命中 视觉推理 :MLLM(summary_cn,abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 本文针对现有智能体跨设备交互场景的不足,提出带紧凑状态设计的统一智能体,构建对应基准数据集,其性能显著优于多种现有设计,且在不同MLLM设置下表现鲁棒。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14099 2026-07-17 cs.CL cs.AI cs.CV 新提交 85%

Just Keep Prompting: Evaluating Repetitive Socratic Prompting in VLMs

只需持续提示:评估视觉语言模型中的重复苏格拉底式提示

Shayda Moezzi, Bishoy Galoaa, Lorena Genua, Taskin Padir, Sarah Ostadabbas

机构 * Northeastern University(东北大学)

专题命中 视觉推理 :VLM(abstract,abstract_cn);vision-language model(abstract);visual reasoning(abstract);grounding(abstract)

AI总结 研究视觉语言模型在反复提示下的稳定性,引入JKP多轮评估框架,用三种策略对模型提问,在STAR基准子集上评估GPT-4o、Gemini 2.5 Pro和Qwen3-VL-30B,发现重复提示利弊兼具且因模型而异,揭示了模型压力反应概况。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13673 2026-06-12 cs.CV cs.AI 新提交 85%

SpatialClaw: Rethinking Action Interface for Agentic Spatial Reasoning

SpatialClaw:重新思考智能体空间推理的动作接口

Seokju Cho, Ryo Hachiuma, Abhishek Badki, Hang Su, Byung-Kwan Lee, Chan Hee Song, Sifei Liu, Subhashree Radhakrishnan, Seungryong Kim, Yu-Chiang Frank Wang, Min-Hung Chen

机构 * KAIST(韩国科学技术院) NVIDIA(英伟达)

专题命中 视觉推理 :VLM(summary_cn,abstract);vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 提出SpatialClaw框架,以代码作为动作接口,通过状态化Python内核和感知几何原语,使VLM智能体逐步执行并灵活组合中间结果,在20个3D/4D空间推理基准上平均准确率59.9%,比现有方法高11.2个百分点。

Comments Project page: https://spatialclaw.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07433 2026-06-08 cs.CV cs.AI cs.MM 新提交 85%

Watch, Remember, Reason: Human-View Video Understanding with MLLMs

Watch, Remember, Reason: 基于多模态大语言模型的人类视角视频理解

Jiahao Meng, Yue Tan, Qi Xu, Kuan Gao, Weisong Liu, Yanwei Li, Jason Li, Lingdong Kong, Haochen Wang, Qianyu Zhou, Jiangning Zhang, Guangliang Cheng, Yunhai Tong, Lu Qi, Minghsuan Yang

机构 * School of Intelligence Science and Technology, Peking University(北京理工大学智能科学与技术学院) Wuhan University(武汉大学) Shanghai Jiao Tong University(上海交通大学) Nanyang Technological University(南洋理工大学) CASIA(中国科学院自动化研究所) University of Tokyo(东京大学) University of Liverpool(利物浦大学) Zhejiang University(浙江大学) National University of Singapore(新加坡国立大学) UC Merced(加州大学默塞德分校)

专题命中 视觉推理 :MLLM(summary_cn,abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 提出人类视角下视频理解的三个功能能力(观看、记忆、推理),构建统一框架分析视频MLLM的感知、记忆、推理和预测,并总结挑战、方法、应用及未来方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23897 2026-05-25 cs.CV cs.AI cs.CL 85%

ETCHR: Editing To Clarify and Harness Reasoning

ETCHR: 通过编辑来澄清和利用推理

Beichen Zhang, Yuhong Liu, Jinsong Li, Yuhang Zang, Jiaqi Wang, Dahua Lin

机构 * The Chinese University of Hong Kong Shanghai AI Laboratory(香港中文大学上海人工智能实验室) Shanghai AI Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 视觉推理 :VLM(abstract,abstract_cn);visual reasoning(abstract);multimodal large language model(abstract);MLLM(abstract_cn)

AI总结 针对多模态大语言模型在需要细粒度关注或视角变换的问题上纯文本思维链的瓶颈,提出了一种解耦的图像编辑模型ETCHR,通过两阶段训练(推理模仿和推理增强)弥合语言侧和生成侧差距,无需训练即可插入不同MLLM,在五个任务族上平均Pass@1提升4.61-5.47个百分点。

Comments Code, model and data are open-sourced at https://github.com/InternLM/ETCHR

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12953 2026-05-14 cs.CV cs.AI 85%

Seg-Agent: Test-Time Multimodal Reasoning for Training-Free Language-Guided Segmentation

Seg-Agent: 无训练语言引导分割的测试时多模态推理

Chao Hao, Jun Xu, Ji Du, Shuo Ye, Ziyue Qiao, Xiaodong Cun, Guangcong Wang, Xubin Zheng, Zitong Yu

机构 * School of Computing and Information Technology(计算与信息科技学院) Great Bay University(大湾大学) Hangzhou International Innovation Institute(杭州国际创新研究院) Beihang University(北航大学) Department of Computing(计算系) The Hong Kong Polytechnic University(香港理工大学)

专题命中 视觉推理 :MLLM(abstract,abstract_cn);visual reasoning(abstract);grounding(abstract);multimodal large language model(abstract)

AI总结 Seg-Agent提出无训练的多模态推理框架,通过生成-选择-细化三阶段循环实现视觉区域分割,无需参数更新即可达到与训练方法相当的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07817 2026-05-11 cs.CV cs.AI cs.CL 85%

GazeVLM: Active Vision via Internal Attention Control for Multimodal Reasoning

GazeVLM:通过内部注意力控制实现多模态推理的主动视觉

Brown Ebouky, Gabriele Carrino, Niccolo Avogaro, Christoph Studer, Andrea Bartezzaghi, Mattia Rigotti

机构 * IBM Research(IBM研究院) ETH Zurich(苏黎世联邦理工学院) TU Wien(维也纳技术大学)

专题命中 视觉推理 :VLM(abstract,abstract_cn);vision-language model(abstract);visual reasoning(abstract);grounding(abstract)

AI总结 GazeVLM通过内部注意力控制实现主动视觉,使模型在多模态推理中实现从全局空间感知到局部聚焦推理的无缝切换,无需外部工具或增加视觉token。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20755 2026-04-23 cs.AI cs.LG 85%

V-tableR1: Process-Supervised Multimodal Table Reasoning with Critic-Guided Policy Optimization

V-tableR1:基于过程监督的多模态表格推理与批评引导的策略优化

Yubo Jiang, Yitong An, Xin Yang, Abudukelimu Wuerkaixi, Xuxin Cheng, Fengying Xie, Zhiguo Jiang, Cao Liu, Ke Zeng, Haopeng Zhang

机构 * School of Astronautics Beihang University(北航航天学院) Longcat Interaction Team Meituan(美团长猫交互团队) Tianmushan Laboratory Beihang University(北航天门实验室)

专题命中 视觉推理 :VLM(abstract,abstract_cn);visual reasoning(abstract);grounding(abstract);multimodal large language model(abstract)

AI总结 V-tableR1通过过程监督强化学习框架,利用表格的确定性网格结构,提升多模态大语言模型的推理能力,通过批评引导策略优化方法,实现更严谨的逻辑推导,取得开放源代码模型在复杂表格基准上的最佳性能。

Comments 15 pages, 4 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12198 2025-08-19 physics.ao-ph cs.AI cs.LG 85%

Exploring Multimodal AI Reasoning for Meteorological Forecasting from Skew-T Diagrams

ChangJae Lee, Heecheol Yang, Jonghak Choi

专题命中 视觉推理 :vision-language model(abstract);VLM(abstract);visual reasoning(abstract);visual question answering(abstract)

Comments 24 pages, 3 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02564 2026-06-26 cs.CV 版本更新 85%

VLMs are Good Teachers for Video Reasoning via Adaptive Test-Time Optimization

VLMs 是视频推理的好老师:通过自适应测试时优化

Junhao Cheng, Liang Hou, Tianxiong Zhong, Xin Tao, Pengfei Wan, Kun Gai, Jing Liao

机构 * City University of Hong Kong(香港城市大学) Kling Team, Kuaishou Technology(快手科技 Kling 团队)

专题命中 视觉推理 :VLM(summary_cn,abstract);vision-language model(abstract);分类 cs.CV

AI总结 提出将视觉语言模型(VLM)作为“教师”,通过提取任务规则并设计可微分奖励,指导视频生成模型(VGM)在测试时在线优化轻量级 LoRA 模块,从而提升视频推理的泛化能力。

Comments Project Page: https://VLM-as-Teacher.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14026 2026-08-19 cs.CE 版本更新 85%

MMDynOpt-Agent: Dynamic Optimization for Multimodal Large Language Model Reasoning via Reinforcement Learning

MMDynOpt-Agent:基于强化学习的多模态大语言模型推理动态优化方法

Wenjin Liu, Haoran Luo, Fayuan Ke, Zhenghong Lin, Yue Lu, Zhe Cui, Anh Tuan Luu, Carl Yang

专题命中 视觉推理 :multimodal large language model(title,abstract);MLLM(abstract,abstract_cn)

AI总结 该研究针对多模态大语言模型推理效率不足的问题,提出MMDynOpt-Agent,通过强化学习将多模态推理动态优化建模为马尔可夫决策过程,结合多轮优化提示与多维度奖励机制,在15个公开数据集上性能优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14551 2026-07-14 cs.RO 版本更新 85%

Replanning Human-Robot Collaborative Tasks with Vision-Language Models via Semantic and Physical Dual-Correction

通过语义和物理双校正利用视觉语言模型重新规划人机协作任务

Taichi Kato, Takuya Kiyokawa, Namiko Saito, Kensuke Harada

专题命中 视觉推理 :vision-language model(title,abstract);VLM(abstract,abstract_cn)

AI总结 本文提出一种通过语义和物理双校正机制提升人机协作任务中机器人重新规划能力的框架,结合视觉语言模型与物理反馈纠正,提高任务执行的成功率和可行性。

Comments 20 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29579 2026-06-30 cs.CV cs.AI cs.LG cs.MM 85%

ScAle: Attention Head Scaling as a Minimal Adapter for Spatial Reasoning in Vision Language Models

ScAle: 注意力头缩放作为视觉语言模型中空间推理的最小适配器

Rahul Chowdhury, Timothy A Rupprecht, Xuan Shen, Pu Zhao, Yanzhi Wang

机构 * Northeastern University(东北大学) EmbodyX Inc.(EmbodyX公司) Zhejiang University(浙江大学)

专题命中 视觉推理 :vision language model(title,abstract);VLM(abstract_cn);分类 cs.CV、cs.AI、cs.LG

AI总结 提出ScAle,一种超轻量适配方法,通过学习少量标量系数调节冻结骨干网络中的注意力头和MLP激活,仅用1K可训练参数在空间推理任务上实现高达134.1%的相对精度提升。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05531 2026-06-05 cs.CV cs.AI cs.CL cs.LG 85%

Almieyar-Oryx-BloomBench: A Bilingual Multimodal Benchmark for Cognitively Informed Evaluation of Vision-Language Models

Almieyar-Oryx-BloomBench:一个用于视觉语言模型认知知情评估的双语多模态基准

Mohammad Mahdi Abootorabi, Omid Ghahroodi, Anas Madkoor, Marzia Nouri, Doratossadat Dastgheib, Mohamed Hefeeda, Ehsaneddin Asgari

机构 * University of British Columbia(不列颠哥伦比亚大学) Zuse School(Zuse学校) Qatar Computing Research Institute (QCRI)(卡塔尔计算研究所) Hamad Bin Khalifa University(哈马德·本·哈利法大学)

专题命中 视觉推理 :vision-language model(title,abstract);VLM(abstract_cn);分类 cs.CV、cs.AI、cs.LG

AI总结 针对现有基准无法诊断视觉语言模型真实推理能力的问题,提出基于Bloom认知分类学的双语多模态基准BloomBench,系统评估六个认知层次,揭示模型在事实回忆和创造性合成方面的深层局限。

Comments Accepted to ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏