arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 26117 信号源:cs.CV, cs.AI, cs.LG

1. 视觉推理 4478 篇

2505.16192 2025-06-02 cs.CV cs.AI 86%

VLM-R$^3$: Region Recognition, Reasoning, and Refinement for Enhanced Multimodal Chain-of-Thought

Chaoya Jiang, Yongrui Heng, Wei Ye, Han Yang, Haiyang Xu, Ming Yan, Ji Zhang, Fei Huang, Shikun Zhang

机构 * National Engineering Research Center for Software Engineering, Peking University(软件工程国家工程研究中心,北京大学) Alibaba Group(阿里巴巴集团) ZEEKR Intelligent Technology Holding Limited(ZEKR智能科技控股有限公司)

专题命中 视觉推理 :VLM(title,abstract);grounding(abstract);MLLM(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.20648 2025-04-30 cs.CV cs.AI 86%

SpaRE: Enhancing Spatial Reasoning in Vision-Language Models with Synthetic Data

Michael Ogezi, Freda Shi

机构 * University of Waterloo(滑铁卢大学) Vector Institute(向量研究所)

专题命中 视觉推理 :vision-language model(title,abstract);VLM(abstract);visual question answering(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.02587 2025-04-07 cs.LG cs.CL cs.CV 86%

Rethinking RL Scaling for Vision Language Models: A Transparent, From-Scratch Framework and Comprehensive Evaluation Scheme

Yan Ma, Steffi Chern, Xuyang Shen, Yiran Zhong, Pengfei Liu

专题命中 视觉推理 :vision language model(title);vision-language model(abstract);VLM(abstract);visual reasoning(abstract)

Comments Code is public and available at: https://github.com/GAIR-NLP/MAYE

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.19634 2025-03-20 cs.CV cs.AI 86%

MedVLM-R1: Incentivizing Medical Reasoning Capability of Vision-Language Models (VLMs) via Reinforcement Learning

Jiazhen Pan, Che Liu, Junde Wu, Fenglin Liu, Jiayuan Zhu, Hongwei Bran Li, Chen Chen, Cheng Ouyang, Daniel Rueckert

专题命中 视觉推理 :vision-language model(title);VLM(abstract);visual language model(abstract);visual question answering(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.18880 2025-02-03 cs.CV cs.LG 86%

RLS3: RL-Based Synthetic Sample Selection to Enhance Spatial Reasoning in Vision-Language Models for Indoor Autonomous Perception

Joshua R. Waite, Md. Zahid Hasan, Qisai Liu, Zhanhong Jiang, Chinmay Hegde, Soumik Sarkar

专题命中 视觉推理 :vision-language model(title,abstract);VLM(abstract);grounding(abstract);分类 cs.CV、cs.LG

Comments ICCPS 2025 accepted paper, 10 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.16837 2025-01-14 cs.CV cs.AI cs.CL 86%

MLLM-CompBench: A Comparative Reasoning Benchmark for Multimodal LLMs

Jihyung Kil, Zheda Mai, Justin Lee, Zihe Wang, Kerrie Cheng, Lemeng Wang, Ye Liu, Arpita Chowdhury, Wei-Lun Chao

专题命中 视觉推理 :MLLM(title,abstract);LLaVA(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI

Comments This paper has been accepted to NeurIPS 2024. The first two authors contributed equally to this work

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.08125 2024-12-20 cs.CV cs.CL cs.LG 86%

Progressive Multi-granular Alignments for Grounded Reasoning in Large Vision-Language Models

Quang-Hung Le, Long Hoang Dang, Ngan Le, Truyen Tran, Thao Minh Le

专题命中 视觉推理 :vision-language model(title,abstract);visual reasoning(abstract);grounding(abstract);分类 cs.CV、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.13980 2024-09-24 cs.CV cs.AI 86%

Enhancing Advanced Visual Reasoning Ability of Large Language Models

Zhiyuan Li, Dongnan Liu, Chaoyi Zhang, Heng Wang, Tengfei Xue, Weidong Cai

专题命中 视觉推理 :visual reasoning(title,abstract);vision-language model(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI

Comments EMNLP 2024 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.12168 2024-01-23 cs.CV cs.CL cs.LG cs.RO 86%

SpatialVLM: Endowing Vision-Language Models with Spatial Reasoning Capabilities

Boyuan Chen, Zhuo Xu, Sean Kirmani, Brian Ichter, Danny Driess, Pete Florence, Dorsa Sadigh, Leonidas Guibas, Fei Xia

专题命中 视觉推理 :vision-language model(title);vision language model(abstract);VLM(abstract);visual question answering(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20177 2026-05-20 cs.CL cs.CV 86%

From Seeing to Thinking: Decoupling Perception and Reasoning Improves Post-Training of Vision-Language Models

从感知到思考:解耦感知与推理提升视觉语言模型的训练

Juncheng Wu, Hardy Chen, Haoqin Tu, Xianfeng Tang, Freda Shi, Hui Liu, Hanqing Lu, Cihang Xie, Yuyin Zhou

机构 * Amazon(亚马逊) University of Waterloo(滑铁卢大学) Vector Institute, Canada CIFAR AI Chair(向量研究所,加拿大CIFAR人工智能主席)

专题命中 视觉推理 :vision-language model(title,abstract);VLM(abstract,comments);visual reasoning(abstract);分类 cs.CV

AI总结 本研究通过解耦感知与推理,发现视觉任务性能受限于感知能力不足而非推理本身,通过分阶段训练提升模型的感知与推理能力,从而在多个视觉数学和感知任务中取得更优表现。

Comments 19 pages, 9 figures; Accepted to ICML 2026; Project Page: https://ucsc-vlaa.github.io/VLM-CapCurriculum/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19418 2026-08-06 cs.CV cs.AI cs.LG 版本更新 86%

Chain-of-Visual-Thought: Teaching VLMs to See and Think Better with Continuous Visual Tokens

链式视觉思维:通过连续视觉标记教学VLMs更好地看到和思考

Yiming Qin, Bomin Wei, Jiaxin Ge, Konstantinos Kallidromitis, Stephanie Fu, Trevor Darrell, XuDong Wang

机构 * UC Berkeley(加州大学伯克利分校) UCLA(洛杉矶大学) Panasonic AI Research(松下人工智能研究)

专题命中 视觉推理 :VLM(abstract,abstract_cn);LLaVA(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 COVT通过连续视觉标记提升VLMs的视觉推理能力,使模型在多个基准测试中性能提升3%-16%。

Comments Project page: https://wakalsprojectpage.github.io/covt-website/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01472 2026-06-30 cs.RO 86%

AERMANI-VLM: Structured Prompting and Reasoning for Aerial Manipulation with Vision Language Models

AERMANI-VLM:基于视觉语言模型的空中 manipulation 的结构提示与推理

Sarthak Mishra, Rishabh Dev Yadav, Avirup Das, Saksham Gupta, Wei Pan, Spandan Roy

机构 * Robotics Research Center, IIIT Hyderabad(IIIT海得拉巴机器人研究中心) Department of Computer Science, University of Manchester(曼彻斯特大学计算机科学系) Newcastle University(纽卡斯尔大学)

专题命中 视觉推理 :VLM(title,abstract);vision language model(title)

AI总结 本文提出AERMANI-VLM框架,通过分离高层推理与低层控制,利用结构化提示生成自然语言推理轨迹,实现安全可靠的空中 manipulation 任务执行。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22281 2026-06-17 cs.CV cs.AI cs.CL cs.LG cs.RO 版本更新 86%

ThinkJEPA: Empowering Latent World Models with Large Vision-Language Reasoning Model

ThinkJEPA:赋予潜在世界模型大型视觉-语言推理能力

Haichao Zhang, Yijiang Li, Shwai He, Tushar Nagarajan, Mingfei Chen, Jianglin Lu, Ang Li, Yun Fu

机构 * Northeastern University(东北大学) University of California San Diego(加州大学圣地亚哥分校) University of Maryland(马里兰大学) The University of Texas at Austin(德克萨斯大学奥斯汀分校) University of Washington(华盛顿大学)

专题命中 视觉推理 :VLM(summary_cn,abstract);grounding(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 提出ThinkJEPA框架,结合密集JEPA分支与稀疏VLM思考者分支,通过分层金字塔表示提取模块,实现细粒度运动建模与长程语义引导,在手部操作轨迹预测任务上超越基线。

Comments 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15694 2026-06-16 cs.MM cs.AI cs.CV cs.LG 新提交 86%

MAF: Multimodal Adaptive Few-shot Prompting for Sentiment Analysis with MLLMs

MAF: 面向情感分析的多模态自适应少样本提示方法

Hangling Xie

机构 * Nanjing University of Posts and Telecommunications(南京邮电大学)

专题命中 视觉推理 :MLLM(summary_cn,abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 提出MAF框架,通过动态检索与查询相关的多模态示例,利用轻量级系数生成网络实时融合多模态相似度,结合多数投票提升MLLM在情感分析中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08819 2026-05-27 cs.CV cs.AI cs.LG cs.MM 86%

SenBen: Sensitive Scene Graphs for Explainable Content Moderation

SenBen: 用于可解释内容审核的敏感场景图

Fatih Cagatay Akyon, Alptekin Temizel

机构 * Graduate School of Informatics, METU(信息学院研究生院,梅尔夫大学) Ultralytics, Inc.(Ultralytics公司)

专题命中 视觉推理 :VLM(summary_cn,abstract);grounding(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 提出SenBen基准和紧凑学生模型,通过多任务训练和词汇平衡策略实现敏感内容的空间定位与可解释性,在场景图生成上超越多数VLM。

Comments Accepted at CVPRW 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09693 2026-05-12 cs.CV cs.AI cs.LG 86%

Do multimodal models imagine electric sheep?

多模态模型是否想象出电羊?

Santhosh Kumar Ramakrishnan, Carl Vondrick, Raja Giryes, Philipp Krähenbühl, Vladlen Koltun

机构 * Apple(苹果公司)

专题命中 视觉推理 :VLM(summary_cn,abstract);visual reasoning(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 研究发现多模态模型在解决空间谜题时会形成心理图像,通过微调Qwen3.5 VLM解决多种视觉推理任务,发现动作序列预测能提升解谜准确率,尤其在需要空间推理的任务中效果显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21278 2026-04-21 cs.CV cs.AI cs.CL cs.LG 86%

GeoRC: A Benchmark for Geolocation Reasoning Chains

GeoRC:地理定位推理链基准测试

Mohit Talreja, Joshua Diao, Jim Thannikary James, Radu Casapu, Tejas Santanam, Ethan Mendes, Alan Ritter, Wei Xu, James Hays

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 视觉推理 :VLM(summary_cn,abstract);vision language model(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 本文提出GeoRC基准,通过Champion级GeoGuessr专家生成的800条真实推理链,评估VLM生成推理链的准确性,发现大模型在生成可审计推理链上仍逊于人类专家,而小型模型表现更差。

Comments Accepted to ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03204 2026-08-05 cs.CL cs.AI 新提交 85%

Aligning Large Vision-Language Models at Test Time: A Trajectory-Guided Structured Sampling Approach

测试时对齐大型视觉语言模型:一种轨迹引导的结构化采样方法

Tianbao Jiang, Weicong Ni, Gerard de Melo, Linlin Wang

专题命中 视觉推理 :vision-language model(title,abstract);visual reasoning(abstract);grounding(abstract);分类 cs.AI

AI总结 针对现有视觉语言模型测试时对齐方法资源密集、训练与推理分布不匹配的问题,提出轨迹引导结构化采样的测试时对齐方法,在多模态推理数据集上提升准确率且推理开销可控。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02486 2026-08-05 cs.CV cs.CL 版本更新 85%

VLMs Need Words: Vision Language Models Ignore Visual Detail In Favor of Semantic Anchors

VLMs需要词语:视觉语言模型倾向于通过语义锚点而非视觉细节进行推理

Haz Sameen Shahgir, Xiaofu Chen, Yu Fu, Erfan Shayegani, Nael Abu-Ghazaleh, Yova Kementchedjhieva, Yue Dong

机构 * University of California, Riverside(加州大学河滨分校) MBZUAI(穆桑人工智能研究院)

专题命中 视觉推理 :vision language model(title);VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV

AI总结 研究发现视觉语言模型在需要细粒度视觉感知的任务中表现不佳,因其依赖语义锚点而非视觉细节。通过实验验证,模型在可命名实体上表现更佳,而Logit Lens分析显示其能恢复语义标签。任务特定微调可提升性能,无需语言先验。

Comments Accepted at the Conference on Language Modeling 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01709 2026-08-04 cs.CV 新提交 85%

SpatialQuery: Benchmarking Geometry-Grounded Multi-Instance Spatial Reasoning in Vision-Language Models

SpatialQuery:评估视觉语言模型中基于几何的多实例空间推理能力

Hai Nguyen, Tung Vu, Cong Tran

机构 * Posts and Telecommunications Institute of Technology(邮电技术学院)

专题命中 视觉推理 :vision-language model(title,abstract);VLM(abstract,abstract_cn);分类 cs.CV

AI总结 该研究针对视觉语言模型的多实例空间推理缺陷,推出SPATIALQUERY框架及含百万对问答的SPATIALQUERY-1M基准,结合UA-CoT提示,使Qwen3-VL-8B在空间推理任务中表现优于多种模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23125 2026-08-03 cs.LG 版本更新 85%

Self-Boosting Vision-Language Models with Noisy Student On-Policy Self-Distillation

基于有噪学生策略性自蒸馏的自增强视觉语言模型

Shuai Wang, Daoan Zhang, Zhe Tang, Hao Cheng, Jiaheng Wei

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ByteDance Inc.(字节跳动公司) Zhejiang University of Technology(浙江工业大学) Hong Kong Baptist University(香港浸会大学)

专题命中 视觉推理 :vision-language model(title,abstract);VLM(abstract_cn);visual reasoning(abstract);分类 cs.LG

AI总结 研究针对视觉语言模型无外部监督难以改进的问题,提出NOPD自蒸馏方法,利用干净与损坏输入预测差异产生自监督信号,在多视觉推理任务中有效,能提升多个模型在多个基准测试中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16586 2026-07-30 cs.CV 版本更新 85%

LOCUS: Local Visual Cue Search for Enhancing Fine-Grained Perception in Multimodal Large Language Models

LOCUS: 局部视觉线索搜索增强多模态大语言模型的细粒度感知

Zhou Tao, Fang Zhang, Zewen Ding, Shida Wang, Xiaokun Sun, YongXiang Hua, Haoyu Cao, Linli Xu

机构 * University of Science and Technology of China(中国科学技术大学) State Key Laboratory of Cognitive Intelligence(认知智能国家重点实验室)

专题命中 视觉推理 :multimodal large language model(title,abstract);MLLM(summary_cn);分类 cs.CV

AI总结 提出LOCUS训练框架,通过可验证的局部线索搜索代理任务,使MLLM内化细粒度证据选择,提升定位敏感视觉理解而不改变推理接口。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03701 2026-07-30 cs.CV 版本更新 85%

VidNum: Diagnosing VLM Failure Modes in Video-Grounded Numerical Reasoning

VidNum-1.4K:一个全面的视频基于数值推理基准

Shaoyang Cui, Lingbei Meng, Yaodi Luo, Peize He

机构 * Department of Psychological and Cognitive Sciences, Tsinghua University(清华大学心理与认知科学系) Shenzhen Loop Area Institute(深圳河套学院)

专题命中 视觉推理 :VLM(title,abstract);vision-language model(abstract,abstract_cn);分类 cs.CV

AI总结 本文提出VidNum-1.4K基准,通过1379个严格人工标注的视频问题对,评估视频基于的数值推理能力,揭示当前VLMs在多步骤逻辑推理上的不足。

Comments 7 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24125 2026-07-28 cs.RO cs.AI 版本更新 85%

Unified Embodied VLM Reasoning with Robotic Action via Autoregressive Discretized Pre-training

通过自回归离散预训练实现机器人动作的统一具身VLM推理

Yi Liu, Sukai Wang, Dafeng Wei, Xiaowei Cai, Linqing Zhong, Jiange Yang, Guanghui Ren, Jinyu Zhang, Maoqing Yao, Chuankang Li, Xindong He, Liliang Chen, Jianlan Luo

机构 * AgiBot Research(AgiBot研究机构) AgiBot(AgiBot公司) Shanghai Innovation Institute(上海创新研究院)

专题命中 视觉推理 :VLM(title,title_cn);vision-language model(abstract);分类 cs.AI

AI总结 本文提出ERIQ基准和FACT模型,通过统一空间优化推理与动作,提升机器人在开放环境中的泛化与精确执行能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11436 2026-07-20 cs.AI 版本更新 85%

The Ebb and Flow of Multimodal Focus: Scheduling Visual Relay Windows for Grounded VLM Reasoning

多模态焦点的潮起潮落:为基于视觉的语言模型推理调度视觉中继窗口

Wencheng Ye, Yi Bin, Yujuan Ding, Hongye Fang, Zheng Wang, Xing Xu, Jingkuan Song, Yun Zhang, Sirui Da, Heng Tao Shen

机构 * School of Computer Science and Technology, Tongji University(同济大学计算机科学与技术学院) School of Fashion and Textiles, The Hong Kong Polytechnic University(香港理工大学纺织及制衣学院) School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院)

专题命中 视觉推理 :VLM(title,abstract);vision-language model(abstract);grounding(abstract);分类 cs.AI

AI总结 研究视觉语言模型视觉证据不稳定问题,通过剖析其内部多模态注意力焦点的三阶段分布,提出TRACE框架,该框架能自适应控制推理,在多模型和多基准测试中显著提升基于证据的多模态推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13860 2026-07-16 cs.CV 新提交 85%

Towards Enhancing 3D Spatial Reasoning in Medical Multimodal Large Language Models

迈向增强医学多模态大语言模型中的 3D 空间推理

Zhuoyuan Fu, Zeshang Li, Yiqiong Zhang, Hangui Lin, Yan Shu, Yan Li, Binyang Li, Yaru Zhao

机构 * University of International Relations(国际关系学院)

专题命中 视觉推理 :multimodal large language model(title,abstract);visual question answering(abstract);MLLM(abstract);分类 cs.CV

AI总结 研究旨在增强医学多模态大语言模型的 3D 空间推理。通过新型逐片数据合成范式构建结构化推理数据集,用其对二维预训练模型进行指令微调,提升了模型在 3D 医学基准测试中的性能,缩小了与原生 3D 架构的差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12786 2026-07-15 cs.CV 新提交 85%

CoRe: A Comprehensive Framework for Cross-Image Comparative Reasoning in Vision-Language Models

CoRe:视觉语言模型中跨图像比较推理的综合框架

Lin Peng, Cong Wan, Zeyu Guo, SongLin Dong, Yihong Gong

机构 * Xi’an Jiaotong University(西安交通大学)

专题命中 视觉推理 :vision-language model(title,abstract);VLM(abstract_cn);grounding(abstract);分类 cs.CV

AI总结 针对视觉语言模型跨图像比较推理难题,提出CoRe框架,含自动构建的训练集CoRe-20K、结构化奖励框架TriSR及基准CoRe-Bench,实验显示其在CoRe-Bench上大幅超越现有模型,在标准基准上也有竞争力。

Comments Accepted by ACMMM2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16728 2026-07-14 cs.LG 版本更新 85%

The Cost of Reasoning: Chain-of-Thought Induces Overconfidence in Vision-Language Models

推理的成本:链式推理诱导视觉-语言模型的过度自信

Robert Welch, Emir Konuk, Kevin Smith

机构 * KTH Royal Institute of Technology, Stockholm, Sweden(皇家理工学院) Science for Life Laboratory, Stockholm, Sweden(生命科学实验室)

专题命中 视觉推理 :vision-language model(title,abstract);VLM(abstract,abstract_cn);分类 cs.LG

AI总结 研究发现链式推理会降低视觉-语言模型的不确定性估计质量,主要机制是隐式答案条件化,导致模型过度自信。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02742 2026-06-30 cs.CV 85%

Consistent Yet Wrong: Evidence Insensitivity in Spatial Vision-Language Models

一致但错误:空间视觉-语言模型中的证据不敏感性

S Divakar Bhat, Toshihiko Yamasaki

机构 * The University of Tokyo, Japan(东京大学)

专题命中 视觉推理 :vision-language model(title,abstract);VLM(abstract_cn);grounding(abstract);分类 cs.CV

AI总结 通过引入ViewDiag多视图评估协议,发现现代视觉-语言模型在空间推理中表现出跨视角一致但错误的现象,表明其预测主要源于先验驱动而非证据敏感推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22284 2026-06-26 cs.LG 版本更新 85%

BrepCoder: A Unified Multimodal Large Language Model for Multi-task B-rep Reasoning

BrepCoder: 用于多任务B-rep推理的统一多模态大语言模型

Mingi Kim, Yongjun Kim, Jungwoo Kang, Hyungki Kim

机构 * Chungnam National University(全南国立大学)

专题命中 视觉推理 :multimodal large language model(title,abstract);MLLM(abstract,abstract_cn);分类 cs.LG

AI总结 提出BrepCoder,一种统一的多模态大语言模型,通过将CAD建模序列转换为类Python代码并与B-rep对齐,采用两阶段训练策略,实现从B-rep输入执行多种CAD任务,包括补全、纠错和问答。

详情

展开后加载摘要…

URL PDF HTML 收藏