arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 4463 信号源:cs.CV, cs.AI, cs.LG

1. 视觉推理 4463 篇

2401.13601 2024-05-29 cs.CL 78%

MM-LLMs: Recent Advances in MultiModal Large Language Models

Duzhen Zhang, Yahan Yu, Jiahua Dong, Chenxing Li, Dan Su, Chenhui Chu, Dong Yu

专题命中 视觉推理 :multimodal large language model(title,abstract)

Comments Accepted by ACL2024 (findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.20194 2024-04-26 cs.MM 78%

ConvBench: A Multi-Turn Conversation Evaluation Benchmark with Hierarchical Capability for Large Vision-Language Models

Shuo Liu, Kaining Ying, Hao Zhang, Yue Yang, Yuqi Lin, Tianle Zhang, Chuanhao Li, Yu Qiao, Ping Luo, Wenqi Shao, Kaipeng Zhang

专题命中 视觉推理 :vision-language model(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.06528 2024-03-08 cs.AI cs.CV cs.LG 78%

Learning Abstract Visual Reasoning via Task Decomposition: A Case Study in Raven Progressive Matrices

Jakub Kwiatkowski, Krzysztof Krawiec

专题命中 视觉推理 :visual reasoning(title);分类 cs.CV、cs.AI、cs.LG

Comments 22 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.13577 2024-02-22 cs.CL 78%

BBA: Bi-Modal Behavioral Alignment for Reasoning with Large Vision-Language Models

Xueliang Zhao, Xinting Huang, Tingchen Fu, Qintong Li, Shansan Gong, Lemao Liu, Wei Bi, Lingpeng Kong

专题命中 视觉推理 :vision-language model(title,abstract)

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2206.09203 2023-10-31 cs.AI cs.CV cs.LG 78%

Interactive Visual Reasoning under Uncertainty

Manjie Xu, Guangyuan Jiang, Wei Liang, Chi Zhang, Yixin Zhu

专题命中 视觉推理 :visual reasoning(title);分类 cs.CV、cs.AI、cs.LG

Comments Accepted at NeurIPS 2023 (Datasets and Benchmarks)

详情

展开后加载摘要…

URL PDF HTML 收藏
2211.16504 2022-11-30 cs.CV cs.AI cs.LG 78%

Improving Commonsense in Vision-Language Models via Knowledge Graph Riddles

Shuquan Ye, Yujia Xie, Dongdong Chen, Yichong Xu, Lu Yuan, Chenguang Zhu, Jing Liao

专题命中 视觉推理 :vision-language model(title);分类 cs.CV、cs.AI、cs.LG

Comments Code: https://github.com/pleaseconnectwifi/DANCE Project page: shuquanye.com/DANCE_website

详情

展开后加载摘要…

URL PDF HTML 收藏
2209.01319 2022-09-07 cs.RO cs.HC 78%

Kinova Gemini: Interactive Robot Grasping with Visual Reasoning and Conversational AI

Hanxiao Chen, Jiankun Wang, Max Q. -H. Meng

专题命中 视觉推理 :visual reasoning(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2002.06838 2022-06-08 cs.CV cs.AI cs.LG 78%

Stratified Rule-Aware Network for Abstract Visual Reasoning

Sheng Hu, Yuqing Ma, Xianglong Liu, Yanlu Wei, Shihao Bai

专题命中 视觉推理 :visual reasoning(title);分类 cs.CV、cs.AI、cs.LG

Comments AAAI 2021 paper. Code: https://github.com/husheng12345/SRAN

详情

展开后加载摘要…

URL PDF HTML 收藏
2109.08994 2021-09-21 cs.CL 78%

ReaSCAN: Compositional Reasoning in Language Grounding

Zhengxuan Wu, Elisa Kreiss, Desmond C. Ong, Christopher Potts

专题命中 视觉推理 :grounding(title,abstract)

Comments 26 pages, 8 figures

Journal ref NeurIPS 2021 (Dataset and Benchmarks Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2006.05398 2020-06-11 cs.LG cs.AI cs.CV cs.RO stat.ML 78%

Deep Visual Reasoning: Learning to Predict Action Sequences for Task and Motion Planning from an Initial Scene Image

Danny Driess, Jung-Su Ha, Marc Toussaint

专题命中 视觉推理 :visual reasoning(title);分类 cs.CV、cs.AI、cs.LG

Comments Robotics: Science and Systems (R:SS) 2020

详情

展开后加载摘要…

URL PDF HTML 收藏
1710.00453 2017-10-03 cs.CL 78%

Visual Reasoning with Natural Language

Stephanie Zhou, Alane Suhr, Yoav Artzi

专题命中 视觉推理 :visual reasoning(title,abstract)

Comments AAAI NCHRC 2017

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.08165 2025-06-27 cs.LG cs.CV 77%

Chain-of-Sketch: Enabling Global Visual Reasoning

Aryo Lotfi, Enrico Fini, Samy Bengio, Moin Nabi, Emmanuel Abbe

机构 * Apple(苹果公司)

专题命中 视觉推理 :visual reasoning(title,comments);分类 cs.CV、cs.LG

Comments additional experiments added, title changed from "Visual Scratchpads: Enabling Global Reasoning in Vision" to "Chain-of-Sketch: Enabling Global Visual Reasoning"

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03988 2026-08-18 cs.AI 版本更新 77%

Imaginative Perception Tokens Enhance Spatial Reasoning in Multimodal Language Models

想象感知标记增强多模态语言模型的空间推理能力

Mahtab Bigverdi, Linjie Li, Weikai Huang, Yiming Liu, Jaemin Cho, Tuhin Kundu, Chris Dongjoo Kim, Zelun Luo, Jieyu Zhang, Linda Shapiro, Ranjay Krishna

机构 * University of Washington(华盛顿大学) Allen Institute for AI(Allen人工智能研究所) Microsoft(微软) OpenAI(开放人工智能研究院)

专题命中 视觉推理 :VLM(abstract,abstract_cn);vision language model(abstract);分类 cs.AI

AI总结 提出想象感知标记(IPT)作为中间感知表征,通过监督学习提升多模态语言模型在不可见视角推理、遮挡路径追踪等空间推理任务上的性能,在三个新构建的数据集上优于文本思维链训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19985 2026-08-13 cs.CV 版本更新 77%

Vision-Reasoning-Guided Occlusion Removal from Light Fields

视觉推理引导的光场遮挡去除

Mohamed Youssef, Oliver Bimber

机构 * Johannes Kepler University(约翰·开普勒大学)

专题命中 视觉推理 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV

AI总结 提出结合光场积分与视觉语言模型的框架,通过多视图融合和语义先验恢复被遮挡场景,在合成和真实数据上取得最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08053 2026-08-11 cs.RO cs.CV 新提交 77%

PhysX-CoT: Structured Physical Reasoning from a Single Image to Simulation-Ready 3D Assets

PhysX-CoT:从单张图像生成可用于仿真的3D资产的结构化物理推理

Jie Huang, Xiaohe Li, Jiahao Li, Fangli Mou, Chen Qian, Yuqiang Fang, Junhao Fan, Kaixin Zhang, Zide Fan

机构 * Space Engineering University(航天工程大学)

专题命中 视觉推理 :grounding(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV

AI总结 PhysX-CoT将单张图像生成仿真3D资产视为显式结构化物理推理过程,通过分解部件级状态轨迹优化相关指标,在多方面优于基线,生成资产在Unreal Engine 5中表现良好。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05137 2026-08-11 cs.CV 版本更新 77%

SmartMage: Dynamic Modality Orchestration for 3D Scene Understanding

SmartMage:面向3D场景理解的动态模态编排

Yue Zhang, Yingzhao Jian, Yunqiu Xu, Xiaoxiao Sun, Hehe Fan

机构 * Zhejiang University(浙江大学) Stanford University(斯坦福大学)

专题命中 视觉推理 :MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV

AI总结 本文针对现有MLLMs采用固定模态组合的缺陷,提出SmartMage模型,通过SMART和MAGE模块动态编排模态,在5个3D场景理解基准上取得最优性能,在RGB视频理解基准上表现具竞争力。

Comments Accepted to ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05695 2026-08-11 cs.CV 版本更新 77%

Let Geometry GUIDE: Layer-wise Unrolling of Geometric Priors in Multimodal LLMs

让几何引导:在多模态大语言模型中逐层展开几何先验

Chongyu Wang, Ting Huang, Chunyu Sun, Xinyu Ning, Di Wang, Hao Tang

机构 * Xi’an Jiaotong University(西安交通大学) Peking University(北京大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) InspireOmni

专题命中 视觉推理 :MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出GUIDE框架,通过多级采样和逐步融合几何先验,提升多模态大语言模型在空间推理任务中的性能。

Comments Revised manuscript with updated experiments, figures, and presentation

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.04451 2026-08-10 cs.CV 版本更新 77%

RemoteZero: Geospatial Reasoning with Zero Labels

RemoteZero:零样本地理空间推理

Liang Yao, Fan Liu, Shengxiang Xu, Chuanyi Zhang, Rui Min, Shimin Di, Yuhui Zheng

专题命中 视觉推理 :MLLM(summary_cn,abstract_cn);分类 cs.CV

AI总结 本研究提出无标签强化学习框架RemoteZero,利用MLLM的评估能力和航拍图像优势,以语义一致性为内在奖励实现地理空间推理,性能优于监督基线且可自演化,适配多类地球观测任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04759 2026-08-06 cs.CV cs.CL 新提交 77%

Trace, Verify, and Correct: A Training-Free Framework for Spatial Reasoning in Multimodal LLMs

追踪、验证与修正:一种用于多模态大语言模型空间推理的无训练框架

Yang Yang, Jiawei Chen, Tairan Chen, Zhaoxia Yin

机构 * East China Normal University(华东师范大学) Zhongguancun Academy(中关村学院) Stevens Institute of Technology(史蒂文斯理工学院)

专题命中 视觉推理 :multimodal large language model(abstract,abstract_cn);MLLM(abstract);分类 cs.CV

AI总结 针对多模态大语言模型空间推理的错误传播问题,提出无训练的追踪-验证-修正框架,构建空间证据图并评估证据可靠性,在15种模型-数据集设置下平均准确率达68.94%,优于基线。

Comments 19 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29025 2026-08-06 cs.CV 版本更新 77%

Evaluation-Verification Reward for Consistent Multi-Reference Image Editing

用于一致多参考图像编辑的评估-验证奖励

Yingmao Miao, Pengfei Zhang, Xiaochen Lv, Meng Yu, Lei Sun, Xiangxiang Chu, Chao Shen, Chenhao Lin

机构 * Xi’an Jiaotong University(西安交通大学) Amap, Alibaba(高德,阿里巴巴) Shanghai Jiao Tong University(上海交通大学)

专题命中 视觉推理 :MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV

AI总结 针对多参考图像编辑的视觉一致性与奖励模型缺失问题,提出多维度评估-验证奖励EVR,实现无需架构改动的现成编辑器RL微调,性能优于Qwen-Image-Edit并达到或超NanoBanana。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01755 2026-08-05 cs.AI 版本更新 77%

Deferred Exposure of Future Trajectories for Verifiable Reasoning in Autonomous Driving VLMs

用于自动驾驶视觉语言模型可验证推理的未来轨迹延迟暴露

Zixuan Huang, Yang Zhou, Kaixuan Wang, Guli Zhang, Hongyan Xie, Yakun Zhu, Hao Geng, Xiaozhi Chen, Yikun Ban, Deqing Wang

专题命中 视觉推理 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.AI

AI总结 该研究针对自动驾驶VLA模型的轨迹锚定偏差问题,提出AD-MCQ规划框架与DEFT-RLVR方法,将未来轨迹转化为决策后验证目标,提升了自动驾驶推理能力并保留了通用视觉能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00066 2026-08-04 cs.CV 新提交 77%

PhysAgent: A Multi-Agent Framework for Reliable Remote Heart Rate Estimation

PhysAgent:用于可靠远程心率估计的多智能体框架

Yehui Yang, Bo Zhao, Junzhe Cao, Hui Ma, Yue Sun, Wenjin Wang, Zitong Yu

专题命中 视觉推理 :MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV

AI总结 PhysAgent是一种推理时多智能体候选验证框架,以多个基础rPPG估计器输出为待验证生理假设,结合Qwen3-VL-4B多模态大语言模型推理与确定性融合,提升远程心率估计的稳定性与可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28225 2026-07-31 cs.CV 新提交 77%

FaithEyes: Towards Faithful Tool Use via Multi-Agent Process-Image Verification

FaithEyes:通过多智能体过程图像验证实现可信的工具使用

Haoqing Wang, Xingrun Xing, Wei Xia, Ziheng Li, Yehui Tang

机构 * Samsung Research(三星研究院) Peking University(北京大学)

专题命中 视觉推理 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV

AI总结 本研究提出多智能体框架FaithEyes,通过子智能体判断主智能体的工具调用以提升工具使用可信性,在视觉感知与推理基准上实现了更优准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19194 2026-07-23 cs.RO cs.CV 版本更新 77%

Cognitive Dual-Process Planning for Autonomous Driving with Structured Scene Knowledge and Verifiable Reasoning-Action Consistency

基于结构化场景知识和可验证推理-行动一致性的自动驾驶认知双过程规划

Zhongyao Yang, Haoyu Li, Yu Yan, Zhuangxuan Yu, Jiangfeng Nan, Jinrui Nan

机构 * School of Mechanical Engineering, Beijing Institute of Technology(北京理工大学机械工程学院) National Engineering Research Center of Electric Vehicles, Beijing Institute of Technology(北京理工大学电动车辆国家工程研究中心) School of Mechanical Engineering, Southeast University(东南大学机械工程学院)

专题命中 视觉推理 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV

AI总结 研究自动驾驶高级规划问题,提出认知双过程规划框架,用S-CoT模式表示场景知识,通过自动数据引擎、视觉仲裁器及验证器实现自适应推理和规则验证,提升规划准确性、逻辑一致性并降低延迟,明确性能下降条件。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11338 2026-07-23 cs.AI 版本更新 77%

AutoVSR: Automatic Visual-to-Symbolic Reasoning for Symbolic Expression Generation from Circuit Schematic

AutoVSR:用于从电路原理图生成符号表达式的自动视觉到符号推理

Zhe Xiao, Longfei Li, Xu He, Haoying Wu, Zixing Zhang, Mingyu Liu

机构 * Hunan University, Changsha, China(湖南大学) Wuhan University of Technology, Wuhan, China(武汉理工大学) Huazhong University of Science and Technology, Wuhan, China(华中科技大学)

专题命中 视觉推理 :VLM(abstract,abstract_cn);vision language model(abstract);分类 cs.AI

AI总结 研究旨在解决从电路原理图生成符号表达式的难题,提出AutoVSR框架,利用视觉语言模型,通过重建电路图为可执行中间表示并借助符号求解器推理,引入两项创新提升准确率,在任务中表现优于其他方法,还降低了推理成本和提高了计算效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31119 2026-07-23 cs.RO cs.LG 版本更新 77%

Don't Fool Me Twice: Adapting to Adversity in the Wild with Experience-Driven Reasoning

不要愚弄我两次:通过经验驱动推理在野外适应逆境

Navin Sriram Ravie, Andrew Jong, Krrish Jain, John Liu, Omar Alama, Bijo Sebastian, Sebastian Scherer

机构 * Department of Engineering Design, Indian Institute of Technology, Madras(印度理工学院工程设计系,马德拉斯) Robotics Institute, Carnegie Mellon University(卡内基梅隆大学机器人研究所)

专题命中 视觉推理 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.LG

AI总结 提出一种持续学习框架,使移动机器人能够在线从干扰中学习,通过语义将异常行为归因于原因,从而更好地预测和规划未来。

Comments Accepted at 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19027 2026-07-22 cs.CV 新提交 77%

Mitigating Modality and Language-Style Gaps for Zero-Shot Video Moment Retrieval

缓解零样本视频时刻检索中的模态和语言风格差距

Jihyun Lee, Cheol-Ho Cho, Woojin Jun, Woojin Jeong, Jae-Pil Heo

机构 * Sungkyunkwan University(成均馆大学)

专题命中 视觉推理 :vision-language model(abstract);multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

AI总结 研究零样本视频时刻检索中模态和语言风格差距问题,提出基于自相似性的时刻提议和评分方法及查询感知的多模态大语言模型推理阶段,有效缓解差距,在相关基准测试中达最优性能。

Comments ECCV 2026 (* These authors contributed equally.)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16193 2026-07-20 cs.CV 新提交 77%

Knowing the Self, Understanding the World: A Dual-Cognition Benchmark for UAV Spatio-temporal Reasoning with MLLMs

认识自我,理解世界:用于基于多模态大语言模型的无人机时空推理的双认知基准测试

Like Liu, Zhengzheng Xu, Haitao He, Hongzhe Li, Shuchang Zhang, Dian Shao

机构 * Northwestern Polytechnical University(西北工业大学) China University of Petroleum(中国石油大学)

专题命中 视觉推理 :grounding(abstract);multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

AI总结 该研究针对多模态大语言模型在无人机场景双认知能力评估不足的问题,提出UAV-DualCog基准测试,涵盖图像和视频任务,通过自动化管道构建数据,评估发现现有模型存在瓶颈,该基准测试有价值。

Comments 11 pages, 4 figures, 7 tables. Project website: https://uav-dualcog.lozumi.com

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12818 2026-07-16 cs.CV 版本更新 77%

Breaking Déjà Vu: Independent Auditing of Visual Place Recognition through Vision-Language Reasoning

打破似曾相识:通过视觉语言推理对视觉场所识别进行独立审计

Sania Waheed, Michael Milford, Sarvapali D. Ramchurn, Shoaib Ehsan

机构 * School of Electronics and Computer Science, University of Southampton(南安普顿大学电子与计算机科学学院) School of Electrical Engineering and Computer Science, Queensland University of Technology(昆士兰科技大学电气工程与计算机科学学院) School of Computer Science and Electronic Engineering, University of Essex(埃塞克斯大学计算机科学与电子工程学院)

专题命中 视觉推理 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV

AI总结 研究针对视觉场所识别中图像匹配阈值在环境变化下不可靠的问题,引入视觉场所识别审计框架,利用视觉语言模型通过联合推理评估检索匹配,经实验验证该方法有效提升召回率并降低误接受率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22226 2026-07-14 cs.CV 版本更新 77%

Towards Temporal Compositional Reasoning in Long-Form Sports Videos

长期体育视频中的时间组成推理方法

Siyu Cao, Lu Zhang, Ruizhe Zeng, Zhi-yong Liu

机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所MAIS)

专题命中 视觉推理 :grounding(abstract);multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

AI总结 本文提出SportsTime基准和CoTR方法,通过时间接地证据组成提升体育视频长期推理能力,优于现有多模态大语言模型。

详情

展开后加载摘要…

URL PDF HTML 收藏