arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 4454 信号源:cs.CV, cs.AI, cs.LG

1. 视觉推理 4454 篇

2406.07549 2024-06-14 cs.RO 82%

A3VLM: Actionable Articulation-Aware Vision Language Model

Siyuan Huang, Haonan Chang, Yuhan Liu, Yimeng Zhu, Hao Dong, Peng Gao, Abdeslam Boularias, Hongsheng Li

专题命中 视觉推理 :vision language model(title,abstract);visual reasoning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.18358 2024-05-29 cs.CL cs.AI cs.CV cs.LG 82%

MMCTAgent: Multi-modal Critical Thinking Agent Framework for Complex Visual Reasoning

Somnath Kumar, Yash Gadhia, Tanuja Ganu, Akshay Nambi

专题命中 视觉推理 :visual reasoning(title,abstract);分类 cs.CV、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.06904 2024-04-11 cs.RO 82%

Vision-Language Model-based Physical Reasoning for Robot Liquid Perception

Wenqiang Lai, Yuan Gao, Tin Lun Lam

专题命中 视觉推理 :vision-language model(title,abstract);grounding(abstract)

Comments 8 pages, 6 figures, submitted to IROS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.02506 2024-01-22 cs.LG cs.AI cs.CV 82%

Prismer: A Vision-Language Model with Multi-Task Experts

Shikun Liu, Linxi Fan, Edward Johns, Zhiding Yu, Chaowei Xiao, Anima Anandkumar

专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.CV、cs.AI、cs.LG

Comments Published at TMLR 2024. Project Page: https://shikun.io/projects/prismer Code: https://github.com/NVlabs/prismer

详情

展开后加载摘要…

URL PDF HTML 收藏
2301.13007 2023-07-06 cs.CV cs.AI cs.LG 82%

EuclidNet: Deep Visual Reasoning for Constructible Problems in Geometry

Man Fai Wong, Xintong Qi, Chee Wei Tan

专题命中 视觉推理 :visual reasoning(title,abstract);分类 cs.CV、cs.AI、cs.LG

Comments Accepted by 2nd MATH-AI Workshop at NeurIPS'22

Journal ref Adv. Artif. Intell. Mach. Learn.(2023), 3(1):839-852

详情

展开后加载摘要…

URL PDF HTML 收藏
2205.13803 2023-04-14 cs.CV cs.AI cs.LG 82%

Bongard-HOI: Benchmarking Few-Shot Visual Reasoning for Human-Object Interactions

Huaizu Jiang, Xiaojian Ma, Weili Nie, Zhiding Yu, Yuke Zhu, Song-Chun Zhu, Anima Anandkumar

专题命中 视觉推理 :visual reasoning(title,abstract);分类 cs.CV、cs.AI、cs.LG

Comments CVPR 2022 (oral); First two authors contributed equally; Code: https://github.com/NVlabs/Bongard-HOI

详情

展开后加载摘要…

URL PDF HTML 收藏
2202.10284 2023-02-27 cs.AI cs.CV cs.LG 82%

A Review of Emerging Research Directions in Abstract Visual Reasoning

Mikołaj Małkiński, Jacek Mańdziuk

专题命中 视觉推理 :visual reasoning(title,abstract);分类 cs.CV、cs.AI、cs.LG

Journal ref Information Fusion, Volume 91, March 2023, Pages 713-736

详情

展开后加载摘要…

URL PDF HTML 收藏
2301.05226 2023-01-13 cs.CV cs.AI cs.CL cs.LG 82%

See, Think, Confirm: Interactive Prompting Between Vision and Language Models for Knowledge-based Visual Reasoning

Zhenfang Chen, Qinhong Zhou, Yikang Shen, Yining Hong, Hao Zhang, Chuang Gan

专题命中 视觉推理 :visual reasoning(title,abstract);分类 cs.CV、cs.AI、cs.LG

Comments The first two authors contributed equally to this work

详情

展开后加载摘要…

URL PDF HTML 收藏
2211.16492 2022-11-30 cs.CL cs.AI cs.CV cs.LG 82%

Abstract Visual Reasoning with Tangram Shapes

Anya Ji, Noriyuki Kojima, Noah Rush, Alane Suhr, Wai Keen Vong, Robert D. Hawkins, Yoav Artzi

专题命中 视觉推理 :visual reasoning(title,abstract);分类 cs.CV、cs.AI、cs.LG

Comments EMNLP 2022 long paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2202.12162 2022-03-01 cs.LG cs.AI cs.CV 82%

Measuring CLEVRness: Blackbox testing of Visual Reasoning Models

Spyridon Mouselinos, Henryk Michalewski, Mateusz Malinowski

专题命中 视觉推理 :visual reasoning(title);visual question answering(abstract);分类 cs.CV、cs.AI、cs.LG

Comments ICLR 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2110.15358 2021-10-29 cs.CV cs.AI cs.LG 82%

Dynamic Visual Reasoning by Learning Differentiable Physics Models from Video and Language

Mingyu Ding, Zhenfang Chen, Tao Du, Ping Luo, Joshua B. Tenenbaum, Chuang Gan

专题命中 视觉推理 :visual reasoning(title,abstract);分类 cs.CV、cs.AI、cs.LG

Comments NeurIPS 2021. Project page: http://vrdp.csail.mit.edu/

详情

展开后加载摘要…

URL PDF HTML 收藏
2012.08508 2021-10-27 cs.CV cs.AI cs.CL cs.LG 82%

Attention over learned object embeddings enables complex visual reasoning

David Ding, Felix Hill, Adam Santoro, Malcolm Reynolds, Matt Botvinick

专题命中 视觉推理 :visual reasoning(title,abstract);分类 cs.CV、cs.AI、cs.LG

Comments 22 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2011.11603 2021-08-25 cs.CV cs.AI cs.CL cs.LG 82%

Interpretable Visual Reasoning via Induced Symbolic Space

Zhonghao Wang, Kai Wang, Mo Yu, Jinjun Xiong, Wen-mei Hwu, Mark Hasegawa-Johnson, Humphrey Shi

专题命中 视觉推理 :visual reasoning(title,abstract);分类 cs.CV、cs.AI、cs.LG

Comments ICCV 2021

详情

展开后加载摘要…

URL PDF HTML 收藏
2011.13160 2021-04-05 cs.CV cs.AI cs.LG 82%

Transformation Driven Visual Reasoning

Xin Hong, Yanyan Lan, Liang Pang, Jiafeng Guo, Xueqi Cheng

专题命中 视觉推理 :visual reasoning(title,abstract);分类 cs.CV、cs.AI、cs.LG

Comments Accepted to CVPR 2021. Resources including the TRANCE dataset and the code can be found at our homepage https://hongxin2019.github.io/TVR

详情

展开后加载摘要…

URL PDF HTML 收藏
2004.02673 2020-04-07 cs.CV cs.AI cs.LG cs.RO 82%

SHOP-VRB: A Visual Reasoning Benchmark for Object Perception

Michal Nazarczuk, Krystian Mikolajczyk

专题命中 视觉推理 :visual reasoning(title,abstract);分类 cs.CV、cs.AI、cs.LG

Comments International Conference on Robotics and Automation (ICRA) 2020

详情

展开后加载摘要…

URL PDF HTML 收藏
1903.02741 2019-03-08 cs.CV cs.AI cs.LG 82%

RAVEN: A Dataset for Relational and Analogical Visual rEasoNing

Chi Zhang, Feng Gao, Baoxiong Jia, Yixin Zhu, Song-Chun Zhu

专题命中 视觉推理 :visual reasoning(title);visual question answering(abstract);分类 cs.CV、cs.AI、cs.LG

Comments CVPR 2019 paper. Supplementary: http://wellyzhang.github.io/attach/cvpr19zhang_supp.pdf Project: http://wellyzhang.github.io/project/raven.html

详情

展开后加载摘要…

URL PDF HTML 收藏
1803.06092 2018-07-23 cs.AI cs.CV cs.LG 82%

A Dataset and Architecture for Visual Reasoning with a Working Memory

Guangyu Robert Yang, Igor Ganichev, Xiao-Jing Wang, Jonathon Shlens, David Sussillo

专题命中 视觉推理 :visual reasoning(title,abstract);分类 cs.CV、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12743 2026-08-14 cs.AI 新提交 81%

Spatial Memory Agent: Experience-Grounded Procedure Memory for Spatial Intelligence

空间记忆智能体:用于空间智能的基于经验的过程记忆

Haokai Zhang, Yuhang Ding, Yunshu Zhou, Xinze Du, Shengtao Zhang, Zhiyue Zhao, Yuling Xi, Hao Chen

机构 * Zhejiang University(浙江大学) Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 视觉推理 :VLM(summary_cn,abstract);分类 cs.AI

AI总结 该研究提出SMA框架,让冻结VLM智能体无需外部空间工具,通过无参数更新自进化提升空间推理,在多基准和模型上表现最优,提供了空间自进化的实用路径。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10448 2026-08-12 cs.AI 新提交 81%

Rationale-Guided Learning for Multimodal Emotion Recognition

基于理由引导学习的多模态情感识别

Sujung Oh, Jung Uk Kim, Sangmin Lee

专题命中 视觉推理 :MLLM(summary_cn,abstract);分类 cs.AI

AI总结 针对多模态情感识别忽略人类因果推理的问题,提出理由引导学习框架,结合双加工理论与MLLM生成的理由训练模型,在IEMOCAP和MELD基准取得最优性能,且推理无额外开销。

Comments ICASSP 2026

Journal ref S. Oh, J. U. Kim and S. Lee, "Rationale-Guided Learning for Multimodal Emotion Recognition," ICASSP 2026 - 2026 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), Barcelona, Spain, 2026, pp. 12577-12581

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09281 2026-08-11 cs.AI 新提交 81%

MMArch: Benchmarking Multimodal Reasoning Grounded in Architectural Evidence

MMArch:基于建筑证据的多模态推理基准测试

Chenxu Du, Kang An, Tengyue Wang, Zhongyu Yang, Xinqi Yang, Yuanchi Zhu, Hebao Zhu, Ziliang Wang, Faqiang Qian, Yunli Yang, Qibing Ren

专题命中 视觉推理 :MLLM(summary_cn,abstract_cn);multimodal large language model(abstract);分类 cs.AI

AI总结 研究针对多模态大语言模型(MLLM)在工程多模态推理基准上的表现,构建MMArch基准,发现现有MLLM与人类专家存在差距,为相关研究提供评估基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05565 2026-08-07 cs.CV 新提交 81%

EffectLearner: World-Aware Object-Effect Reasoning for Real-World Video Object Removal

EffectLearner:面向真实世界视频物体移除的世界感知物体-效应推理

Feier Wu, Wanke Xia, Xu He, Zilang Zhou, Si Chen, Dongxia Liu, Liyang Chen, Qimeng Wu, Zhengbo Zhang, Wenming Yang, Zhiyong Wu

专题命中 视觉推理 :VLM(summary_cn,abstract);分类 cs.CV

AI总结 该研究提出EffectLearner框架,结合VLM物体-效应推理器与DiT视频擦除器,构建专属数据集EffectWorld并采用渐进式训练,在视频物体移除任务上实现更优性能。

Comments Project: https://morleyolsen.github.io/EffectLearner/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11844 2026-08-05 cs.CV 版本更新 81%

Beyond the Single Camera: Agentic Multi-View Reasoning in Sports Video Understanding

超越单摄像头:体育视频理解中的智能多视角推理

Kerui Chen, Jinglu Wang, Xiaoyi Zhang, Yan Lu

机构 * Zhejiang University(浙江大学) Microsoft Research Asia(微软亚洲研究院)

专题命中 视觉推理 :MLLM(summary_cn,abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 针对体育视频多视角理解缺乏评估基准及MLLMs难以利用多视角信息的问题,引入SportMV - Bench基准,分析瓶颈所在,并提出SportMV - Agent框架,通过迭代循环实现主动视角选择等,相比最强MLLM基线有显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02449 2026-08-04 cs.CV cs.RO 新提交 81%

MoRAL: Sensor-Grounded BEV Reasoning for Compact VLMs toward Edge-Oriented Autonomous Driving

MoRAL:面向边缘自动驾驶的紧凑型视觉语言模型的传感器接地鸟瞰图推理

Ambarish Govindarajulu Kaliamurthi, Kaikai Liu

专题命中 视觉推理 :VLM(abstract,abstract_cn);vision-language model(abstract);grounding(abstract);分类 cs.CV

AI总结 MoRAL是一种两阶段微调流水线,指导Cosmos-Reason2-2B基于物理编码的BEV表示进行驾驶决策,在参数仅为零样本基准四分之一的情况下,在8类驾驶问题中7类胜出,紧急制动召回率提升至47.8%,可在消费级8GB GPU高效运行。

Comments 7 pages, 5 figures, 6 tables. Accepted to the 14th IEEE International Conference on Intelligent Mobile Computing (IEEE IMC 2026), Fukuoka, Japan, July 27-30, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01456 2026-08-04 cs.CV cs.CL 新提交 81%

Long-Horizon Embodied Decision-Making via Multimodal Memory Compression

基于多模态记忆压缩的长视野具身决策

Bingxuan Li, Rui Yang, Cheng Qian, Jiateng Liu, Jeonghwan Kim, Zhenhailong Wang, Manling Li, Tong Zhang, Heng Ji

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Northwestern University(西北大学)

专题命中 视觉推理 :VLM(summary_cn,abstract);分类 cs.CV

AI总结 该研究提出DunphyBench基准用于评估长视野具身决策,发现当前智能体与人类表现存在差距,设计了MeMento记忆压缩器,使VLM驱动智能体准确率提升7.18%且内存使用降低85.38%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27378 2026-07-31 cs.CV cs.MM 新提交 81%

PanDent: Toward Comprehensive Tooth-Level Structure-Language Consistency in Dental Radiology

PanDent:面向牙科放射学中全面的牙级结构-语言一致性

Xiaohan Li, Xinyu Liu, Chang Liu, Sum Wing Au Yeung, Jun Liu, Yixuan Yuan, Hui Chen

机构 * Faculty of Dentistry, The University of Hong Kong(香港大学牙医学院) Imperial College London(帝国理工学院) University of Science and Technology of China(中国科学技术大学) Department of Data and Systems Engineering, The University of Hong Kong(香港大学数据与系统工程系) Department of Electronic Engineering, The Chinese University of Hong Kong(香港中文大学电子工程系)

专题命中 视觉推理 :MLLM(summary_cn,abstract_cn);multimodal large language model(abstract);分类 cs.CV

AI总结 本研究推出PanDent牙科OPG基准,经实验发现现有MLLM生成的牙科报告流畅但临床一致性差,在PanDent上微调可提升其结构-语言一致性,该基准可用于评估MLLM的牙级临床推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27145 2026-07-30 cs.CV 新提交 81%

Explainable and Resource-Efficient Spatial Reasoning in Multimodal LLMs for Decision-Critical Applications

面向决策关键型应用的多模态大语言模型中可解释且资源高效的空间推理

Piyush Jain, Kousik Dasgupta, Rajarshi Roy, Subarna Tripathi

机构 * Heritage Institute of Technology(遗产技术学院) Kalyani Government Engineering College(卡利亚尼政府工程学院) IAIRO Intel Corporation(英特尔公司)

专题命中 视觉推理 :MLLM(abstract,abstract_cn);grounding(abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 针对多模态大语言模型空间判断不透明及细粒度空间理解不足的问题,提出无需训练的ByDeWay-V2框架,结合YOLO-World-L注入空间谓词,在多个基准上显著提升空间推理性能,适配资源受限场景。

Comments 14 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20515 2026-07-24 cs.CV 版本更新 81%

S-Agent: Spatial Tool-Use Elicits Reasoning for Spatial Intelligence

S-Agent:空间工具使用激发空间智能推理

Yalun Dai, Hao Li, Shulin Tian, Runmao Yao, Yuhao Dong, Fangzhou Hong, Zhaoxi Chen, Fangfu Liu, Tao Wang, Kim-Hui Yap, Ziwei Liu

机构 * NTU(南洋理工大学) THU(清华大学) ByteDance(字节跳动) NWPU(西北工业大学)

专题命中 视觉推理 :VLM(summary_cn,abstract);分类 cs.CV

AI总结 提出S-Agent空间工具使用智能体范式,通过时空证据积累和层次化工具集,将VLM作为语义规划器,实现连续多视图图像和视频的空间推理,在无训练下提升开源和闭源VLM性能,并基于S-300K轨迹微调得到紧凑空间智能体S-Agent-8B。

Comments Project Page : https://Ropedia.github.io/S-Agent

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.05881 2026-07-24 cs.LG cs.CL cs.RO 81%

Training Fast Robot Policies with Slow Foundation Models

用慢速基础模型训练快速机器人策略

Utsav Singh, Pramit Bhattacharyya, Vinay P. Namboodiri, Amrit Singh Bedi

专题命中 视觉推理 :vision-language model(abstract);VLM(abstract);visual reasoning(abstract);grounding(abstract)

AI总结 本文提出VGRS方法,通过利用慢速基础模型训练快速机器人策略,结合LLM生成奖励与视觉分析诊断,提升机器人在复杂任务中的表现和部署效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18664 2026-07-22 cs.CV 新提交 81%

DeforM: Reasoning-Guided Physics-Aware Video Generation via Spatial-Temporal Masking

DeforM:通过时空掩码实现推理引导的物理感知视频生成

Yunyi Li, Yu Qiao, Yaohui Wang, Xinyuan Chen

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 视觉推理 :VLM(summary_cn,abstract);分类 cs.CV

AI总结 研究针对视频生成模型难以生成物理感知视频的问题,提出DeforM框架,引入VLM引导的物理推理模块及两种策略,经实验验证该框架能提高生成变形场景的真实感,优于基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16839 2026-07-17 cs.CV 版本更新 81%

LaViDa: A Large Diffusion Language Model for Multimodal Understanding

LaViDa:用于多模态理解的大型扩散语言模型

Shufan Li, Konstantinos Kallidromitis, Hritik Bansal, Akash Gokul, Yusuke Kato, Kazuki Kozuka, Jason Kuen, Zhe Lin, Kai-Wei Chang, Aditya Grover

机构 * UCLA(加州大学洛杉矶分校) Panasonic AI Research(松下人工智能研究) Adobe Research(Adobe研究) Salesforce Research(Salesforce研究)

专题命中 视觉推理 :vision-language model(abstract);VLM(abstract_cn);LLaVA(abstract);visual reasoning(abstract)

AI总结 研究针对现有视觉语言模型在快速推理和可控生成方面的不足,提出基于离散扩散模型构建 LaViDa 系列视觉语言模型,采用多种新技术,在多模态基准测试中性能出色,成为自回归视觉语言模型的有力替代。

Comments 26 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏