arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 26117 信号源:cs.CV, cs.AI, cs.LG

1. 视觉推理 4478 篇

2410.16198 2024-10-22 cs.AI cs.CV 84%

Improve Vision Language Model Chain-of-thought Reasoning

Ruohong Zhang, Bowen Zhang, Yanghao Li, Haotian Zhang, Zhiqing Sun, Zhe Gan, Yinfei Yang, Ruoming Pang, Yiming Yang

专题命中 视觉推理 :vision language model(title,abstract);VLM(abstract);分类 cs.CV、cs.AI

Comments 10 pages + appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.03551 2024-10-07 cs.CV cs.AI cs.HC 84%

Constructive Apraxia: An Unexpected Limit of Instructible Vision-Language Models and Analog for Human Cognitive Disorders

David Noever, Samantha E. Miller Noever

专题命中 视觉推理 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.21439 2024-09-26 cs.AI cs.CL cs.LG 84%

MLLM Is a Strong Reranker: Advancing Multimodal Retrieval-augmented Generation via Knowledge-enhanced Reranking and Noise-injected Training

Zhanpeng Chen, Chengjin Xu, Yiyan Qi, Jian Guo

专题命中 视觉推理 :MLLM(title,abstract);multimodal large language model(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.15769 2024-08-29 cs.CV cs.AI cs.CL 84%

A Survey on Evaluation of Multimodal Large Language Models

Jiaxing Huang, Jingyi Zhang

专题命中 视觉推理 :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.03729 2024-08-13 cs.CV cs.AI 84%

TinyLVLM-eHub: Towards Comprehensive and Efficient Evaluation for Large Vision-Language Models

Wenqi Shao, Meng Lei, Yutao Hu, Peng Gao, Kaipeng Zhang, Fanqing Meng, Peng Xu, Siyuan Huang, Hongsheng Li, Yu Qiao, Ping Luo

专题命中 视觉推理 :vision-language model(title,abstract);visual reasoning(abstract);分类 cs.CV、cs.AI

Comments accepted to IEEE Transactions on Big Data. Project Page: http://lvlm-ehub.opengvlab.com/

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.07922 2024-07-17 cs.CL cs.CV cs.LG 84%

LaVy: Vietnamese Multimodal Large Language Model

Chi Tran, Huong Le Thanh

专题命中 视觉推理 :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.CV、cs.LG

Comments 5 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.11069 2024-06-18 cs.CV cs.AI cs.CL 84%

WildVision: Evaluating Vision-Language Models in the Wild with Human Preferences

Yujie Lu, Dongfu Jiang, Wenhu Chen, William Yang Wang, Yejin Choi, Bill Yuchen Lin

专题命中 视觉推理 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV、cs.AI

Comments link: https://hf.co/spaces/WildVision/vision-arena

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.04461 2024-03-21 cs.CL cs.CV cs.LG 84%

Measuring and Improving Chain-of-Thought Reasoning in Vision-Language Models

Yangyi Chen, Karan Sikka, Michael Cogswell, Heng Ji, Ajay Divakaran

专题命中 视觉推理 :vision-language model(title,abstract);visual reasoning(abstract);分类 cs.CV、cs.LG

Comments NAACL 2024 Main Conference. The data is released at https://github.com/Yangyi-Chen/CoTConsistency

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.12921 2024-03-15 cs.LG cs.AI 84%

Vision-Language Models are Zero-Shot Reward Models for Reinforcement Learning

Juan Rocamonde, Victoriano Montesinos, Elvis Nava, Ethan Perez, David Lindner

专题命中 视觉推理 :vision-language model(title,abstract);VLM(abstract);分类 cs.AI、cs.LG

Comments Presented at International Conference on Learning Representations (ICLR) 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.09778 2024-03-07 cs.CV cs.CL cs.LG 84%

Towards Grounded Visual Spatial Reasoning in Multi-Modal Vision Language Models

Navid Rajabi, Jana Kosecka

专题命中 视觉推理 :vision language model(title);visual question answering(abstract);grounding(abstract);分类 cs.CV、cs.LG

Comments Accepted to DMLR @ ICLR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.17661 2024-01-01 cs.CL cs.AI cs.CV 84%

Gemini in Reasoning: Unveiling Commonsense in Multimodal Large Language Models

Yuqing Wang, Yun Zhao

专题命中 视觉推理 :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.CV、cs.AI

Comments Data and results are available at: https://github.com/EternityYW/Gemini-Commonsense-Evaluation/

详情

展开后加载摘要…

URL PDF HTML 收藏
2212.10292 2022-12-21 cs.CV cs.AI 84%

Towards Unsupervised Visual Reasoning: Do Off-The-Shelf Features Know How to Reason?

Monika Wysoczańska, Tom Monnier, Tomasz Trzciński, David Picard

专题命中 视觉推理 :visual reasoning(title,abstract);visual question answering(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2007.04670 2020-07-13 cs.AI cs.CV 84%

Multi-Granularity Modularized Network for Abstract Visual Reasoning

Xiangru Tang, Haoyuan Wang, Xiang Pan, Jiyang Qi

专题命中 视觉推理 :visual reasoning(title,abstract);grounding(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
1809.01943 2018-09-07 cs.IR cs.AI cs.CL cs.CV 84%

Cascaded Mutual Modulation for Visual Reasoning

Yiqun Yao, Jiaming Xu, Feng Wang, Bo Xu

专题命中 视觉推理 :visual reasoning(title,abstract);visual question answering(abstract);分类 cs.CV、cs.AI

Comments to appear in EMNLP 2018

详情

展开后加载摘要…

URL PDF HTML 收藏
1612.06890 2016-12-22 cs.CV cs.CL cs.LG 84%

CLEVR: A Diagnostic Dataset for Compositional Language and Elementary Visual Reasoning

Justin Johnson, Bharath Hariharan, Laurens van der Maaten, Li Fei-Fei, C. Lawrence Zitnick, Ross Girshick

专题命中 视觉推理 :visual reasoning(title,abstract);visual question answering(abstract);分类 cs.CV、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29496 2026-05-29 cs.CL cs.CV 84%

On Asymmetric Optimization of Reasoning and Perception in Vision-Language Model Post-Training

视觉语言模型后训练中推理与感知的非对称优化研究

Xueqing Wu, Yu-Chi Lin, Kai-Wei Chang, Nanyun Peng

机构 * University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 视觉推理 :vision-language model(title,abstract);visual reasoning(abstract);分类 cs.CV;VLM(comments)

AI总结 通过合成任务诊断发现,后训练中推理提升显著优于感知,SFT源于感知token少导致训练信号弱,RL源于奖励耦合,提出动态重加权损失和感知奖励可缓解不平衡并提升端到端性能。

Comments Project: https://asymmetric-vlm-post-training.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26742 2026-03-31 cs.CL cs.LG 84%

Do Multilingual VLMs Reason Equally? A Cross-Lingual Visual Reasoning Audit for Indian Languages

多语言视觉语言模型是否同样具备推理能力?一种针对印度语言的跨语言视觉推理审计

Swastik R

机构 * Indian Institute of Information Technology, Raichur(印度信息技术学院赖丘尔分校)

专题命中 视觉推理 :visual reasoning(title,abstract);vision-language model(abstract);分类 cs.LG;VLM(comments)

AI总结 本文通过将MathVista、ScienceQA和MMMU的980道题翻译成印度语言,评估了8种VLM在七种语言中的表现,发现切换至印度语言时准确率下降9.8-25个百分点,且达罗毗荼语比印欧语下降更多,链式推理反而降低了部分语言的性能。

Comments 16 pages, 10 figures, 6 tables. Code and data: https://github.com/QuantumByte-01/multilingual-vlm-reasoning-audit Dataset: https://huggingface.co/datasets/Swastikr/multilingual-vlm-reasoning

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05023 2026-02-19 cs.CR cs.AI 84%

Do Vision-Language Models Respect Contextual Integrity in Location Disclosure?

视觉-语言模型在位置披露中是否尊重上下文完整性?

Ruixin Yang, Ethan Mendes, Arthur Wang, James Hays, Sauvik Das, Wei Xu, Alan Ritter

专题命中 视觉推理 :vision-language model(title,abstract);VLM(abstract,comments);分类 cs.AI

AI总结 本文研究了视觉-语言模型在位置披露中的隐私问题,指出现有模型在隐私保护方面存在不足,提出VLM-GEOPRIVACY基准以评估模型对上下文完整性的尊重程度。

Comments Accepted by ICLR 2026. Code and data can be downloaded via https://github.com/99starman/VLM-GeoPrivacyBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08024 2026-07-10 cs.CV cs.AI cs.LG cs.RO 新提交 83%

APIVOT: Adaptive Planning with Interleaved Vision-Language Thoughts

APIVOT:具有交错视觉语言思维的自适应规划

Emily Jin, Joy Hsu, Yiqing Xu, Weiyu Liu, Nick Haber, Jiajun Wu

机构 * Stanford University(斯坦福大学)

专题命中 视觉推理 :VLM(summary_cn,abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 研究长期机器人规划问题,提出基于VLM的APIVOT规划器,通过自适应交错语言和视觉思维,利用语言语义推理、视觉思维验证几何可行性,在长期厨房任务中表现出色,提升了规划成功率和推理效率。

Comments Project Page: https://emilyzjin.github.io/projects/apivot.html

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07403 2026-07-07 cs.CV cs.AI cs.CL cs.LG 版本更新 83%

SpatialThinker: Reinforcing Scene Graph-Grounded Spatial Reasoning via Dense Rewards

空间思考者:通过密集奖励强化场景图基础的空间推理

Hunar Batra, Haoqin Tu, Hardy Chen, Yuanze Lin, Cihang Xie, Ronald Clark

机构 * University of Oxford(牛津大学) University of California, Santa Cruz(加州大学圣克鲁兹分校)

专题命中 视觉推理 :visual reasoning(abstract);grounding(abstract);multimodal large language model(abstract);MLLM(abstract)

AI总结 研究针对多模态大语言模型空间推理难题,提出SpatialThinker,通过在线强化学习统一场景图生成与视觉推理,构建心理场景图并借助密集奖励推理,贡献包括基于SGG推理、高质量训练数据集及密集奖励设计。

Comments Preprint. Accepted at NeurIPS 2025 Workshops on SPACE in Vision, Language, and Embodied AI (SpaVLE) as Oral, Embodied World Models for Decision Making (EWM), Aligning Reinforcement Learning Experimentalists and Theorists (ARLET), and Scaling Environments for Agents (SEA)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19088 2026-06-18 cs.RO 新提交 83%

ReSiReg: Towards Spatially Consistent Semantics in Language-Conditioned Robotic Tasks

ReSiReg:面向语言条件机器人任务的空间一致语义

Simon Schwaiger, David Seyser, Alessandro Scherl, Wilfried Wöber, Gerald Steinbauer-Wagner

机构 * Graz University of Technology, Institute of Software Engineering and Artificial Intelligence(格拉茨技术大学,软件工程与人工智能研究所) University of Applied Sciences Technikum Wien, Department of Industrial Engineering(维也纳应用科技大学,工业工程系) University of Alicante, Department of Computer Technology(阿利坎特大学,计算机技术系) University of Natural Resources and Life Sciences, Institute for Integrative Nature Conservation Research(自然资源与生命科学大学,整合自然保护研究 institute)

专题命中 视觉推理 :VLM(summary_cn,abstract);vision-language model(abstract)

AI总结 提出ReSiReg方法,通过重构空间一致的VLM中间特征,改善密集语言接地检索,在OVSS和3D映射中提升空间一致性,并发布紧凑的25M参数VLM模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01662 2026-06-02 cs.RO 83%

PLanAR: Planning-Language-Grounded Agentic Reasoning for Robot Manipulation

PLanAR:面向机器人操作的规划语言基础智能推理

Pengyuan Guo, Zhonghao Mai, Zhengtong Xu, Kaidi Zhang, Quan Khanh Luu, Heng Zhang, Zichen Miao, Arash Ajoudani, Zachary Kingston, Qiang Qiu, Yu She

机构 * Purdue University(普渡大学) Istituto Italiano di Tecnologia(意大利理工研究院)

专题命中 视觉推理 :VLM(summary_cn,abstract);vision-language model(abstract)

AI总结 提出PLanAR框架,通过规划语言接口定义VLM推理空间,实现开放词汇的长时域机器人操作,并支持逐步验证与重规划。

Comments New version with updated framing, contributions, experiments, and figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15407 2026-05-26 cs.AI cs.CV cs.LG 83%

IPR-1: Interactive Physical Reasoner

IPR-1:交互式物理推理器

Mingyu Zhang, Lifeng Zhuo, Tianxi Tan, Guocan Xie, Xian Nie, Yan Li, Renjie Zhao, Zizhu He, Ziyu Wang, Jiting Cai, Yong-Lu Li

机构 * CARNEGIE MELLON UNIVERSITY(卡内基梅隆大学)

专题命中 视觉推理 :VLM(summary_cn,abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 提出IPR模型,通过世界模型滚动评分和强化VLM策略,结合物理中心动作代码PhysCode,在1000+异构游戏基准上实现鲁棒的物理推理,性能超越GPT-5并零样本迁移至未见游戏。

Comments Accepted by CVPR 2026. 13 pages of main text and 20 pages of appendices. Project page: https://mybearyzhang.github.io/ipr-1

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10806 2026-05-12 cs.CV cs.AI cs.LG 83%

PhyGround: Benchmarking Physical Reasoning in Generative World Models

PhyGround:用于生成世界模型中物理推理的基准测试

Juyi Lin, Arash Akbari, Yumei He, Lin Zhao, Haichao Zhang, Arman Akbari, Xingchen Xu, Zoe Y. Lu, Enfu Nan, Hokin Deng, Edmund Yeh, Sarah Ostadabbas, Yun Fu, Jennifer Dy, Pu Zhao, Yanzhi Wang

机构 * Northeastern University(东北大学) Tulane University(路易斯安那州立大学) University of Washington(华盛顿大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 视觉推理 :VLM(summary_cn,abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 PhyGround通过250个精心设计的提示和13种物理定律的分类,评估视频生成中的物理推理能力,采用大规模人工研究验证并发布专用VLM评估工具PhyJudge-9B,显著降低偏见。

Comments Preprint. 56 pages, 39 figures, 40 tables. Project page: https://phyground.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01371 2026-05-05 cs.RO 83%

ESARBench: A Benchmark for Agentic UAV Embodied Search and Rescue

ESARBench: 一种用于代理无人机体感知搜索与救援的基准

Daoxuan Zhang, Ping Chen, Jianyi Zhou, Shuo Yang

机构 * Harbin Institute of Technology(哈尔滨工业大学)

专题命中 视觉推理 :MLLM(summary_cn,abstract);multimodal large language model(abstract)

AI总结 本文提出ESARBench,首个用于评估基于MLLM的无人机在高真实感搜索与救援场景中的基准,通过构建高保真环境和600个任务数据集,揭示了ESAR中的关键瓶颈。

Comments 20 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17830 2026-04-21 cs.RO 83%

SYMBOLIZER: Symbolic Model-free Task Planning with VLMs

SYMBOLIZER:基于VLMs的符号模型无关任务规划

Sami Azirar, Zlatan Ajanovic, Hermann Blum

机构 * RWTH Aachen(亚琛理工大学) University of Bonn(波恩大学) Lamarr Institute for Machine Learning and Artificial Intelligence(拉马尔人工智能与机器学习研究院)

专题命中 视觉推理 :VLM(summary_cn,abstract);visual language model(abstract)

AI总结 本文提出SYMBOLIZER框架,利用VLMs将图像转化为符号状态,结合启发式搜索实现跨领域任务规划,优于直接VLM规划并可与基于启发式的传统方法媲美。

Comments under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17645 2026-02-25 cs.CV cs.AI cs.CL cs.LG cs.MM 83%

HoloLLM: Multisensory Foundation Model for Language-Grounded Human Sensing and Reasoning

HoloLLM:面向语言基础的人感知与推理的多感官基础模型

Chuhao Zhou, Jianfei Yang

机构 * MARS Lab, Nanyang Technological University(南洋理工大学MARS实验室)

专题命中 视觉推理 :vision-language model(abstract);VLM(abstract);multimodal large language model(abstract);MLLM(abstract)

AI总结 HoloLLM通过整合LiDAR、红外、毫米波雷达和Wi-Fi等多感官数据,提升语言基础的人感知与推理能力,实验表明其在真实场景中的性能提升达30%。

Comments Camera-ready version. Accepted at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08990 2026-08-17 cs.CV 版本更新 83%

ActFER: Agentic Facial Expression Recognition via Active Tool-Augmented Visual Reasoning

ActFER: 通过主动工具增强的视觉推理实现代理面部表情识别

Shifeng Liu, Zhengye Zhang, Sirui Zhao, Xinglong Mao, Zhehan Kan, Zhixiang Wei, Shiwei Wu, Chaoyou Fu, Tong Xu, Enhong Chen

专题命中 视觉推理 :visual reasoning(title);multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

AI总结 ActFER通过主动视觉证据获取和多模态推理提升面部表情识别,采用UC-GRPO算法优化局部检查和情绪感知,实验显示其在AU预测准确率上显著优于传统方法。

Comments 10 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13344 2026-08-14 cs.AI 新提交 83%

LongEarth-R1: Benchmarking and Aligning Vision-Language Models for Long-Horizon Earth Observation Reasoning

LongEarth-R1:用于长时序地球观测推理的视觉语言模型基准测试与对齐

Yupan Ding, Jing Xiao, Zhenyuan Zhang, Chaofeng Chen, Liang Liao, Gui-Song Xia, Mi Wang

专题命中 视觉推理 :vision-language model(title,abstract);grounding(abstract);分类 cs.AI

AI总结 该研究推出长时序地球观测推理基准LongEarth-Bench,开发LongEarth-R1模型,在全部12项长序列遥感推理任务中表现最优,同时在标准遥感基准上保持竞争力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12920 2026-08-14 cs.CV 新提交 83%

TennisVAR: A Stroke-Evidence-Grounded Multimodal Large Language Model for Tactical Reasoning in Tennis Videos

TennisVAR:一种基于击球证据的多模态大语言模型,用于网球视频中的战术推理

Yifan Mei, Qingling Shi, Changli Wu, Jiayuan Rao, Jiayi Ji, Liujuan Cao

专题命中 视觉推理 :multimodal large language model(title,abstract);grounding(abstract);分类 cs.CV

AI总结 该研究针对网球视频理解的感知与理解差距,提出回合级战术推理任务,构建专家标注基准TRACE,开发基于证据的多模态大语言模型TennisVAR,实现网球视频的战术推理。

Comments Project Page: https://whynotgit2025.github.io/TennisVAR/

详情

展开后加载摘要…

URL PDF HTML 收藏