arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 4454 信号源:cs.CV, cs.AI, cs.LG

1. 视觉推理 4454 篇

2509.23652 2025-10-02 cs.CV cs.AI 81%

ReWatch-R1: Boosting Complex Video Reasoning in Large Vision-Language Models through Agentic Data Synthesis

Congzhi Zhang, Zhibin Wang, Yinchao Ma, Jiawei Peng, Yihan Wang, Qiang Zhou, Jun Song, Bo Zheng

机构 * Alibaba Group(阿里巴巴集团)

专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25160 2025-09-30 cs.CV cs.AI cs.CL 81%

GSM8K-V: Can Vision Language Models Solve Grade School Math Word Problems in Visual Contexts

Fan Yuan, Yuchen Yan, Yifan Jiang, Haoran Zhao, Tao Feng, Jinyan Chen, Yanwei Lou, Wenqi Zhang, Yongliang Shen, Weiming Lu, Jun Xiao, Yueting Zhuang

专题命中 视觉推理 :vision language model(title,abstract);分类 cs.CV、cs.AI

Comments 68 pages, 6 figures, Project Page: https://zju-real.github.io/GSM8K-V Code: https://github.com/ZJU-REAL/GSM8K-V Datasets: https://huggingface.co/datasets/ZJU-REAL/GSM8K-V

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24776 2025-09-30 cs.CV cs.AI 81%

VTPerception-R1: Enhancing Multimodal Reasoning via Explicit Visual and Textual Perceptual Grounding

Yizhuo Ding, Mingkang Chen, Zhibang Feng, Tong Xiao, Wanying Qu, Wenqi Shao, Yanwei Fu

机构 * Fudan University(复旦大学) Shanghai AI Laboratory(上海人工智能实验室) The University of Hong Kong(香港大学) Shenzhen University(深圳大学) University of Science and Technology of China(中国科学技术大学)

专题命中 视觉推理 :grounding(title);multimodal large language model(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23827 2025-09-30 cs.CV cs.LG 81%

Assessing Visual Privacy Risks in Multimodal AI: A Novel Taxonomy-Grounded Evaluation of Vision-Language Models

Efthymios Tsaprazlis, Tiantian Feng, Anil Ramakrishna, Rahul Gupta, Shrikanth Narayanan

机构 * University of Southern California(南加州大学) Amazon AGI(亚马逊人工智能实验室)

专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.CV、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.07815 2025-09-12 cs.RO cs.CV cs.LG 81%

Imagine, Verify, Execute: Memory-guided Agentic Exploration with Vision-Language Models

Seungjae Lee, Daniel Ekpo, Haowen Liu, Furong Huang, Abhinav Shrivastava, Jia-Bin Huang

专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.CV、cs.LG

Comments Project webpage: https://ive-robot.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.08270 2025-09-11 cs.LG cs.AI 81%

Interpretable Physics Reasoning and Performance Taxonomy in Vision-Language Models

Pranav Pawar, Kavish Shah, Akshat Bhalani, Komal Kasat, Dev Mittal, Hadi Gala, Deepali Patil, Nikita Raichada, Monali Deshmukh

专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04772 2025-09-08 cs.CV cs.AI 81%

FloodVision: Urban Flood Depth Estimation Using Foundation Vision-Language Models and Domain Knowledge Graph

Zhangding Liu, Neda Mohammadi, John E. Taylor

专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15576 2025-08-29 cs.CV cs.LG 81%

Visual Perturbation and Adaptive Hard Negative Contrastive Learning for Compositional Reasoning in Vision-Language Models

Xin Huang, Ruibin Li, Tong Jia, Wei Zheng, Ya Wang

机构 * School of Artificial Intelligence and Software Engineering, Nanyang Normal University, Henan, China(人工智能与软件工程学院,南阳师范学院,河南) Institute for Artificial Intelligence, Peking University, Beijing, China(人工智能研究院,北京大学,北京) Collaborative Innovation Center of Intelligent Explosion-proof Equipment, Henan, China(智能防爆设备协同创新中心,河南)

专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.CV、cs.LG

Comments Accepted at the International Joint Conference on Artificial Intelligence (IJCAI 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18179 2025-08-26 cs.AI cs.CV 81%

SEAM: Semantically Equivalent Across Modalities Benchmark for Vision-Language Models

Zhenwei Tang, Difan Jiao, Blair Yang, Ashton Anderson

机构 * Department of Computer Science, University of Toronto(多伦多大学计算机科学系) Coolwei AI Lab(Coolwei人工智能实验室)

专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.CV、cs.AI

Comments COLM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.18684 2025-08-18 cs.CV cs.AI cs.RO 81%

SORT3D: Spatial Object-centric Reasoning Toolbox for Zero-Shot 3D Grounding Using Large Language Models

Nader Zantout, Haochen Zhang, Pujith Kachana, Jinkai Qiu, Guofei Chen, Ji Zhang, Wenshan Wang

机构 * Carnegie Mellon University, Robotics Institute(卡内基梅隆大学,机器人研究所)

专题命中 视觉推理 :grounding(title,abstract);分类 cs.CV、cs.AI

Comments 8 pages, 6 figures, published in IROS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.15485 2025-08-15 cs.CV cs.AI cs.CL 81%

CAPTURe: Evaluating Spatial Reasoning in Vision Language Models via Occluded Object Counting

Atin Pothiraj, Elias Stengel-Eskin, Jaemin Cho, Mohit Bansal

机构 * UNC Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 视觉推理 :vision language model(title);vision-language model(abstract);分类 cs.CV、cs.AI

Comments ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.23382 2025-08-01 cs.CL cs.AI cs.CV 81%

MPCC: A Novel Benchmark for Multimodal Planning with Complex Constraints in Multimodal Large Language Models

Yiyan Ji, Haoran Chen, Qiguang Chen, Chengyue Wu, Libo Qin, Wanxiang Che

机构 * Harbin Institute of Technology(哈尔滨工业大学) The University of Hong Kong(香港大学) Central South University(中南大学)

专题命中 视觉推理 :multimodal large language model(title);MLLM(abstract);分类 cs.CV、cs.AI

Comments Accepted to ACM Multimedia 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.23956 2025-07-24 cs.CV cs.AI 81%

AirCache: Activating Inter-modal Relevancy KV Cache Compression for Efficient Large Vision-Language Model Inference

Kai Huang, Hao Zou, Bochen Wang, Ye Xi, Zhen Xie, Hao Wang

机构 * Alibaba Group(阿里巴巴集团)

专题命中 视觉推理 :vision-language model(title);visual language model(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.11761 2025-07-17 cs.CV cs.AI 81%

Beyond Task-Specific Reasoning: A Unified Conditional Generative Framework for Abstract Visual Reasoning

Fan Shi, Bin Li, Xiangyang Xue

机构 * Shanghai Key Laboratory of Intelligent Information Processing, School of Computer Science, Fudan University(上海智能信息处理重点实验室,计算机科学学院,复旦大学)

专题命中 视觉推理 :visual reasoning(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21876 2025-06-30 cs.CL cs.AI cs.CV 81%

Do Vision-Language Models Have Internal World Models? Towards an Atomic Evaluation

Qiyue Gao, Xinyu Pi, Kevin Liu, Junrong Chen, Ruolan Yang, Xinqi Huang, Xinyu Fang, Lu Sun, Gautham Kishore, Bo Ai, Stone Tao, Mengyang Liu, Jiaxi Yang, Chao-Jung Lai, Chuanyang Jin, Jiannan Xiang, Benhao Huang, Zeming Chen, David Danks, Hao Su, Tianmin Shu, Ziqiao Ma, Lianhui Qin, Zhiting Hu

机构 * UC San Diego JHU Cornell Tech EPFL UMich

专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.CV、cs.AI

Comments ACL 2025 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09965 2025-06-23 cs.CV cs.AI 81%

Reinforcing Spatial Reasoning in Vision-Language Models with Interwoven Thinking and Visual Drawing

Junfei Wu, Jian Guan, Kaituo Feng, Qiang Liu, Shu Wu, Liang Wang, Wei Wu, Tieniu Tan

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学) Ant Group(蚂蚁集团) CUHK MMLab(香港中文大学MMLab) Nanjing University(南京大学)

专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.19409 2025-06-12 cs.CV cs.CL cs.LG 81%

ImageChain: Advancing Sequential Image-to-Text Reasoning in Multimodal Large Language Models

Danae Sánchez Villegas, Ingo Ziegler, Desmond Elliott

机构 * University of Copenhagen(哥本哈根大学)

专题命中 视觉推理 :multimodal large language model(title,abstract);分类 cs.CV、cs.LG

Comments Code, dataset, and checkpoints are publicly available at https://github.com/danaesavi/ImageChain; v2: added human annotation study to validate SimRate

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08927 2025-06-11 cs.CV cs.AI cs.CL 81%

Socratic-MCTS: Test-Time Visual Reasoning by Asking the Right Questions

David Acuna, Ximing Lu, Jaehun Jung, Hyunwoo Kim, Amlan Kar, Sanja Fidler, Yejin Choi

机构 * NVIDIA University of Washington(华盛顿大学) University of Toronto(多伦多大学)

专题命中 视觉推理 :visual reasoning(title);vision-language model(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11300 2025-06-10 cs.CL cs.AI cs.CV 81%

CORDIAL: Can Multimodal Large Language Models Effectively Understand Coherence Relationships?

Aashish Anantha Ramakrishnan, Aadarsh Anantha Ramakrishnan, Dongwon Lee

机构 * The Pennsylvania State University(宾夕法尼亚州立大学) National Institute of Technology, Tiruchirappalli(特里奇里帕利学院)

专题命中 视觉推理 :multimodal large language model(title,abstract);分类 cs.CV、cs.AI

Comments To appear at the 63rd Annual Meeting of the Association for Computational Linguistics (ACL), Vienna, Austria, July 2025, https://2025.aclweb.org/

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05883 2025-06-09 cs.CV cs.AI 81%

HMVLM: Multistage Reasoning-Enhanced Vision-Language Model for Long-Tailed Driving Scenarios

Daming Wang, Yuhao Song, Zijian He, Kangliang Chen, Xing Pan, Lu Deng, Weihao Gu

专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.CV、cs.AI

Comments WOD Vision-based End-to-End Driving Challenge

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04688 2025-06-06 cs.CL cs.AI cs.CV 81%

MMRefine: Unveiling the Obstacles to Robust Refinement in Multimodal Large Language Models

Gio Paik, Geewook Kim, Jinbae Im

专题命中 视觉推理 :multimodal large language model(title,abstract);分类 cs.CV、cs.AI

Comments ACL Findings 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24139 2025-06-04 cs.CV cs.AI 81%

S4-Driver: Scalable Self-Supervised Driving Multimodal Large Language Modelwith Spatio-Temporal Visual Representation

Yichen Xie, Runsheng Xu, Tong He, Jyh-Jing Hwang, Katie Luo, Jingwei Ji, Hubert Lin, Letian Chen, Yiren Lu, Zhaoqi Leng, Dragomir Anguelov, Mingxing Tan

机构 * UC Berkeley(加州大学伯克利分校) Waymo LLC(Waymo公司) Cornell University(康奈尔大学) Georgia Institute of Technology(佐治亚理工学院)

专题命中 视觉推理 :multimodal large language model(title,abstract);分类 cs.CV、cs.AI

Comments Accepted by CVPR2025; Project website: s4-driver.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02096 2025-06-04 cs.LG cs.CL cs.CV 81%

SynthRL: Scaling Visual Reasoning with Verifiable Data Synthesis

Zijian Wu, Jinjie Ni, Xiangyan Liu, Zichen Liu, Hang Yan, Michael Qizhe Shieh

机构 * National University of Singapore(新加坡国立大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 视觉推理 :visual reasoning(title);vision-language model(abstract);分类 cs.CV、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20021 2025-05-27 cs.CV cs.AI 81%

Decomposing Complex Visual Comprehension into Atomic Visual Skills for Vision Language Models

Hyunsik Chae, Seungwoo Yoon, Jaden Park, Chloe Yewon Chun, Yongin Cho, Mu Cai, Yong Jae Lee, Ernest K. Ryu

机构 * Seoul National University(首尔国立大学) UCLA(加州大学洛杉矶分校) University of Wisconsin–Madison(威斯康星大学麦迪逊分校) Google DeepMind(谷歌DeepMind)

专题命中 视觉推理 :vision language model(title);vision-language model(abstract);分类 cs.CV、cs.AI

Comments 69 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18536 2025-05-27 cs.CL cs.AI cs.CV 81%

Reinforcement Fine-Tuning Powers Reasoning Capability of Multimodal Large Language Models

Haoyuan Sun, Jiaqi Wu, Bo Xia, Yifu Luo, Yifei Zhao, Kai Qin, Xufei Lv, Tiantian Zhang, Yongzhe Chang, Xueqian Wang

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院,清华大学)

专题命中 视觉推理 :multimodal large language model(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.04911 2025-05-09 cs.CV cs.AI cs.CL 81%

SpatialPrompting: Keyframe-driven Zero-Shot Spatial Reasoning with Off-the-Shelf Multimodal Large Language Models

Shun Taguchi, Hideki Deguchi, Takumi Hamazaki, Hiroyuki Sakai

机构 * Toyota Central R&D Labs., Inc.(丰田中央研究实验室)

专题命中 视觉推理 :multimodal large language model(title,abstract);分类 cs.CV、cs.AI

Comments 18 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.08837 2025-05-09 cs.LG cs.AI 81%

VL-Rethinker: Incentivizing Self-Reflection of Vision-Language Models with Reinforcement Learning

Haozhe Wang, Chao Qu, Zuming Huang, Wei Chu, Fangzhen Lin, Wenhu Chen

机构 * HKUST(香港科技大学) University of Waterloo(滑铁卢大学) Vector Institute(向量研究所)

专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.AI、cs.LG

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.20199 2025-04-30 cs.CV cs.AI cs.CL 81%

Weaving Context Across Images: Improving Vision-Language Models through Focus-Centric Visual Chains

Juntian Zhang, Chuanqi cheng, Yuhan Liu, Wei Liu, Jian Luan, Rui Yan

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学人工智能学院)

专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.06462 2025-04-21 cs.CV cs.LG 81%

VCR: A Task for Pixel-Level Complex Reasoning in Vision Language Models via Restoring Occluded Text

Tianyu Zhang, Suyuchen Wang, Lu Li, Ge Zhang, Perouz Taslakian, Sai Rajeswar, Jie Fu, Bang Liu, Yoshua Bengio

专题命中 视觉推理 :vision language model(title,abstract);分类 cs.CV、cs.LG

Comments Accepted at ICLR 2025. Original paper name: VCR: Visual Caption Restoration

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.04447 2025-04-14 cs.AI cs.CV 81%

EgoPlan-Bench2: A Benchmark for Multimodal Large Language Model Planning in Real-World Scenarios

Lu Qiu, Yi Chen, Yuying Ge, Yixiao Ge, Ying Shan, Xihui Liu

专题命中 视觉推理 :multimodal large language model(title,abstract);分类 cs.CV、cs.AI

Comments Code & data are available at: https://qiulu66.github.io/egoplanbench2/

详情

展开后加载摘要…

URL PDF HTML 收藏