arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 26117 信号源:cs.CV, cs.AI, cs.LG

1. 视觉推理 4478 篇

2502.19409 2025-06-12 cs.CV cs.CL cs.LG 81%

ImageChain: Advancing Sequential Image-to-Text Reasoning in Multimodal Large Language Models

Danae Sánchez Villegas, Ingo Ziegler, Desmond Elliott

机构 * University of Copenhagen(哥本哈根大学)

专题命中 视觉推理 :multimodal large language model(title,abstract);分类 cs.CV、cs.LG

Comments Code, dataset, and checkpoints are publicly available at https://github.com/danaesavi/ImageChain; v2: added human annotation study to validate SimRate

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08927 2025-06-11 cs.CV cs.AI cs.CL 81%

Socratic-MCTS: Test-Time Visual Reasoning by Asking the Right Questions

David Acuna, Ximing Lu, Jaehun Jung, Hyunwoo Kim, Amlan Kar, Sanja Fidler, Yejin Choi

机构 * NVIDIA University of Washington(华盛顿大学) University of Toronto(多伦多大学)

专题命中 视觉推理 :visual reasoning(title);vision-language model(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11300 2025-06-10 cs.CL cs.AI cs.CV 81%

CORDIAL: Can Multimodal Large Language Models Effectively Understand Coherence Relationships?

Aashish Anantha Ramakrishnan, Aadarsh Anantha Ramakrishnan, Dongwon Lee

机构 * The Pennsylvania State University(宾夕法尼亚州立大学) National Institute of Technology, Tiruchirappalli(特里奇里帕利学院)

专题命中 视觉推理 :multimodal large language model(title,abstract);分类 cs.CV、cs.AI

Comments To appear at the 63rd Annual Meeting of the Association for Computational Linguistics (ACL), Vienna, Austria, July 2025, https://2025.aclweb.org/

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05883 2025-06-09 cs.CV cs.AI 81%

HMVLM: Multistage Reasoning-Enhanced Vision-Language Model for Long-Tailed Driving Scenarios

Daming Wang, Yuhao Song, Zijian He, Kangliang Chen, Xing Pan, Lu Deng, Weihao Gu

专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.CV、cs.AI

Comments WOD Vision-based End-to-End Driving Challenge

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04688 2025-06-06 cs.CL cs.AI cs.CV 81%

MMRefine: Unveiling the Obstacles to Robust Refinement in Multimodal Large Language Models

Gio Paik, Geewook Kim, Jinbae Im

专题命中 视觉推理 :multimodal large language model(title,abstract);分类 cs.CV、cs.AI

Comments ACL Findings 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24139 2025-06-04 cs.CV cs.AI 81%

S4-Driver: Scalable Self-Supervised Driving Multimodal Large Language Modelwith Spatio-Temporal Visual Representation

Yichen Xie, Runsheng Xu, Tong He, Jyh-Jing Hwang, Katie Luo, Jingwei Ji, Hubert Lin, Letian Chen, Yiren Lu, Zhaoqi Leng, Dragomir Anguelov, Mingxing Tan

机构 * UC Berkeley(加州大学伯克利分校) Waymo LLC(Waymo公司) Cornell University(康奈尔大学) Georgia Institute of Technology(佐治亚理工学院)

专题命中 视觉推理 :multimodal large language model(title,abstract);分类 cs.CV、cs.AI

Comments Accepted by CVPR2025; Project website: s4-driver.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02096 2025-06-04 cs.LG cs.CL cs.CV 81%

SynthRL: Scaling Visual Reasoning with Verifiable Data Synthesis

Zijian Wu, Jinjie Ni, Xiangyan Liu, Zichen Liu, Hang Yan, Michael Qizhe Shieh

机构 * National University of Singapore(新加坡国立大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 视觉推理 :visual reasoning(title);vision-language model(abstract);分类 cs.CV、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20021 2025-05-27 cs.CV cs.AI 81%

Decomposing Complex Visual Comprehension into Atomic Visual Skills for Vision Language Models

Hyunsik Chae, Seungwoo Yoon, Jaden Park, Chloe Yewon Chun, Yongin Cho, Mu Cai, Yong Jae Lee, Ernest K. Ryu

机构 * Seoul National University(首尔国立大学) UCLA(加州大学洛杉矶分校) University of Wisconsin–Madison(威斯康星大学麦迪逊分校) Google DeepMind(谷歌DeepMind)

专题命中 视觉推理 :vision language model(title);vision-language model(abstract);分类 cs.CV、cs.AI

Comments 69 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18536 2025-05-27 cs.CL cs.AI cs.CV 81%

Reinforcement Fine-Tuning Powers Reasoning Capability of Multimodal Large Language Models

Haoyuan Sun, Jiaqi Wu, Bo Xia, Yifu Luo, Yifei Zhao, Kai Qin, Xufei Lv, Tiantian Zhang, Yongzhe Chang, Xueqian Wang

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院,清华大学)

专题命中 视觉推理 :multimodal large language model(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.04911 2025-05-09 cs.CV cs.AI cs.CL 81%

SpatialPrompting: Keyframe-driven Zero-Shot Spatial Reasoning with Off-the-Shelf Multimodal Large Language Models

Shun Taguchi, Hideki Deguchi, Takumi Hamazaki, Hiroyuki Sakai

机构 * Toyota Central R&D Labs., Inc.(丰田中央研究实验室)

专题命中 视觉推理 :multimodal large language model(title,abstract);分类 cs.CV、cs.AI

Comments 18 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.08837 2025-05-09 cs.LG cs.AI 81%

VL-Rethinker: Incentivizing Self-Reflection of Vision-Language Models with Reinforcement Learning

Haozhe Wang, Chao Qu, Zuming Huang, Wei Chu, Fangzhen Lin, Wenhu Chen

机构 * HKUST(香港科技大学) University of Waterloo(滑铁卢大学) Vector Institute(向量研究所)

专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.AI、cs.LG

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.20199 2025-04-30 cs.CV cs.AI cs.CL 81%

Weaving Context Across Images: Improving Vision-Language Models through Focus-Centric Visual Chains

Juntian Zhang, Chuanqi cheng, Yuhan Liu, Wei Liu, Jian Luan, Rui Yan

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学人工智能学院)

专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.06462 2025-04-21 cs.CV cs.LG 81%

VCR: A Task for Pixel-Level Complex Reasoning in Vision Language Models via Restoring Occluded Text

Tianyu Zhang, Suyuchen Wang, Lu Li, Ge Zhang, Perouz Taslakian, Sai Rajeswar, Jie Fu, Bang Liu, Yoshua Bengio

专题命中 视觉推理 :vision language model(title,abstract);分类 cs.CV、cs.LG

Comments Accepted at ICLR 2025. Original paper name: VCR: Visual Caption Restoration

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.04447 2025-04-14 cs.AI cs.CV 81%

EgoPlan-Bench2: A Benchmark for Multimodal Large Language Model Planning in Real-World Scenarios

Lu Qiu, Yi Chen, Yuying Ge, Yixiao Ge, Ying Shan, Xihui Liu

专题命中 视觉推理 :multimodal large language model(title,abstract);分类 cs.CV、cs.AI

Comments Code & data are available at: https://qiulu66.github.io/egoplanbench2/

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.05782 2025-04-09 cs.CV cs.AI 81%

MDK12-Bench: A Multi-Discipline Benchmark for Evaluating Reasoning in Multimodal Large Language Models

Pengfei Zhou, Fanrui Zhang, Xiaopeng Peng, Zhaopan Xu, Jiaxin Ai, Yansheng Qiu, Chuanhao Li, Zhen Li, Ming Li, Yukang Feng, Jianwen Sun, Haoquan Zhang, Zizhen Li, Xiaofeng Mao, Wangbo Zhao, Kai Wang, Xiaojun Chang, Wenqi Shao, Yang You, Kaipeng Zhang

专题命中 视觉推理 :multimodal large language model(title,abstract);分类 cs.CV、cs.AI

Comments 11 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.04839 2025-04-08 cs.CV cs.AI cs.CL 81%

Advancing Multimodal In-Context Learning in Large Vision-Language Models with Task-aware Demonstrations

Yanshu Li

专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.CV、cs.AI

Comments Accepted by ICLR 2025 Workshop on Reasoning and Planning for LLMs, 25 pages, 13 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.02799 2025-04-04 cs.CV cs.AI 81%

Systematic Evaluation of Large Vision-Language Models for Surgical Artificial Intelligence

Anita Rau, Mark Endo, Josiah Aklilu, Jaewoo Heo, Khaled Saab, Alberto Paderno, Jeffrey Jopling, F. Christopher Holsinger, Serena Yeung-Levy

专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.10380 2025-04-02 cs.CV cs.AI cs.CL cs.IR 81%

NTSEBENCH: Cognitive Reasoning Benchmark for Vision Language Models

Pranshu Pandya, Vatsal Gupta, Agney S Talwarr, Tushar Kataria, Dan Roth, Vivek Gupta

专题命中 视觉推理 :vision language model(title);visual reasoning(abstract);分类 cs.CV、cs.AI

Comments 28 pages, 3 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.16425 2025-03-27 cs.CV cs.AI cs.RO 81%

TopV-Nav: Unlocking the Top-View Spatial Reasoning Potential of MLLM for Zero-shot Object Navigation

Linqing Zhong, Chen Gao, Zihan Ding, Yue Liao, Huimin Ma, Shifeng Zhang, Xu Zhou, Si Liu

专题命中 视觉推理 :MLLM(title,abstract);分类 cs.CV、cs.AI

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.15886 2025-03-24 cs.CV cs.LG 81%

Enhancing Zero-Shot Image Recognition in Vision-Language Models through Human-like Concept Guidance

Hui Liu, Wenya Wang, Kecheng Chen, Jie Liu, Yibing Liu, Tiexin Qin, Peisong He, Xinghao Jiang, Haoliang Li

专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.CV、cs.LG

Comments 21 pages, 7 figures 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.01550 2025-03-24 cs.CV cs.AI 81%

SeqAfford: Sequential 3D Affordance Reasoning via Multimodal Large Language Model

Chunlin Yu, Hanqing Wang, Ye Shi, Haoyang Luo, Sibei Yang, Jingyi Yu, Jingya Wang

专题命中 视觉推理 :multimodal large language model(title);grounding(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.02172 2025-03-19 cs.CV cs.AI cs.CL 81%

VISCO: Benchmarking Fine-Grained Critique and Correction Towards Self-Improvement in Visual Reasoning

Xueqing Wu, Yuheng Ding, Bingxuan Li, Pan Lu, Da Yin, Kai-Wei Chang, Nanyun Peng

专题命中 视觉推理 :visual reasoning(title);vision-language model(abstract);分类 cs.CV、cs.AI

Comments CVPR 2025. https://visco-benchmark.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.12932 2025-03-11 cs.CV cs.AI 81%

CoMT: A Novel Benchmark for Chain of Multi-modal Thought on Large Vision-Language Models

Zihui Cheng, Qiguang Chen, Jin Zhang, Hao Fei, Xiaocheng Feng, Wanxiang Che, Min Li, Libo Qin

专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.CV、cs.AI

Comments Accepted at AAAI 2025; Project Page: https://github.com/czhhzc/CoMT

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.00836 2025-02-25 cs.CV cs.AI cs.CL 81%

DynaMath: A Dynamic Visual Benchmark for Evaluating Mathematical Reasoning Robustness of Vision Language Models

Chengke Zou, Xingang Guo, Rui Yang, Junyu Zhang, Bin Hu, Huan Zhang

专题命中 视觉推理 :vision language model(title);vision-language model(abstract);分类 cs.CV、cs.AI

Comments Accepted by ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.12381 2025-02-19 cs.CV cs.AI 81%

HumanEval-V: Benchmarking High-Level Visual Reasoning with Complex Diagrams in Coding Tasks

Fengji Zhang, Linquan Wu, Huiyu Bai, Guancheng Lin, Xiao Li, Xiao Yu, Yue Wang, Bei Chen, Jacky Keung

专题命中 视觉推理 :visual reasoning(title,abstract);分类 cs.CV、cs.AI

Comments homepage https://humaneval-v.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.11968 2025-01-22 cs.AI cs.LG 81%

Bridging Visualization and Optimization: Multimodal Large Language Models on Graph-Structured Combinatorial Optimization

Jie Zhao, Kang Hao Cheong, Witold Pedrycz

专题命中 视觉推理 :multimodal large language model(title,abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.18319 2025-01-03 cs.CV cs.AI 81%

Mulberry: Empowering MLLM with o1-like Reasoning and Reflection via Collective Monte Carlo Tree Search

Huanjin Yao, Jiaxing Huang, Wenhao Wu, Jingyi Zhang, Yibo Wang, Shunyu Liu, Yingjie Wang, Yuxin Song, Haocheng Feng, Li Shen, Dacheng Tao

专题命中 视觉推理 :MLLM(title,abstract);分类 cs.CV、cs.AI

Comments Technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.15462 2024-12-23 cs.RO cs.AI cs.CL cs.HC cs.LG 81%

TalkWithMachines: Enhancing Human-Robot Interaction for Interpretable Industrial Robotics Through Large/Vision Language Models

Ammar N. Abbas, Csaba Beleznai

专题命中 视觉推理 :vision language model(title,abstract);分类 cs.AI、cs.LG

Comments This paper has been accepted for publication in the proceedings of the 2024 Eighth IEEE International Conference on Robotic Computing (IRC)

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.12121 2024-12-17 cs.CL cs.AI cs.CV cs.MM 81%

IRR: Image Review Ranking Framework for Evaluating Vision-Language Models

Kazuki Hayashi, Kazuma Onishi, Toma Suzuki, Yusuke Ide, Seiji Gobara, Shigeki Saito, Yusuke Sakai, Hidetaka Kamigaito, Katsuhiko Hayashi, Taro Watanabe

专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.CV、cs.AI

Comments 18pages, Accepted at COLING25

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.10057 2024-11-07 cs.CV cs.AI 81%

First Multi-Dimensional Evaluation of Flowchart Comprehension for Multimodal Large Language Models

Enming Zhang, Ruobing Yao, Huanyong Liu, Junhui Yu, Jiale Wang

专题命中 视觉推理 :multimodal large language model(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏