arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 4454 信号源:cs.CV, cs.AI, cs.LG

1. 视觉推理 4454 篇

2504.05782 2025-04-09 cs.CV cs.AI 81%

MDK12-Bench: A Multi-Discipline Benchmark for Evaluating Reasoning in Multimodal Large Language Models

Pengfei Zhou, Fanrui Zhang, Xiaopeng Peng, Zhaopan Xu, Jiaxin Ai, Yansheng Qiu, Chuanhao Li, Zhen Li, Ming Li, Yukang Feng, Jianwen Sun, Haoquan Zhang, Zizhen Li, Xiaofeng Mao, Wangbo Zhao, Kai Wang, Xiaojun Chang, Wenqi Shao, Yang You, Kaipeng Zhang

专题命中 视觉推理 :multimodal large language model(title,abstract);分类 cs.CV、cs.AI

Comments 11 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.04839 2025-04-08 cs.CV cs.AI cs.CL 81%

Advancing Multimodal In-Context Learning in Large Vision-Language Models with Task-aware Demonstrations

Yanshu Li

专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.CV、cs.AI

Comments Accepted by ICLR 2025 Workshop on Reasoning and Planning for LLMs, 25 pages, 13 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.02799 2025-04-04 cs.CV cs.AI 81%

Systematic Evaluation of Large Vision-Language Models for Surgical Artificial Intelligence

Anita Rau, Mark Endo, Josiah Aklilu, Jaewoo Heo, Khaled Saab, Alberto Paderno, Jeffrey Jopling, F. Christopher Holsinger, Serena Yeung-Levy

专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.10380 2025-04-02 cs.CV cs.AI cs.CL cs.IR 81%

NTSEBENCH: Cognitive Reasoning Benchmark for Vision Language Models

Pranshu Pandya, Vatsal Gupta, Agney S Talwarr, Tushar Kataria, Dan Roth, Vivek Gupta

专题命中 视觉推理 :vision language model(title);visual reasoning(abstract);分类 cs.CV、cs.AI

Comments 28 pages, 3 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.16425 2025-03-27 cs.CV cs.AI cs.RO 81%

TopV-Nav: Unlocking the Top-View Spatial Reasoning Potential of MLLM for Zero-shot Object Navigation

Linqing Zhong, Chen Gao, Zihan Ding, Yue Liao, Huimin Ma, Shifeng Zhang, Xu Zhou, Si Liu

专题命中 视觉推理 :MLLM(title,abstract);分类 cs.CV、cs.AI

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.15886 2025-03-24 cs.CV cs.LG 81%

Enhancing Zero-Shot Image Recognition in Vision-Language Models through Human-like Concept Guidance

Hui Liu, Wenya Wang, Kecheng Chen, Jie Liu, Yibing Liu, Tiexin Qin, Peisong He, Xinghao Jiang, Haoliang Li

专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.CV、cs.LG

Comments 21 pages, 7 figures 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.01550 2025-03-24 cs.CV cs.AI 81%

SeqAfford: Sequential 3D Affordance Reasoning via Multimodal Large Language Model

Chunlin Yu, Hanqing Wang, Ye Shi, Haoyang Luo, Sibei Yang, Jingyi Yu, Jingya Wang

专题命中 视觉推理 :multimodal large language model(title);grounding(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.02172 2025-03-19 cs.CV cs.AI cs.CL 81%

VISCO: Benchmarking Fine-Grained Critique and Correction Towards Self-Improvement in Visual Reasoning

Xueqing Wu, Yuheng Ding, Bingxuan Li, Pan Lu, Da Yin, Kai-Wei Chang, Nanyun Peng

专题命中 视觉推理 :visual reasoning(title);vision-language model(abstract);分类 cs.CV、cs.AI

Comments CVPR 2025. https://visco-benchmark.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.12932 2025-03-11 cs.CV cs.AI 81%

CoMT: A Novel Benchmark for Chain of Multi-modal Thought on Large Vision-Language Models

Zihui Cheng, Qiguang Chen, Jin Zhang, Hao Fei, Xiaocheng Feng, Wanxiang Che, Min Li, Libo Qin

专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.CV、cs.AI

Comments Accepted at AAAI 2025; Project Page: https://github.com/czhhzc/CoMT

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.00836 2025-02-25 cs.CV cs.AI cs.CL 81%

DynaMath: A Dynamic Visual Benchmark for Evaluating Mathematical Reasoning Robustness of Vision Language Models

Chengke Zou, Xingang Guo, Rui Yang, Junyu Zhang, Bin Hu, Huan Zhang

专题命中 视觉推理 :vision language model(title);vision-language model(abstract);分类 cs.CV、cs.AI

Comments Accepted by ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.12381 2025-02-19 cs.CV cs.AI 81%

HumanEval-V: Benchmarking High-Level Visual Reasoning with Complex Diagrams in Coding Tasks

Fengji Zhang, Linquan Wu, Huiyu Bai, Guancheng Lin, Xiao Li, Xiao Yu, Yue Wang, Bei Chen, Jacky Keung

专题命中 视觉推理 :visual reasoning(title,abstract);分类 cs.CV、cs.AI

Comments homepage https://humaneval-v.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.11968 2025-01-22 cs.AI cs.LG 81%

Bridging Visualization and Optimization: Multimodal Large Language Models on Graph-Structured Combinatorial Optimization

Jie Zhao, Kang Hao Cheong, Witold Pedrycz

专题命中 视觉推理 :multimodal large language model(title,abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.18319 2025-01-03 cs.CV cs.AI 81%

Mulberry: Empowering MLLM with o1-like Reasoning and Reflection via Collective Monte Carlo Tree Search

Huanjin Yao, Jiaxing Huang, Wenhao Wu, Jingyi Zhang, Yibo Wang, Shunyu Liu, Yingjie Wang, Yuxin Song, Haocheng Feng, Li Shen, Dacheng Tao

专题命中 视觉推理 :MLLM(title,abstract);分类 cs.CV、cs.AI

Comments Technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.15462 2024-12-23 cs.RO cs.AI cs.CL cs.HC cs.LG 81%

TalkWithMachines: Enhancing Human-Robot Interaction for Interpretable Industrial Robotics Through Large/Vision Language Models

Ammar N. Abbas, Csaba Beleznai

专题命中 视觉推理 :vision language model(title,abstract);分类 cs.AI、cs.LG

Comments This paper has been accepted for publication in the proceedings of the 2024 Eighth IEEE International Conference on Robotic Computing (IRC)

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.12121 2024-12-17 cs.CL cs.AI cs.CV cs.MM 81%

IRR: Image Review Ranking Framework for Evaluating Vision-Language Models

Kazuki Hayashi, Kazuma Onishi, Toma Suzuki, Yusuke Ide, Seiji Gobara, Shigeki Saito, Yusuke Sakai, Hidetaka Kamigaito, Katsuhiko Hayashi, Taro Watanabe

专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.CV、cs.AI

Comments 18pages, Accepted at COLING25

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.10057 2024-11-07 cs.CV cs.AI 81%

First Multi-Dimensional Evaluation of Flowchart Comprehension for Multimodal Large Language Models

Enming Zhang, Ruobing Yao, Huanyong Liu, Junhui Yu, Jiale Wang

专题命中 视觉推理 :multimodal large language model(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.14852 2024-11-06 cs.CV cs.AI 81%

Is A Picture Worth A Thousand Words? Delving Into Spatial Reasoning for Vision Language Models

Jiayu Wang, Yifei Ming, Zhenmei Shi, Vibhav Vineet, Xin Wang, Yixuan Li, Neel Joshi

专题命中 视觉推理 :vision language model(title);vision-language model(abstract);分类 cs.CV、cs.AI

Comments Accepted to NeurIPS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.02359 2024-11-05 cs.RO cs.AI cs.LG 81%

DeeR-VLA: Dynamic Inference of Multimodal Large Language Models for Efficient Robot Execution

Yang Yue, Yulin Wang, Bingyi Kang, Yizeng Han, Shenzhi Wang, Shiji Song, Jiashi Feng, Gao Huang

专题命中 视觉推理 :multimodal large language model(title);MLLM(abstract);分类 cs.AI、cs.LG

Comments 25 pages, 6 figures, NeurIPS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.17041 2024-10-04 cs.CV cs.AI cs.CL 81%

Eliciting In-Context Learning in Vision-Language Models for Videos Through Curated Data Distributional Properties

Keunwoo Peter Yu, Zheyuan Zhang, Fengyuan Hu, Shane Storks, Joyce Chai

专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.CV、cs.AI

Comments 16 pages, LaTeX; Accepted to EMNLP 2024 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.17150 2024-09-02 cs.CV cs.AI 81%

Look, Compare, Decide: Alleviating Hallucination in Large Vision-Language Models via Multi-View Multi-Path Reasoning

Xiaoye Qu, Jiashuo Sun, Wei Wei, Yu Cheng

专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.CV、cs.AI

Comments 13 pages, 7 tables, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.18626 2024-07-29 cs.CL cs.AI cs.CV cs.DL cs.MM 81%

Every Part Matters: Integrity Verification of Scientific Figures Based on Multimodal Large Language Models

Xiang Shi, Jiawei Liu, Yinpeng Liu, Qikai Cheng, Wei Lu

专题命中 视觉推理 :multimodal large language model(title,abstract);分类 cs.CV、cs.AI

Comments 28 pages, 11 figures, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.15487 2024-07-23 cs.CV cs.AI 81%

In-Context Learning Improves Compositional Understanding of Vision-Language Models

Matteo Nulli, Anesa Ibrahimi, Avik Pal, Hoshe Lee, Ivona Najdenkoska

专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.11300 2024-07-17 cs.CV cs.AI 81%

Large Vision-Language Models as Emotion Recognizers in Context Awareness

Yuxuan Lei, Dingkang Yang, Zhaoyu Chen, Jiawei Chen, Peng Zhai, Lihua Zhang

专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.02537 2024-06-05 cs.CL cs.CV cs.LG 81%

TopViewRS: Vision-Language Models as Top-View Spatial Reasoners

Chengzu Li, Caiqi Zhang, Han Zhou, Nigel Collier, Anna Korhonen, Ivan Vulić

专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.CV、cs.LG

Comments 9 pages, 3 figures, 3 tables (21 pages, 4 figures, 15 tables including references and appendices)

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.03458 2024-06-04 cs.CV cs.LG 81%

Slot Abstractors: Toward Scalable Abstract Visual Reasoning

Shanka Subhra Mondal, Jonathan D. Cohen, Taylor W. Webb

专题命中 视觉推理 :visual reasoning(title,abstract);分类 cs.CV、cs.LG

Comments 18 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.20795 2024-06-03 cs.CV cs.AI 81%

InsightSee: Advancing Multi-agent Vision-Language Models for Enhanced Visual Understanding

Huaxiang Zhang, Yaojia Mu, Guo-Niu Zhu, Zhongxue Gan

专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.10509 2024-04-02 cs.CL cs.AI cs.CV 81%

An Examination of the Compositionality of Large Generative Vision-Language Models

Teli Ma, Rong Li, Junwei Liang

专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.10534 2024-03-19 cs.CV cs.AI 81%

VISREAS: Complex Visual Reasoning with Unanswerable Questions

Syeda Nahida Akter, Sangwu Lee, Yingshan Chang, Yonatan Bisk, Eric Nyberg

专题命中 视觉推理 :visual reasoning(title);LLaVA(abstract);分类 cs.CV、cs.AI

Comments 18 pages, 14 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.00352 2024-03-04 cs.CV cs.LG 81%

Revisiting Disentanglement in Downstream Tasks: A Study on Its Necessity for Abstract Visual Reasoning

Ruiqian Nai, Zixin Wen, Ji Li, Yuanzhi Li, Yang Gao

专题命中 视觉推理 :visual reasoning(title,abstract);分类 cs.CV、cs.LG

Comments Accepted to AAAI-2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.11337 2024-01-23 cs.CV cs.AI 81%

Prompting Large Vision-Language Models for Compositional Reasoning

Timothy Ossowski, Ming Jiang, Junjie Hu

专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏