arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 26117 信号源:cs.CV, cs.AI, cs.LG

1. 视觉推理 4478 篇

2505.20728 2025-08-27 cs.AI 79%

Jigsaw-Puzzles: From Seeing to Understanding to Reasoning in Vision-Language Models

Zesen Lyu, Dandan Zhang, Wei Ye, Fangdi Li, Zhihang Jiang, Yao Yang

机构 * Hangzhou Institute for Advanced Study, UCAS(杭州高等研究 institute,UCAS) Zhejiang Lab(浙江实验室) Zhejiang University(浙江大学)

专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.AI

Comments Accepted by EMNLP 2025 Main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13938 2025-08-20 cs.CL cs.CV 79%

MME-SCI: A Comprehensive and Challenging Science Benchmark for Multimodal Large Language Models

Jiacheng Ruan, Dan Jiang, Xian Gao, Ting Liu, Yuzhuo Fu, Yangyang Kang

专题命中 视觉推理 :multimodal large language model(title,abstract);分类 cs.CV

Comments 9 pages, 6 figures, work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10770 2025-08-15 cs.CV 79%

From Diagnosis to Improvement: Probing Spatio-Physical Reasoning in Vision Language Models

Tiancheng Han, Yunfei Gao, Yong Li, Wuzhou Yu, Qiaosheng Zhang, Wenqi Shao

专题命中 视觉推理 :vision language model(title,abstract);分类 cs.CV

Comments 9 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.00318 2025-08-14 cs.AI q-bio.NC 79%

Probing Mechanical Reasoning in Large Vision Language Models

Haoran Sun, Qingying Gao, Haiyun Lyu, Dezhi Luo, Yijiang Li, Hokin Deng

机构 * Johns Hopkins University(约翰霍普金斯大学) University of North Carolina Chapel Hill(北卡罗来纳大学教堂山分校) University of Michigan(密歇根大学) University of California San Diego(加州大学圣地亚哥分校) Carnegie Mellon University(卡内基梅隆大学)

专题命中 视觉推理 :vision language model(title,abstract);分类 cs.AI

Comments Published at the ICLR 2025 Workshop on Bidirectional Human-AI Alignment (BiAlign)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08926 2025-08-13 cs.AI 79%

Safe Semantics, Unsafe Interpretations: Tackling Implicit Reasoning Safety in Large Vision-Language Models

Wei Cai, Jian Zhao, Yuchu Jiang, Tianle Zhang, Xuelong Li

机构 * Peking University(北京大学) Institute of Artificial Intelligence (TeleAI), China Telecom(人工智能研究所(TeleAI),中国电信) Northwestern Polytechnical University(西北工业大学) Southeast University(东南大学)

专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.00324 2025-08-13 cs.AI 79%

Vision Language Models See What You Want but not What You See

Qingying Gao, Yijiang Li, Haiyun Lyu, Haoran Sun, Dezhi Luo, Hokin Deng

机构 * Johns Hopkins University(约翰霍普金斯大学) University of California San Diego(加州大学圣地亚哥分校) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) University of Michigan(密歇根大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 视觉推理 :vision language model(title,abstract);分类 cs.AI

Comments Published at the ICLR 2025 Workshop on Bidirectional Human-AI Alignment (BiAlign)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06851 2025-08-12 cs.AI cs.CY 79%

MDK12-Bench: A Comprehensive Evaluation of Multimodal Large Language Models on Multidisciplinary Exams

Pengfei Zhou, Xiaopeng Peng, Fanrui Zhang, Zhaopan Xu, Jiaxin Ai, Yansheng Qiu, Chuanhao Li, Zhen Li, Ming Li, Yukang Feng, Jianwen Sun, Haoquan Zhang, Zizhen Li, Xiaofeng Mao, Zekai Li, Wangbo Zhao, Kai Wang, Xiaojun Chang, Wenqi Shao, Yang You, Kaipeng Zhang

机构 * Shanghai AI Laboratory(上海人工智能实验室) Shanghai Innovation Institute(上海创新研究院) USTC(中国科学技术大学) RIT(罗切斯特理工学院) HIT(哈尔滨工业大学) WHU(武汉大学) MBZUAI(马克斯·普朗克人工智能研究所) NUS(新加坡国立大学)

专题命中 视觉推理 :multimodal large language model(title,abstract);分类 cs.AI

Comments 35 pages, 33 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06009 2025-08-11 cs.CV 79%

MathReal: We Keep It Real! A Real Scene Benchmark for Evaluating Math Reasoning in Multimodal Large Language Models

Jun Feng, Zixin Wang, Zhentao Zhang, Yue Guo, Zhihan Zhou, Xiuyi Chen, Zhenyang Li, Dawei Yin

专题命中 视觉推理 :multimodal large language model(title,abstract);分类 cs.CV

Comments 29 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04931 2025-08-08 cs.RO cs.AI 79%

INTENTION: Inferring Tendencies of Humanoid Robot Motion Through Interactive Intuition and Grounded VLM

Jin Wang, Weijie Wang, Boyuan Deng, Heng Zhang, Rui Dai, Nikos Tsagarakis

专题命中 视觉推理 :VLM(title);vision-language model(abstract);分类 cs.AI

Comments Project Web: https://robo-intention.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03737 2025-08-07 cs.CL cs.AI 79%

GanitBench: A bi-lingual benchmark for evaluating mathematical reasoning in Vision Language Models

Ashutosh Bandooni, Brindha Subburaj

专题命中 视觉推理 :vision language model(title,abstract);分类 cs.AI

Comments 6 pages, 3 figures. Accepted, Presented and Published as part of Proceedings of the 6th International Conference on Recent Advantages in Information Technology (RAIT) 2025

Journal ref 2025 6th International Conference on Recent Advances in Information Technology (RAIT), Dhanbad, India, 2025, pp. 1-6

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00726 2025-08-04 cs.CV 79%

MIHBench: Benchmarking and Mitigating Multi-Image Hallucinations in Multimodal Large Language Models

Jiale Li, Mingrui Wu, Zixiang Jin, Hao Chen, Jiayi Ji, Xiaoshuai Sun, Liujuan Cao, Rongrong Ji

机构 * Xiamen University(厦门大学) Zhongguancun Academy(中关村学院)

专题命中 视觉推理 :multimodal large language model(title,abstract);分类 cs.CV

Comments ACM MM25 has accepted this paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16974 2025-08-04 cs.CV 79%

OpenSeg-R: Improving Open-Vocabulary Segmentation via Step-by-Step Visual Reasoning

Zongyan Han, Jiale Cao, Shuo Chen, Tong Wang, Jorma Laaksonen, Rao Muhammad Anwer

机构 * Mohamed Bin Zayed University of Artificial Intelligence(莫扎德大学人工智能学院) Tianjin University(天津大学) Nanjing University(南京大学) Aalto University(艾尔沃斯大学)

专题命中 视觉推理 :visual reasoning(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.23362 2025-08-01 cs.CV 79%

Short-LVLM: Compressing and Accelerating Large Vision-Language Models by Pruning Redundant Layers

Ji Ma, Wei Suo, Peng Wang, Yanning Zhang

机构 * Northwestern Polytechnical University(西北工业大学) National Engineering Laboratory for Integrated Aero-Space-Ground-Ocean Big Data Application Technology(集成空天地海大数据应用技术国家工程实验室)

专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.CV

Comments Accepted By ACM MM 25

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.22933 2025-08-01 cs.CL cs.AI 79%

Augmented Vision-Language Models: A Systematic Review

Anthony C Davis, Burhan Sadiq, Tianmin Shu, Chien-Ming Huang

机构 * Johns Hopkins University(约翰霍普金斯大学)

专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.12447 2025-07-31 cs.CV 79%

CLIP-HandID: Vision-Language Model for Hand-Based Person Identification

Nathanael L. Baisa, Babu Pallam, Amudhavel Jayavel

机构 * School of Computer Science(计算机科学学院) Informatics De Montfort University(信息学德蒙特福特大学)

专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.18433 2025-07-25 eess.IV cs.CV 79%

DiagR1: A Vision-Language Model Trained via Reinforcement Learning for Digestive Pathology Diagnosis

Minxi Ouyang, Lianghui Zhu, Yaqing Bao, Qiang Huang, Jingli Ouyang, Tian Guan, Xitong Ling, Jiawen Li, Song Duan, Wenbin Dai, Li Zheng, Xuemei Zhang, Yonghong He

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Department of Pathology, Liuzhou People’s Hospital Affiliated to Guangxi Medical University(广西医科大学柳州市人民医院病理科) Department of Immunology, College of Basic Medical Sciences, China Medical University(中国医科大学基础医学学院免疫科) Greater Bay Area Center for Medical Device Evaluation and Inspection.NMPA(粤港澳大湾区医疗器械评价和检验中心.NMPA) Shenzhen Shengqiang Technology Co., Ltd.(深圳盛强科技有限公司) Department of Pathology, Chongqing University Affiliated Three Gorges Hospital(重庆大学附属第三人民医院病理科)

专题命中 视觉推理 :vision-language model(title);vision language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.09491 2025-07-15 cs.CV 79%

GLIMPSE: Do Large Vision-Language Models Truly Think With Videos or Just Glimpse at Them?

Yiyang Zhou, Linjie Li, Shi Qiu, Zhengyuan Yang, Yuyang Zhao, Siwei Han, Yangfan He, Kangqi Li, Haonian Ji, Zihao Zhao, Haibo Tong, Lijuan Wang, Huaxiu Yao

专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.CV

Comments 15 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.00947 2025-07-15 cs.CL cs.CV 79%

VisOnlyQA: Large Vision Language Models Still Struggle with Visual Perception of Geometric Information

Ryo Kamoi, Yusen Zhang, Sarkar Snigdha Sarathi Das, Ranran Haoran Zhang, Rui Zhang

专题命中 视觉推理 :vision language model(title,abstract);分类 cs.CV

Comments COLM 2025. VisOnlyQA dataset, code, and model responses are provided at https://github.com/psunlpgroup/VisOnlyQA. Please also refer to our project website at https://visonlyqa.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.08468 2025-07-08 cs.CL cs.CV 79%

Judging the Judges: Can Large Vision-Language Models Fairly Evaluate Chart Comprehension and Reasoning?

Md Tahmid Rahman Laskar, Mohammed Saidul Islam, Ridwan Mahbub, Ahmed Masry, Mizanur Rahman, Amran Bhuiyan, Mir Tafseer Nayeem, Shafiq Joty, Enamul Hoque, Jimmy Huang

机构 * York University(约克大学) University of Alberta(阿尔伯塔大学) Nanyang Technological University(南洋理工大学) Salesforce AI Research(Salesforce AI研究)

专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.CV

Comments Accepted at ACL 2025 Industry Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.02978 2025-07-08 cs.CV 79%

Ascending the Infinite Ladder: Benchmarking Spatial Deformation Reasoning in Vision-Language Models

Jiahuan Zhang, Shunwen Bai, Tianheng Wang, Kaiwen Guo, Kai Han, Guozheng Rao, Kaicheng Yu

机构 * Autolab, Westlake University(Autolab,西拉丘吉大学) Tianjin University(天津大学) Zhejiang University(浙江大学) Capital Normal University(首都师范大学) University of Hong Kong(香港大学)

专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.14171 2025-07-04 cs.CV 79%

Thinking in Space: How Multimodal Large Language Models See, Remember, and Recall Spaces

Jihan Yang, Shusheng Yang, Anjali W. Gupta, Rilyn Han, Li Fei-Fei, Saining Xie

机构 * New York University(纽约大学) Yale University(耶鲁大学) Stanford University(斯坦福大学)

专题命中 视觉推理 :multimodal large language model(title,abstract);分类 cs.CV

Comments Project page: https://vision-x-nyu.github.io/thinking-in-space.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.01702 2025-07-03 cs.CL cs.AI 79%

AdamMeme: Adaptively Probe the Reasoning Capacity of Multimodal Large Language Models on Harmfulness

Zixin Chen, Hongzhan Lin, Kaixin Li, Ziyang Luo, Zhen Ye, Guang Chen, Zhiyong Huang, Jing Ma

专题命中 视觉推理 :multimodal large language model(title,abstract);分类 cs.AI

Comments ACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.00898 2025-07-02 cs.CV cs.CL 79%

ONLY: One-Layer Intervention Sufficiently Mitigates Hallucinations in Large Vision-Language Models

Zifu Wan, Ce Zhang, Silong Yong, Martin Q. Ma, Simon Stepputtis, Louis-Philippe Morency, Deva Ramanan, Katia Sycara, Yaqi Xie

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.CV

Comments Accepted by ICCV 2025. Project page: https://zifuwan.github.io/ONLY/

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.22434 2025-06-30 cs.CV 79%

MiCo: Multi-image Contrast for Reinforcement Visual Reasoning

Xi Chen, Mingkang Zhu, Shaoteng Liu, Xiaoyang Wu, Xiaogang Xu, Yu Liu, Xiang Bai, Hengshuang Zhao

机构 * HKU(香港大学) Tongyi Lab, Alibaba Group(通义实验室,阿里巴巴集团) CUHK(香港中文大学) HUST(华中科技大学)

专题命中 视觉推理 :visual reasoning(title);vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.23905 2025-06-30 cs.CV 79%

Boosting MLLM Reasoning with Text-Debiased Hint-GRPO

Qihan Huang, Weilong Dai, Jinlong Liu, Wanggui He, Hao Jiang, Mingli Song, Jingyuan Chen, Chang Yao, Jie Song

机构 * Zhejiang University(浙江大学) Alibaba Group(阿里巴巴集团)

专题命中 视觉推理 :MLLM(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.05894 2025-06-26 cs.CV cs.CL 79%

GlyphPattern: An Abstract Pattern Recognition Benchmark for Vision-Language Models

Zixuan Wu, Yoolim Kim, Carolyn Jane Anderson

专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.CV

Journal ref Findings of the ACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.18385 2025-06-24 cs.CV 79%

InternSpatial: A Comprehensive Dataset for Spatial Reasoning in Vision-Language Models

Nianchen Deng, Lixin Gu, Shenglong Ye, Yinan He, Zhe Chen, Songze Li, Haomin Wang, Xingguang Wei, Tianshuo Yang, Min Dou, Tong He, Wenqi Shao, Kaipeng Zhang, Yi Wang, Botian Shi, Yanting Zhang, Jifeng Dai, Yu Qiao, Hongjie Zhang, Wenhai Wang

机构 * Shanghai AI Laboratory(上海人工智能实验室) The Chinese University of Hong Kong(香港中文大学) University of Science and Technology of China(中国科学技术大学) Shanghai Jiao Tong University(上海交通大学) Donghua University(东华大学) Nanjing University(南京大学) Tsinghua University(清华大学)

专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.04623 2025-06-20 cs.CV eess.AS 79%

EchoInk-R1: Exploring Audio-Visual Reasoning in Multimodal LLMs via Reinforcement Learning

Zhenghao Xing, Xiaowei Hu, Chi-Wing Fu, Wenhai Wang, Jifeng Dai, Pheng-Ann Heng

机构 * The Chinese University of Hong Kong(香港中文大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Tsinghua University(清华大学)

专题命中 视觉推理 :visual reasoning(title);multimodal large language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08189 2025-06-11 cs.CV cs.CL 79%

Open World Scene Graph Generation using Vision Language Models

Amartya Dutta, Kazi Sajeed Mehrab, Medha Sawhney, Abhilash Neog, Mridul Khurana, Sepideh Fatemi, Aanish Pradhan, M. Maruf, Ismini Lourentzou, Arka Daw, Anuj Karpatne

专题命中 视觉推理 :vision language model(title,abstract);分类 cs.CV

Comments Accepted in CVPR 2025 Workshop (CVinW)

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.13540 2025-06-09 cs.CL cs.CV 79%

Benchmarking and Improving Large Vision-Language Models for Fundamental Visual Graph Understanding and Reasoning

Yingjie Zhu, Xuefeng Bai, Kehai Chen, Yang Xiang, Jun Yu, Min Zhang

机构 * Institute of Computing and Intelligence, Harbin Institute of Technology, Shenzhen, China(计算与智能研究院,哈尔滨工业大学,深圳) Peng Cheng Laboratory, Shenzhen, China(鹏城实验室,深圳) School of Intelligence Science and Engineering, Harbin Institute of Technology, Shenzhen, China(智能科学与工程学院,哈尔滨工业大学,深圳)

专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.CV

Comments Accepted by ACL2025 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏