arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 4454 信号源:cs.CV, cs.AI, cs.LG

1. 视觉推理 4454 篇

2412.00947 2025-07-15 cs.CL cs.CV 79%

VisOnlyQA: Large Vision Language Models Still Struggle with Visual Perception of Geometric Information

Ryo Kamoi, Yusen Zhang, Sarkar Snigdha Sarathi Das, Ranran Haoran Zhang, Rui Zhang

专题命中 视觉推理 :vision language model(title,abstract);分类 cs.CV

Comments COLM 2025. VisOnlyQA dataset, code, and model responses are provided at https://github.com/psunlpgroup/VisOnlyQA. Please also refer to our project website at https://visonlyqa.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.08468 2025-07-08 cs.CL cs.CV 79%

Judging the Judges: Can Large Vision-Language Models Fairly Evaluate Chart Comprehension and Reasoning?

Md Tahmid Rahman Laskar, Mohammed Saidul Islam, Ridwan Mahbub, Ahmed Masry, Mizanur Rahman, Amran Bhuiyan, Mir Tafseer Nayeem, Shafiq Joty, Enamul Hoque, Jimmy Huang

机构 * York University(约克大学) University of Alberta(阿尔伯塔大学) Nanyang Technological University(南洋理工大学) Salesforce AI Research(Salesforce AI研究)

专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.CV

Comments Accepted at ACL 2025 Industry Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.02978 2025-07-08 cs.CV 79%

Ascending the Infinite Ladder: Benchmarking Spatial Deformation Reasoning in Vision-Language Models

Jiahuan Zhang, Shunwen Bai, Tianheng Wang, Kaiwen Guo, Kai Han, Guozheng Rao, Kaicheng Yu

机构 * Autolab, Westlake University(Autolab,西拉丘吉大学) Tianjin University(天津大学) Zhejiang University(浙江大学) Capital Normal University(首都师范大学) University of Hong Kong(香港大学)

专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.14171 2025-07-04 cs.CV 79%

Thinking in Space: How Multimodal Large Language Models See, Remember, and Recall Spaces

Jihan Yang, Shusheng Yang, Anjali W. Gupta, Rilyn Han, Li Fei-Fei, Saining Xie

机构 * New York University(纽约大学) Yale University(耶鲁大学) Stanford University(斯坦福大学)

专题命中 视觉推理 :multimodal large language model(title,abstract);分类 cs.CV

Comments Project page: https://vision-x-nyu.github.io/thinking-in-space.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.01702 2025-07-03 cs.CL cs.AI 79%

AdamMeme: Adaptively Probe the Reasoning Capacity of Multimodal Large Language Models on Harmfulness

Zixin Chen, Hongzhan Lin, Kaixin Li, Ziyang Luo, Zhen Ye, Guang Chen, Zhiyong Huang, Jing Ma

专题命中 视觉推理 :multimodal large language model(title,abstract);分类 cs.AI

Comments ACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.00898 2025-07-02 cs.CV cs.CL 79%

ONLY: One-Layer Intervention Sufficiently Mitigates Hallucinations in Large Vision-Language Models

Zifu Wan, Ce Zhang, Silong Yong, Martin Q. Ma, Simon Stepputtis, Louis-Philippe Morency, Deva Ramanan, Katia Sycara, Yaqi Xie

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.CV

Comments Accepted by ICCV 2025. Project page: https://zifuwan.github.io/ONLY/

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.22434 2025-06-30 cs.CV 79%

MiCo: Multi-image Contrast for Reinforcement Visual Reasoning

Xi Chen, Mingkang Zhu, Shaoteng Liu, Xiaoyang Wu, Xiaogang Xu, Yu Liu, Xiang Bai, Hengshuang Zhao

机构 * HKU(香港大学) Tongyi Lab, Alibaba Group(通义实验室,阿里巴巴集团) CUHK(香港中文大学) HUST(华中科技大学)

专题命中 视觉推理 :visual reasoning(title);vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.23905 2025-06-30 cs.CV 79%

Boosting MLLM Reasoning with Text-Debiased Hint-GRPO

Qihan Huang, Weilong Dai, Jinlong Liu, Wanggui He, Hao Jiang, Mingli Song, Jingyuan Chen, Chang Yao, Jie Song

机构 * Zhejiang University(浙江大学) Alibaba Group(阿里巴巴集团)

专题命中 视觉推理 :MLLM(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.05894 2025-06-26 cs.CV cs.CL 79%

GlyphPattern: An Abstract Pattern Recognition Benchmark for Vision-Language Models

Zixuan Wu, Yoolim Kim, Carolyn Jane Anderson

专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.CV

Journal ref Findings of the ACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.18385 2025-06-24 cs.CV 79%

InternSpatial: A Comprehensive Dataset for Spatial Reasoning in Vision-Language Models

Nianchen Deng, Lixin Gu, Shenglong Ye, Yinan He, Zhe Chen, Songze Li, Haomin Wang, Xingguang Wei, Tianshuo Yang, Min Dou, Tong He, Wenqi Shao, Kaipeng Zhang, Yi Wang, Botian Shi, Yanting Zhang, Jifeng Dai, Yu Qiao, Hongjie Zhang, Wenhai Wang

机构 * Shanghai AI Laboratory(上海人工智能实验室) The Chinese University of Hong Kong(香港中文大学) University of Science and Technology of China(中国科学技术大学) Shanghai Jiao Tong University(上海交通大学) Donghua University(东华大学) Nanjing University(南京大学) Tsinghua University(清华大学)

专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.04623 2025-06-20 cs.CV eess.AS 79%

EchoInk-R1: Exploring Audio-Visual Reasoning in Multimodal LLMs via Reinforcement Learning

Zhenghao Xing, Xiaowei Hu, Chi-Wing Fu, Wenhai Wang, Jifeng Dai, Pheng-Ann Heng

机构 * The Chinese University of Hong Kong(香港中文大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Tsinghua University(清华大学)

专题命中 视觉推理 :visual reasoning(title);multimodal large language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08189 2025-06-11 cs.CV cs.CL 79%

Open World Scene Graph Generation using Vision Language Models

Amartya Dutta, Kazi Sajeed Mehrab, Medha Sawhney, Abhilash Neog, Mridul Khurana, Sepideh Fatemi, Aanish Pradhan, M. Maruf, Ismini Lourentzou, Arka Daw, Anuj Karpatne

专题命中 视觉推理 :vision language model(title,abstract);分类 cs.CV

Comments Accepted in CVPR 2025 Workshop (CVinW)

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.13540 2025-06-09 cs.CL cs.CV 79%

Benchmarking and Improving Large Vision-Language Models for Fundamental Visual Graph Understanding and Reasoning

Yingjie Zhu, Xuefeng Bai, Kehai Chen, Yang Xiang, Jun Yu, Min Zhang

机构 * Institute of Computing and Intelligence, Harbin Institute of Technology, Shenzhen, China(计算与智能研究院,哈尔滨工业大学,深圳) Peng Cheng Laboratory, Shenzhen, China(鹏城实验室,深圳) School of Intelligence Science and Engineering, Harbin Institute of Technology, Shenzhen, China(智能科学与工程学院,哈尔滨工业大学,深圳)

专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.CV

Comments Accepted by ACL2025 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.13612 2025-06-04 cs.CV 79%

FIHA: Autonomous Hallucination Evaluation in Vision-Language Models with Davidson Scene Graphs

Bowen Yan, Zhengsong Zhang, Liqiang Jing, Eftekhar Hossain, Xinya Du

机构 * University of Texas at Dallas(德克萨斯大学达拉斯分校)

专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.CV

Comments Accepted by Findings of ACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.19958 2025-06-03 cs.CV 79%

ChatReID: Open-ended Interactive Person Retrieval via Hierarchical Progressive Tuning for Vision Language Models

Ke Niu, Haiyang Yu, Mengyang Zhao, Teng Fu, Siyang Yi, Wei Lu, Bin Li, Xuelin Qian, Xiangyang Xue

机构 * Fudan University(复旦大学) Northwestern Polytechnical University(西北工业大学)

专题命中 视觉推理 :vision language model(title);vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24476 2025-06-02 cs.CV 79%

Period-LLM: Extending the Periodic Capability of Multimodal Large Language Model

Yuting Zhang, Hao Lu, Qingyong Hu, Yin Wang, Kaishen Yuan, Xin Liu, Kaishun Wu

机构 * The Hong Kong University of Science & Technology (Guangzhou)(香港科技大学(广州)) The Hong Kong University of Science & Technology(香港科技大学) Zhejiang University(浙江大学) Lappeenranta-Lahti University of Technology(拉佩兰塔-拉赫蒂技术大学)

专题命中 视觉推理 :multimodal large language model(title,abstract);分类 cs.CV

Comments Accepted by CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21374 2025-05-28 cs.CV 79%

Video-Holmes: Can MLLM Think Like Holmes for Complex Video Reasoning?

Junhao Cheng, Yuying Ge, Teng Wang, Yixiao Ge, Jing Liao, Ying Shan

机构 * ARC Lab, Tencent PCG(腾讯PCG广告实验室) City University of Hong Kong(香港城市大学)

专题命中 视觉推理 :MLLM(title);grounding(abstract);分类 cs.CV

Comments Homepage: https://github.com/TencentARC/Video-Holmes

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16517 2025-05-27 cs.RO cs.CV 79%

ManipLVM-R1: Reinforcement Learning for Reasoning in Embodied Manipulation with Large Vision-Language Models

Zirui Song, Guangxian Ouyang, Mingzhe Li, Yuheng Ji, Chenxi Wang, Zixiang Xu, Zeyu Zhang, Xiaoqing Zhang, Qian Jiang, Zhenhao Chen, Zhongzhi Li, Rui Yan, Xiuying Chen

机构 * Mohamed bin Zayed University of Artificial Intelligence(莫扎伊德·本·扎耶德人工智能大学) ByteDance(字节跳动) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) The Australia National University(澳大利亚国立大学) Renmin University of China(中国人民大学) Wuhan University(武汉大学)

专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.CV

Comments 14pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.00193 2025-05-27 cs.CL cs.CV 79%

Do Vision-Language Models Really Understand Visual Language?

Yifan Hou, Buse Giledereli, Yilei Tu, Mrinmaya Sachan

专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.CV

Comments ICML 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16446 2025-05-23 cs.LG 79%

Implicit Jailbreak Attacks via Cross-Modal Information Concealment on Vision-Language Models

Zhaoxin Wang, Handing Wang, Cong Tian, Yaochu Jin

机构 * Xidian University(西安电子科技大学) Westlake University(西湖大学)

专题命中 视觉推理 :vision-language model(title);multimodal large language model(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.05096 2025-05-23 cs.CV 79%

Human-in-the-loop Reasoning For Traffic Sign Detection: Collaborative Approach Yolo With Video-llava

Mehdi Azarafza, Fatima Idrees, Ali Ehteshami Bejnordi, Charles Steinmetz, Stefan Henkler, Achim Rettberg

机构 * Department of Computer Science Univ. of Applied Science Hamm-Lippstadt(计算机科学系应用科学大学哈姆-利普施塔特) Carl von Ossietzky University of Oldenburg(卡尔·冯·奥西埃茨基旧恩堡大学)

专题命中 视觉推理 :LLaVA(title,abstract);分类 cs.CV

Comments 10 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15154 2025-05-22 cs.CL cs.AI cs.MM 79%

Prolonged Reasoning Is Not All You Need: Certainty-Based Adaptive Routing for Efficient LLM/MLLM Reasoning

Jinghui Lu, Haiyang Yu, Siliang Xu, Shiwei Ran, Guozhi Tang, Siqi Wang, Bin Shan, Teng Fu, Hao Feng, Jingqun Tang, Han Wang, Can Huang

机构 * ByteDance(字节跳动) FuDan University(复旦大学)

专题命中 视觉推理 :MLLM(title);multimodal large language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12000 2025-05-20 cs.CV 79%

IQBench: How "Smart'' Are Vision-Language Models? A Study with Human IQ Tests

Tan-Hanh Pham, Phu-Vinh Nguyen, Dang The Hung, Bui Trong Duong, Vu Nguyen Thanh, Chris Ngo, Tri Quang Truong, Truong-Son Hy

机构 * Harvard Medical School(哈佛医学院) Uppsala University(乌普萨拉大学) University of London(伦敦大学) Vietnam Military Medical University(越南军医大学) University of Technical Education Ho Chi Minh City(胡志明市技术大学) Knovel Engineering Lab(Knovel工程实验室) University of Alabama at Birmingham(阿拉巴马大学伯明翰分校)

专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.CV

Comments IQ Test for Multimodal Models

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.16184 2025-04-30 cs.CV 79%

Predicate Debiasing in Vision-Language Models Integration for Scene Graph Generation Enhancement

Yuxuan Wang, Xiaoyuan Liu

机构 * Nanyang Technological University(南洋理工大学)

专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.12542 2025-04-24 cs.CV 79%

ST-Think: How Multimodal Large Language Models Reason About 4D Worlds from Ego-Centric Videos

Peiran Wu, Yunze Liu, Miao Liu, Junxiao Shen

机构 * University of Bristol(布里斯托大学) X-Intelligence Labs(X-智能实验室) Meta

专题命中 视觉推理 :multimodal large language model(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.18203 2025-04-24 cs.CV cs.CL 79%

Critic-V: VLM Critics Help Catch VLM Errors in Multimodal Reasoning

Di Zhang, Junxian Li, Jingdi Lei, Xunzhi Wang, Yujie Liu, Zonglin Yang, Jiatong Li, Weida Wang, Suorong Yang, Jianbo Wu, Peng Ye, Wanli Ouyang, Dongzhan Zhou

机构 * Fudan University(复旦大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Jiaotong University(上海交通大学) Nankai University(南开大学) Shanghai University(上海大学) Nanyang Technological University(南洋理工大学) Hong Kong Polytechnic University(香港理工大学) Tongji University(同济大学) Nanjing University(南京大学) University of California, Merced(加州大学梅德福分校) Chinese University of Hong Kong(香港中文大学)

专题命中 视觉推理 :VLM(title);vision-language model(abstract);分类 cs.CV

Comments 16 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.07521 2025-04-18 cs.AI cs.MM 79%

Why We Feel: Breaking Boundaries in Emotional Reasoning with Multimodal Large Language Models

Yuxiang Lin, Jingdong Sun, Zhi-Qi Cheng, Jue Wang, Haomin Liang, Zebang Cheng, Yifei Dong, Jun-Yan He, Xiaojiang Peng, Xian-Sheng Hua

专题命中 视觉推理 :multimodal large language model(title);vision-language model(abstract);分类 cs.AI

Comments Accepted at CVPR Workshop NEXD 2025. 21 pages, Project: https://github.com/Lum1104/EIBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.17385 2025-04-18 cs.CL cs.CV 79%

Do Vision-Language Models Represent Space and How? Evaluating Spatial Frame of Reference Under Ambiguities

Zheyuan Zhang, Fengyuan Hu, Jayjun Lee, Freda Shi, Parisa Kordjamshidi, Joyce Chai, Ziqiao Ma

专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.CV

Comments Accepted to ICLR 2025 (Oral) | Project page: https://spatial-comfort.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.09979 2025-04-15 cs.CV 79%

Resampling Benchmark for Efficient Comprehensive Evaluation of Large Vision-Language Models

Teppei Suzuki, Keisuke Ozawa

专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.08111 2025-04-14 cs.CV 79%

POEM: Precise Object-level Editing via MLLM control

Marco Schouten, Mehmet Onurcan Kaya, Serge Belongie, Dim P. Papadopoulos

专题命中 视觉推理 :MLLM(title);multimodal large language model(abstract);分类 cs.CV

Comments Accepted to SCIA 2025

详情

展开后加载摘要…

URL PDF HTML 收藏