arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 4463 信号源:cs.CV, cs.AI, cs.LG

1. 视觉推理 4463 篇

2511.09339 2025-11-13 cs.CL 78%

mmJEE-Eval: A Bilingual Multimodal Benchmark for Evaluating Scientific Reasoning in Vision-Language Models

Arka Mukherjee, Shreya Ghosh

机构 * Kalinga Institute of Industrial Technology (KIIT)(喀里亚理工学院) Indian Institute of Technology (IIT), Bhubaneswar(印度理工学院(班加罗尔))

专题命中 视觉推理 :vision-language model(title,abstract)

Comments Accepted to IJCNLP-AACL Findings 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.16400 2025-11-12 cs.CL 78%

VipAct: Visual-Perception Enhancement via Specialized VLM Agent Collaboration and Tool-use

Zhehao Zhang, Ryan Rossi, Tong Yu, Franck Dernoncourt, Ruiyi Zhang, Jiuxiang Gu, Sungchul Kim, Xiang Chen, Zichao Wang, Nedim Lipka

机构 * Adobe

专题命中 视觉推理 :VLM(title);vision-language model(abstract)

Comments AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03908 2025-11-07 cs.CL 78%

Context informs pragmatic interpretation in vision-language models

Alvin Wei Ming Tan, Ben Prystawski, Veronica Boyce, Michael C. Frank

机构 * Department of Psychology Stanford University(心理学系 斯坦福大学)

专题命中 视觉推理 :vision-language model(title,abstract)

Comments Accepted at CogInterp Workshop, NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.12149 2025-11-04 cs.CL cs.MM cs.SI 78%

Seeing Sarcasm Through Different Eyes: Analyzing Multimodal Sarcasm Perception in Large Vision-Language Models

Junjie Chen, Xuyang Liu, Subin Huang, Linfeng Zhang, Hang Yu

机构 * Anhui Polytechnic University (AHPU)(安徽工程大学) Shanghai University (SHU)(上海大学) Shanghai Jiao Tong University (SJTU)(上海交通大学) Sichuan University (SCU)(四川大学)

专题命中 视觉推理 :vision-language model(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24322 2025-09-30 cs.CL 78%

Multimodal Large Language Models Meet Multimodal Emotion Recognition and Reasoning: A Survey

Yuntao Shou, Tao Meng, Wei Ai, Keqin Li

机构 * Central South University of Forestry and Technology(林业科技大学) State University of New York(纽约州立大学)

专题命中 视觉推理 :multimodal large language model(title,abstract)

Comments 35 pages, 10 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18682 2025-09-24 cs.MM 78%

Harnessing Multimodal Large Language Models for Personalized Product Search with Query-aware Refinement

Beibei Zhang, Yanan Lu, Ruobing Xie, Zongyi Li, Siyuan Xing, Tongwei Ren, Fen Lin

专题命中 视觉推理 :multimodal large language model(title);MLLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.09070 2025-09-16 cs.LG cs.AI cs.CV 78%

FairCoT: Enhancing Fairness in Text-to-Image Generation via Chain of Thought Reasoning with Multimodal Large Language Models

Zahraa Al Sahili, Ioannis Patras, Matthew Purver

机构 * School of Electronic Engineering and Computer Science, Queen Mary University of London(伦敦女王学院电子工程与计算机科学学院) Department of Knowledge Technologies, Jožef Stefan Institute(Jožef Stefan研究所知识技术系)

专题命中 视觉推理 :multimodal large language model(title);分类 cs.CV、cs.AI、cs.LG

Comments Accepted at EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.08126 2025-09-11 cs.RO 78%

Attribute-based Object Grounding and Robot Grasp Detection with Spatial Reasoning

Houjian Yu, Zheming Zhou, Min Sun, Omid Ghasemalizadeh, Yuyin Sun, Cheng-Hao Kuo, Arnie Sen, Changhyun Choi

机构 * Department of Electrical and Computer Engineering, Univ. of Minnesota(电气与计算机工程系) Amazon Lab126(亚马逊实验室126) National Tsing Hua University(国立清华大学)

专题命中 视觉推理 :grounding(title,abstract)

Comments Accepted to 2025 IEEE-RAS 24th International Conference on Humanoid Robots

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06801 2025-08-19 cs.HC 78%

Understanding Pedestrian Gesture Misrecognition: Insights from Vision-Language Model Reasoning

Tram Thi Minh Tran, Xinyan Yu, Callum Parker, Julie Stephany Berrio Perez, Stewart Worrall, Martin Tomitsch

专题命中 视觉推理 :vision-language model(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.12937 2025-08-05 cs.AI cs.CL cs.CV cs.LG 78%

R1-VL: Learning to Reason with Multimodal Large Language Models via Step-wise Group Relative Policy Optimization

Jingyi Zhang, Jiaxing Huang, Huanjin Yao, Shunyu Liu, Xikun Zhang, Shijian Lu, Dacheng Tao

机构 * Nanyang Technological University(南洋理工大学)

专题命中 视觉推理 :multimodal large language model(title);分类 cs.CV、cs.AI、cs.LG

Comments ICCV 2025 Camera Ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.11114 2025-07-16 cs.CL 78%

MSA at ImageCLEF 2025 Multimodal Reasoning: Multilingual Multimodal Reasoning With Ensemble Vision Language Models

Seif Ahmed, Mohamed T. Younes, Abdelrahman Moustafa, Abdelrahman Allam, Hamza Moustafa

机构 * October University for Modern Sciences and Arts(现代科学与艺术大学)

专题命中 视觉推理 :vision language model(title);VLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.08496 2025-07-14 cs.CL 78%

LLaPa: A Vision-Language Model Framework for Counterfactual-Aware Procedural Planning

Shibo Sun, Xue Li, Donglin Di, Mingjie Wei, Lanshun Nie, Wei-Nan Zhang, Dechen Zhan, Yang Song, Lei Fan

机构 * Harbin Institute of Technology(哈尔滨工业大学) University of New South Wales(新南威尔士大学)

专题命中 视觉推理 :vision-language model(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.19303 2025-06-25 cs.RO 78%

Robotic Perception with a Large Tactile-Vision-Language Model for Physical Property Inference

Zexiang Guo, Hengxiang Chen, Xinheng Mai, Qiusang Qiu, Gan Ma, Zhanat Kappassov, Qiang Li, Nutan Chen

机构 * College of Big Data and Internet, Shenzhen Technology University, China(大数据与互联网学院,深圳科技大学,中国) Sino-German College of Intelligent Manufacturing, Shenzhen Technology University, China(中德智能制造学院,深圳科技大学,中国) Robotics Department, Institute of Smart Systems and Artificial Intelligence (ISSAI), Nazarbayev University, Kazakhstan(机器人系,智能系统与人工智能研究所(ISSAI),纳扎尔巴耶夫大学,哈萨克斯坦) Foundation Robotics Labs, Germany(基础机器人实验室,德国)

专题命中 视觉推理 :vision-language model(title,abstract)

Comments This paper has been accepted by the 2025 International Conference on Climbing and Walking Robots (CLAWAR). These authors contributed equally to this work: Zexiang Guo, Hengxiang Chen, Xinheng Mai

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.12710 2025-06-17 cs.RO 78%

Multimodal Large Language Models-Enabled UAV Swarm: Towards Efficient and Intelligent Autonomous Aerial Systems

Yuqi Ping, Tianhao Liang, Huahao Ding, Guangyu Lei, Junwei Wu, Xuan Zou, Kuan Shi, Rui Shao, Chiya Zhang, Weizheng Zhang, Weijie Yuan, Tingting Zhang

机构 * College of Informatics, Harbin Institute of Technology(信息学院,哈尔滨工业大学) Key Laboratory of Forest and Grassland Fire Risk Prevention, Ministry of Emergency Management, China Fire and Rescue Institute(森林和草原火灾风险预防重点实验室,应急管理部,中国消防救援学院) Southern University of Science and Technology(南方科技大学)

专题命中 视觉推理 :multimodal large language model(title,abstract)

Comments 8 pages, 5 figures,submitted to IEEE wcm

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.11936 2025-05-21 cs.CL 78%

A Survey of Mathematical Reasoning in the Era of Multimodal Large Language Model: Benchmark, Method & Challenges

Yibo Yan, Jiamin Su, Jianxiang He, Fangteng Fu, Xu Zheng, Yuanhuiyi Lyu, Kun Wang, Shen Wang, Qingsong Wen, Xuming Hu

专题命中 视觉推理 :multimodal large language model(title,abstract)

Comments Accepted by The 63rd Annual Meeting of the Association for Computational Linguistics (ACL Findings 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.15863 2025-05-21 cs.RO 78%

Task-oriented Robotic Manipulation with Vision Language Models

Nurhan Bulus Guran, Hanchi Ren, Jingjing Deng, Xianghua Xie

机构 * Department of Computer Science, Swansea University(计算机科学系,萨瑟兰大学) Department of Computer Science, Durham University(计算机科学系,杜ham大学)

专题命中 视觉推理 :vision language model(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.09120 2025-05-20 cs.CL 78%

Can Vision-Language Models Infer Speaker's Ignorance? The Role of Visual and Linguistic Cues

Ye-eun Cho, Yunho Maeng

机构 * Sungkyunkwan University(顺天妇女大学) Ewha Womans University & LLM Experimental Lab, MODULABS(成均馆大学及LLM实验实验室,MODULABS)

专题命中 视觉推理 :vision-language model(title,abstract)

Comments 11 pages, 4 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.02569 2025-05-06 cs.RO cs.HC 78%

HapticVLM: VLM-Driven Texture Recognition Aimed at Intelligent Haptic Interaction

Muhammad Haris Khan, Miguel Altamirano Cabrera, Dmitrii Iarchuk, Yara Mahmoud, Daria Trinitatova, Issatay Tokmurziyev, Dzmitry Tsetserukou

机构 * Intelligent Space Robotics Laboratory, Center for Digital Engineering, Skolkovo Institute of Science and Technology(智能空间机器人实验室、数字工程中心、斯克尔科沃科学与技术研究所)

专题命中 视觉推理 :VLM(title);vision-language model(abstract)

Comments Submitted to IEEE conf

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.05132 2025-03-11 cs.AI cs.CV cs.LG 78%

R1-Zero's "Aha Moment" in Visual Reasoning on a 2B Non-SFT Model

Hengguang Zhou, Xirui Li, Ruochen Wang, Minhao Cheng, Tianyi Zhou, Cho-Jui Hsieh

专题命中 视觉推理 :visual reasoning(title);分类 cs.CV、cs.AI、cs.LG

Comments 10 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11903 2025-03-11 cs.CL 78%

MMRC: A Large-Scale Benchmark for Understanding Multimodal Large Language Model in Real-World Conversation

Haochen Xue, Feilong Tang, Ming Hu, Yexin Liu, Qidong Huang, Yulong Li, Chengzhi Liu, Zhongxing Xu, Chong Zhang, Chun-Mei Feng, Yutong Xie, Imran Razzak, Zongyuan Ge, Jionglong Su, Junjun He, Yu Qiao

专题命中 视觉推理 :multimodal large language model(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.08603 2024-12-31 cs.CL 78%

A Comprehensive Survey of Large Language Models and Multimodal Large Language Models in Medicine

Hanguang Xiao, Feizhong Zhou, Xingyue Liu, Tianqi Liu, Zhipeng Li, Xin Liu, Xiaoxuan Huang

专题命中 视觉推理 :multimodal large language model(title,abstract)

Journal ref Information Fusion, 117 (2025) 102888

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.11496 2024-12-02 cs.CL 78%

Safe + Safe = Unsafe? Exploring How Safe Images Can Be Exploited to Jailbreak Large Vision-Language Models

Chenhang Cui, Gelei Deng, An Zhang, Jingnan Zheng, Yicong Li, Lianli Gao, Tianwei Zhang, Tat-Seng Chua

专题命中 视觉推理 :vision-language model(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.00855 2024-11-05 cs.LG cs.AI cs.CL cs.CV 78%

Vision-Language Models Can Self-Improve Reasoning via Reflection

Kanzhi Cheng, Yantao Li, Fangzhi Xu, Jianbing Zhang, Hao Zhou, Yang Liu

专题命中 视觉推理 :vision-language model(title);分类 cs.CV、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.20927 2024-11-01 cs.RO 78%

VLMimic: Vision Language Models are Visual Imitation Learner for Fine-grained Actions

Guanyan Chen, Meiling Wang, Te Cui, Yao Mu, Haoyang Lu, Tianxing Zhou, Zicai Peng, Mengxiao Hu, Haizhou Li, Yuan Li, Yi Yang, Yufeng Yue

专题命中 视觉推理 :vision language model(title,abstract)

Comments accepted for publication in the 38th Conference on Neural Information Processing Systems (NeurIPS 2024)

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.14917 2024-10-21 cs.CL 78%

With Ears to See and Eyes to Hear: Sound Symbolism Experiments with Multimodal Large Language Models

Tyler Loakman, Yucheng Li, Chenghua Lin

专题命中 视觉推理 :multimodal large language model(title);vision language model(abstract)

Comments Accepted to EMNLP 2024 (Camera Ready)

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.09489 2024-10-15 cs.CL 78%

Towards Efficient Visual-Language Alignment of the Q-Former for Visual Reasoning Tasks

Sungkyung Kim, Adam Lee, Junyoung Park, Andrew Chung, Jusang Oh, Jay-Yoon Lee

专题命中 视觉推理 :visual reasoning(title,abstract)

Comments EMNLP 2024 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.03907 2024-10-08 cs.CL 78%

ActPlan-1K: Benchmarking the Procedural Planning Ability of Visual Language Models in Household Activities

Ying Su, Zhan Ling, Haochen Shi, Jiayang Cheng, Yauwai Yim, Yangqiu Song

专题命中 视觉推理 :visual language model(title);vision language model(abstract)

Comments 13 pages, 9 figures, 8 tables, accepted to EMNLP 2024 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.00257 2024-10-07 cs.CL 78%

Are Large Vision Language Models up to the Challenge of Chart Comprehension and Reasoning? An Extensive Investigation into the Capabilities and Limitations of LVLMs

Mohammed Saidul Islam, Raian Rahman, Ahmed Masry, Md Tahmid Rahman Laskar, Mir Tafseer Nayeem, Enamul Hoque

专题命中 视觉推理 :vision language model(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.04929 2024-07-31 cs.RO 78%

RoboMP$^2$: A Robotic Multimodal Perception-Planning Framework with Multimodal Large Language Models

Qi Lv, Hao Li, Xiang Deng, Rui Shao, Michael Yu Wang, Liqiang Nie

专题命中 视觉推理 :multimodal large language model(title,abstract)

Comments Accepted by ICML 2024; Project page: https://aopolin-lv.github.io/RoboMP2.github.io/

Journal ref Proceedings of the 41st International Conference on Machine Learning, PMLR 235:33558-33574, 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.04615 2024-06-10 eess.AS cs.CL cs.SD 78%

What do MLLMs hear? Examining reasoning with text and sound components in Multimodal Large Language Models

Enis Berk Çoban, Michael I. Mandel, Johanna Devaney

专题命中 视觉推理 :multimodal large language model(title);MLLM(abstract)

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏