arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 26117 信号源:cs.CV, cs.AI, cs.LG

1. 视觉推理 4478 篇

2506.08691 2025-06-11 cs.CV 83%

VReST: Enhancing Reasoning in Large Vision-Language Models through Tree Search and Self-Reward Mechanism

Congzhi Zhang, Jiawei Peng, Zhenglin Wang, Yilong Lai, Haowen Sun, Heng Chang, Fei Ma, Weijiang Yu

机构 * School of Computer Science and Engineering, Sun Yat-Sen University(中山大学计算机科学与工程学院) Guangdong Laboratory of Artificial Intelligence and Digital Economy(广东省人工智能与数字经济实验室) Huawei Technologies Co., Ltd(华为技术有限公司)

专题命中 视觉推理 :vision-language model(title,abstract);visual reasoning(abstract);分类 cs.CV

Comments Accepted by ACL 2025 main

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07235 2025-06-10 cs.CV cs.CL 83%

Multi-Step Visual Reasoning with Visual Tokens Scaling and Verification

Tianyi Bai, Zengjie Hu, Fupeng Sun, Jiantao Qiu, Yizhen Jiang, Guangxin He, Bohan Zeng, Conghui He, Binhang Yuan, Wentao Zhang

机构 * HKUST(香港科技大学) Peking University(北京大学) Shanghai AI Lab(上海人工智能实验室) Imperial College London(伦敦帝国理工学院)

专题命中 视觉推理 :visual reasoning(title,abstract);visual question answering(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07202 2025-06-10 cs.AI 83%

Reasoning Multimodal Large Language Model: Data Contamination and Dynamic Evaluation

Ming Liu, Wensheng Zhang

机构 * Department of Computer Science(计算机科学系) Iowa State University(爱荷华州立大学)

专题命中 视觉推理 :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.01744 2025-06-09 cs.CV cs.CL 83%

Leopard: A Vision Language Model For Text-Rich Multi-Image Tasks

Mengzhao Jia, Wenhao Yu, Kaixin Ma, Tianqing Fang, Zhihan Zhang, Siru Ouyang, Hongming Zhang, Dong Yu, Meng Jiang

机构 * University of Notre Dame(诺丁汉大学) Tencent AI Seattle Lab(腾讯AI西雅图实验室) UIUC(伊利诺伊大学香槟分校)

专题命中 视觉推理 :vision language model(title);multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

Comments Our code is available at https://github.com/tencent-ailab/Leopard

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.00304 2025-06-04 cs.CV 83%

StimuVAR: Spatiotemporal Stimuli-aware Video Affective Reasoning with Multimodal Large Language Models

Yuxiang Guo, Faizan Siddiqui, Yang Zhao, Rama Chellappa, Shao-Yuan Lo

机构 * Johns Hopkins University(约翰霍普金斯大学) Honda Research Institute USA(本田研究院美国)

专题命中 视觉推理 :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.CV

Comments Paper is accepted by IJCV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00123 2025-06-03 cs.CV cs.RO 83%

Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces

Gen Luo, Ganlin Yang, Ziyang Gong, Guanzhou Chen, Haonan Duan, Erfei Cui, Ronglei Tong, Zhi Hou, Tianyi Zhang, Zhe Chen, Shenglong Ye, Lewei Lu, Jingbo Wang, Wenhai Wang, Jifeng Dai, Yu Qiao, Rongrong Ji, Xizhou Zhu

机构 * Shanghai AI Laboratory(上海人工智能实验室) Tsinghua University(清华大学) University of Science and Technology of China(中国科学技术大学) Shanghai Jiao Tong University(上海交通大学) Xiamen University(厦门大学) SenseTime Research(商汤科技研究院) Zhejiang University(浙江大学) Nanjing University(南京大学)

专题命中 视觉推理 :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24173 2025-06-02 cs.CV 83%

DrVD-Bench: Do Vision-Language Models Reason Like Human Doctors in Medical Image Diagnosis?

Tianhong Zhou, Yin Xu, Yingtao Zhu, Chuxi Xiao, Haiyang Bian, Lei Wei, Xuegong Zhang

机构 * Tsinghua University(清华大学)

专题命中 视觉推理 :vision-language model(title,abstract);visual reasoning(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19684 2025-05-29 cs.CV 83%

VisCRA: A Visual Chain Reasoning Attack for Jailbreaking Multimodal Large Language Models

Bingrui Sima, Linhua Cong, Wenxuan Wang, Kun He

机构 * Huazhong University of Science and Technology(华中科技大学) Hong Kong University of Science and Technology(香港科技大学)

专题命中 视觉推理 :multimodal large language model(title,abstract);visual reasoning(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.13112 2025-05-28 cs.CV 83%

SURDS: Benchmarking Spatial Understanding and Reasoning in Driving Scenarios with Vision Language Models

Xianda Guo, Ruijun Zhang, Yiqun Duan, Yuhang He, Dujun Nie, Wenke Huang, Chenming Zhang, Shuai Liu, Hao Zhao, Long Chen

机构 * School of Computer Science, Wuhan University(武汉大学计算机学院) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Waytous University of Technology Sydney(悉尼大学) Microsoft Research(微软研究院) IAIR, Xi’an Jiaotong University(西安交通大学IAIR) TikTok AIR, Tsinghua University(清华大学AIR)

专题命中 视觉推理 :vision language model(title,abstract);MLLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19149 2025-05-27 cs.CV 83%

MIND-Edit: MLLM Insight-Driven Editing via Language-Vision Projection

Shuyu Wang, Weiqi Li, Qian Wang, Shijie Zhao, Jian Zhang

机构 * School of Electronic and Computer Engineering, Peking University(北京大学电子与计算机工程学院) ByteDance Inc.(字节跳动公司)

专题命中 视觉推理 :MLLM(title,abstract);multimodal large language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15259 2025-05-27 cs.LG cs.CL 83%

ReGUIDE: Data Efficient GUI Grounding via Spatial Reasoning and Search

Hyunseok Lee, Jeonghoon Kim, Beomjun Kim, Jihoon Tack, Chansong Jo, Jaehong Lee, Cheonbok Park, Sookyo In, Jinwoo Shin, Kang Min Yoo

机构 * KAIST(韩国科学技术院) NAVER Cloud(NAVER云)

专题命中 视觉推理 :grounding(title,abstract);multimodal large language model(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11436 2025-05-22 cs.CL cs.AI 83%

GODBench: A Benchmark for Multimodal Large Language Models in Video Comment Art

Yiming Lei, Chenkai Zhang, Zeming Liu, Haitao Leng, Shaoguo Liu, Tingting Gao, Qingjie Liu, Yunhong Wang

专题命中 视觉推理 :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.AI

Comments 69 pages, 66 figures, accepted by ACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13426 2025-05-20 cs.CV 83%

G1: Bootstrapping Perception and Reasoning Abilities of Vision-Language Model via Reinforcement Learning

Liang Chen, Hongcheng Gao, Tianyu Liu, Zhiqi Huang, Flood Sung, Xinyu Zhou, Yuxin Wu, Baobao Chang

机构 * Peking University(北京大学) UCAS(中国科学院大学) Moonshot AI

专题命中 视觉推理 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV

Comments 21 pages, 14 figures, code released at https://github.com/chenllliang/G1

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13419 2025-05-20 cs.CV 83%

FEALLM: Advancing Facial Emotion Analysis in Multimodal Large Language Models with Emotional Synergy and Reasoning

Zhuozhao Hu, Kaishen Yuan, Xin Liu, Zitong Yu, Yuan Zong, Jingang Shi, Huanjing Yue, Jingyu Yang

机构 * Tianjin University(天津大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) Lappeenranta-Lahti University of Technology LUT(拉佩兰塔-拉赫蒂技术大学) Great Bay University(大湾大学) Southeast University(东南大学) Xi’an Jiaotong University(西安交通大学)

专题命中 视觉推理 :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.CV

Comments 10 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11907 2025-05-20 cs.CV 83%

Are Multimodal Large Language Models Ready for Omnidirectional Spatial Reasoning?

Zihao Dongfang, Xu Zheng, Ziqiao Weng, Yuanhuiyi Lyu, Danda Pani Paudel, Luc Van Gool, Kailun Yang, Xuming Hu

专题命中 视觉推理 :multimodal large language model(title,abstract);grounding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11838 2025-05-20 cs.CV 83%

RVTBench: A Benchmark for Visual Reasoning Tasks

Yiqing Shen, Chenjia Li, Chenxiao Fan, Mathias Unberath

机构 * Johns Hopkins University(约翰霍普金斯大学)

专题命中 视觉推理 :visual reasoning(title,abstract);grounding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.09118 2025-05-15 cs.CV 83%

Seeing Beyond the Scene: Enhancing Vision-Language Models with Interactional Reasoning

Dayong Liang, Changmeng Zheng, Zhiyuan Wen, Yi Cai, Xiao-Yong Wei, Qing Li

机构 * South China University of Technology(华南理工大学) The Hong Kong Polytechnic University(香港理工大学) Peng Cheng Laboratory(彭成实验室)

专题命中 视觉推理 :vision-language model(title,abstract);grounding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.12533 2025-05-13 cs.RO cs.LG 83%

Being-0: A Humanoid Robotic Agent with Vision-Language Models and Modular Skills

Haoqi Yuan, Yu Bai, Yuhui Fu, Bohan Zhou, Yicheng Feng, Xinrun Xu, Yi Zhan, Börje F. Karlsson, Zongqing Lu

机构 * Peking University(北京大学) BAAI(百度人工智能研究院) BeingBeyond

专题命中 视觉推理 :vision-language model(title,abstract);VLM(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.18671 2025-04-29 cs.AI 83%

Proof-of-TBI -- Fine-Tuned Vision Language Model Consortium and OpenAI-o3 Reasoning LLM-Based Medical Diagnosis Support System for Mild Traumatic Brain Injury (TBI) Prediction

Ross Gore, Eranga Bandara, Sachin Shetty, Alberto E. Musto, Pratip Rana, Ambrosio Valencia-Romero, Christopher Rhea, Lobat Tayebi, Heather Richter, Atmaram Yarlagadda, Donna Edmonds, Steven Wallace, Donna Broshek

机构 * Old Dominion University(旧 Dominion 大学) McDonald Army Health Center(麦克唐纳陆军医疗中心) BRAINBox Solutions(BRAINBox 解决方案) UVA Health(弗吉尼亚大学健康系统)

专题命中 视觉推理 :vision language model(title,abstract);vision-language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.15624 2025-04-29 cs.CV 83%

FaceInsight: A Multimodal Large Language Model for Face Perception

Jingzhi Li, Changjiang Luo, Ruoyu Chen, Hua Zhang, Wenqi Ren, Jianhou Gan, Xiaochun Cao

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院) School of Cyber Science and Technology, Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区计算机科学与技术学院) Key Laboratory of Education Informatization for Nationalities (Yunnan Normal University), Ministry of Education(民族教育信息化重点实验室(云南师范大学))

专题命中 视觉推理 :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.15279 2025-04-22 cs.CV 83%

VisuLogic: A Benchmark for Evaluating Visual Reasoning in Multi-modal Large Language Models

Weiye Xu, Jiahao Wang, Weiyun Wang, Zhe Chen, Wengang Zhou, Aijun Yang, Lewei Lu, Houqiang Li, Xiaohua Wang, Xizhou Zhu, Wenhai Wang, Jifeng Dai, Jinguo Zhu

机构 * University of Science and Technology of China(中国科学技术大学) Xi’an Jiaotong University(西安交通大学) SenseTime Research(商汤科技研究院) Tsinghua University(清华大学)

专题命中 视觉推理 :visual reasoning(title,abstract);multimodal large language model(abstract);分类 cs.CV

Comments Code, data, and baselines are available at https://visulogic-benchmark.github.io/VisuLogic

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.14904 2025-04-22 cs.SI cs.AI cs.CL cs.MM 83%

VLM as Policy: Common-Law Content Moderation Framework for Short Video Platform

Xingyu Lu, Tianke Zhang, Chang Meng, Xiaobei Wang, Jinpeng Wang, YiFan Zhang, Shisong Tang, Changyi Liu, Haojie Ding, Kaiyu Jiang, Kaiyu Tang, Bin Wen, Hai-Tao Zheng, Fan Yang, Tingting Gao, Di Zhang, Kun Gai

专题命中 视觉推理 :VLM(title,abstract);vision language model(abstract);分类 cs.AI

Comments 20 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.04781 2025-04-08 cs.CV 83%

OCC-MLLM-CoT-Alpha: Towards Multi-stage Occlusion Recognition Based on Large Language Models via 3D-Aware Supervision and Chain-of-Thoughts Guidance

Chaoyi Wang, Baoqing Li, Xinhan Di

专题命中 视觉推理 :MLLM(title,abstract);vision-language model(abstract);分类 cs.CV

Comments This work has been accepted to the Multimodal Algorithmic Reasoning (MAR) Workshop at CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.03735 2025-04-02 cs.CV 83%

VidHalluc: Evaluating Temporal Hallucinations in Multimodal Large Language Models for Video Understanding

Chaoyu Li, Eun Woo Im, Pooyan Fazli

专题命中 视觉推理 :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.CV

Comments CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.19707 2025-03-26 cs.CV cs.CL 83%

Mind the Gap: Benchmarking Spatial Reasoning in Vision-Language Models

Ilias Stogiannidis, Steven McDonagh, Sotirios A. Tsaftaris

专题命中 视觉推理 :vision-language model(title,abstract);visual question answering(abstract);分类 cs.CV

Comments 8 main pages, 4 pages Appendix, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.16326 2025-03-21 cs.AI 83%

OmniGeo: Towards a Multimodal Large Language Models for Geospatial Artificial Intelligence

Long Yuan, Fengran Mo, Kaiyu Huang, Wenjie Wang, Wangyuxuan Zhai, Xiaoyu Zhu, You Li, Jinan Xu, Jian-Yun Nie

专题命中 视觉推理 :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.AI

Comments 15 pages, Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.01754 2025-03-21 cs.CV 83%

SDRT: Enhance Vision-Language Models by Self-Distillation with Diverse Reasoning Traces

Guande Wu, Huan Song, Yawei Wang, Qiaojing Yan, Yijun Tian, Lin Lee Cheong, Panpan Xu

专题命中 视觉推理 :vision-language model(title,abstract);visual reasoning(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06670 2025-03-11 cs.CV cs.CL 83%

Attention, Please! PixelSHAP Reveals What Vision-Language Models Actually Focus On

Roni Goldshmidt

专题命中 视觉推理 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.05064 2025-03-10 cs.RO cs.AI 83%

Perceiving, Reasoning, Adapting: A Dual-Layer Framework for VLM-Guided Precision Robotic Manipulation

Qingxuan Jia, Guoqin Tang, Zeyuan Huang, Zixuan Hao, Ning Ji, Shihang, Yin, Gang Chen

专题命中 视觉推理 :VLM(title,abstract);vision-language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.00761 2025-03-04 cs.RO cs.CV cs.MA cs.SY eess.SY 83%

TRACE: A Self-Improving Framework for Robot Behavior Forecasting with Vision-Language Models

Gokul Puthumanaillam, Paulo Padrao, Jose Fuentes, Pranay Thangeda, William E. Schafer, Jae Hyuk Song, Karan Jagdale, Leonardo Bobadilla, Melkior Ornik

专题命中 视觉推理 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏