arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 4447 信号源:cs.CV, cs.AI, cs.LG

1. 视觉推理 4447 篇

2505.09118 2025-05-15 cs.CV 83%

Seeing Beyond the Scene: Enhancing Vision-Language Models with Interactional Reasoning

Dayong Liang, Changmeng Zheng, Zhiyuan Wen, Yi Cai, Xiao-Yong Wei, Qing Li

机构 * South China University of Technology(华南理工大学) The Hong Kong Polytechnic University(香港理工大学) Peng Cheng Laboratory(彭成实验室)

专题命中 视觉推理 :vision-language model(title,abstract);grounding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.12533 2025-05-13 cs.RO cs.LG 83%

Being-0: A Humanoid Robotic Agent with Vision-Language Models and Modular Skills

Haoqi Yuan, Yu Bai, Yuhui Fu, Bohan Zhou, Yicheng Feng, Xinrun Xu, Yi Zhan, Börje F. Karlsson, Zongqing Lu

机构 * Peking University(北京大学) BAAI(百度人工智能研究院) BeingBeyond

专题命中 视觉推理 :vision-language model(title,abstract);VLM(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.18671 2025-04-29 cs.AI 83%

Proof-of-TBI -- Fine-Tuned Vision Language Model Consortium and OpenAI-o3 Reasoning LLM-Based Medical Diagnosis Support System for Mild Traumatic Brain Injury (TBI) Prediction

Ross Gore, Eranga Bandara, Sachin Shetty, Alberto E. Musto, Pratip Rana, Ambrosio Valencia-Romero, Christopher Rhea, Lobat Tayebi, Heather Richter, Atmaram Yarlagadda, Donna Edmonds, Steven Wallace, Donna Broshek

机构 * Old Dominion University(旧 Dominion 大学) McDonald Army Health Center(麦克唐纳陆军医疗中心) BRAINBox Solutions(BRAINBox 解决方案) UVA Health(弗吉尼亚大学健康系统)

专题命中 视觉推理 :vision language model(title,abstract);vision-language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.15624 2025-04-29 cs.CV 83%

FaceInsight: A Multimodal Large Language Model for Face Perception

Jingzhi Li, Changjiang Luo, Ruoyu Chen, Hua Zhang, Wenqi Ren, Jianhou Gan, Xiaochun Cao

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院) School of Cyber Science and Technology, Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区计算机科学与技术学院) Key Laboratory of Education Informatization for Nationalities (Yunnan Normal University), Ministry of Education(民族教育信息化重点实验室(云南师范大学))

专题命中 视觉推理 :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.15279 2025-04-22 cs.CV 83%

VisuLogic: A Benchmark for Evaluating Visual Reasoning in Multi-modal Large Language Models

Weiye Xu, Jiahao Wang, Weiyun Wang, Zhe Chen, Wengang Zhou, Aijun Yang, Lewei Lu, Houqiang Li, Xiaohua Wang, Xizhou Zhu, Wenhai Wang, Jifeng Dai, Jinguo Zhu

机构 * University of Science and Technology of China(中国科学技术大学) Xi’an Jiaotong University(西安交通大学) SenseTime Research(商汤科技研究院) Tsinghua University(清华大学)

专题命中 视觉推理 :visual reasoning(title,abstract);multimodal large language model(abstract);分类 cs.CV

Comments Code, data, and baselines are available at https://visulogic-benchmark.github.io/VisuLogic

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.14904 2025-04-22 cs.SI cs.AI cs.CL cs.MM 83%

VLM as Policy: Common-Law Content Moderation Framework for Short Video Platform

Xingyu Lu, Tianke Zhang, Chang Meng, Xiaobei Wang, Jinpeng Wang, YiFan Zhang, Shisong Tang, Changyi Liu, Haojie Ding, Kaiyu Jiang, Kaiyu Tang, Bin Wen, Hai-Tao Zheng, Fan Yang, Tingting Gao, Di Zhang, Kun Gai

专题命中 视觉推理 :VLM(title,abstract);vision language model(abstract);分类 cs.AI

Comments 20 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.04781 2025-04-08 cs.CV 83%

OCC-MLLM-CoT-Alpha: Towards Multi-stage Occlusion Recognition Based on Large Language Models via 3D-Aware Supervision and Chain-of-Thoughts Guidance

Chaoyi Wang, Baoqing Li, Xinhan Di

专题命中 视觉推理 :MLLM(title,abstract);vision-language model(abstract);分类 cs.CV

Comments This work has been accepted to the Multimodal Algorithmic Reasoning (MAR) Workshop at CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.03735 2025-04-02 cs.CV 83%

VidHalluc: Evaluating Temporal Hallucinations in Multimodal Large Language Models for Video Understanding

Chaoyu Li, Eun Woo Im, Pooyan Fazli

专题命中 视觉推理 :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.CV

Comments CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.19707 2025-03-26 cs.CV cs.CL 83%

Mind the Gap: Benchmarking Spatial Reasoning in Vision-Language Models

Ilias Stogiannidis, Steven McDonagh, Sotirios A. Tsaftaris

专题命中 视觉推理 :vision-language model(title,abstract);visual question answering(abstract);分类 cs.CV

Comments 8 main pages, 4 pages Appendix, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.16326 2025-03-21 cs.AI 83%

OmniGeo: Towards a Multimodal Large Language Models for Geospatial Artificial Intelligence

Long Yuan, Fengran Mo, Kaiyu Huang, Wenjie Wang, Wangyuxuan Zhai, Xiaoyu Zhu, You Li, Jinan Xu, Jian-Yun Nie

专题命中 视觉推理 :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.AI

Comments 15 pages, Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.01754 2025-03-21 cs.CV 83%

SDRT: Enhance Vision-Language Models by Self-Distillation with Diverse Reasoning Traces

Guande Wu, Huan Song, Yawei Wang, Qiaojing Yan, Yijun Tian, Lin Lee Cheong, Panpan Xu

专题命中 视觉推理 :vision-language model(title,abstract);visual reasoning(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06670 2025-03-11 cs.CV cs.CL 83%

Attention, Please! PixelSHAP Reveals What Vision-Language Models Actually Focus On

Roni Goldshmidt

专题命中 视觉推理 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.05064 2025-03-10 cs.RO cs.AI 83%

Perceiving, Reasoning, Adapting: A Dual-Layer Framework for VLM-Guided Precision Robotic Manipulation

Qingxuan Jia, Guoqin Tang, Zeyuan Huang, Zixuan Hao, Ning Ji, Shihang, Yin, Gang Chen

专题命中 视觉推理 :VLM(title,abstract);vision-language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.00761 2025-03-04 cs.RO cs.CV cs.MA cs.SY eess.SY 83%

TRACE: A Self-Improving Framework for Robot Behavior Forecasting with Vision-Language Models

Gokul Puthumanaillam, Paulo Padrao, Jose Fuentes, Pranay Thangeda, William E. Schafer, Jae Hyuk Song, Karan Jagdale, Leonardo Bobadilla, Melkior Ornik

专题命中 视觉推理 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.20573 2025-03-03 cs.CV cs.CL 83%

Visual Reasoning at Urban Intersections: FineTuning GPT-4o for Traffic Conflict Detection

Sari Masri, Huthaifa I. Ashqar, Mohammed Elhenawy

专题命中 视觉推理 :visual reasoning(title,abstract);multimodal large language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.18735 2025-02-27 cs.RO cs.CV 83%

QueryAdapter: Rapid Adaptation of Vision-Language Models in Response to Natural Language Queries

Nicolas Harvey Chapman, Feras Dayoub, Will Browne, Christopher Lehnert

专题命中 视觉推理 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.11913 2025-02-17 cs.AI cs.RO 83%

On-Board Vision-Language Models for Personalized Autonomous Vehicle Motion Control: System Design and Real-World Validation

Can Cui, Zichong Yang, Yupeng Zhou, Juntong Peng, Sung-Yeon Park, Cong Zhang, Yunsheng Ma, Xu Cao, Wenqian Ye, Yiheng Feng, Jitesh Panchal, Lingxi Li, Yaobin Chen, Ziran Wang

专题命中 视觉推理 :vision-language model(title,abstract);VLM(abstract);分类 cs.AI

Comments arXiv admin note: substantial text overlap with arXiv:2410.15281

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.04389 2025-02-10 cs.SE cs.AI 83%

Overcoming Vision Language Model Challenges in Diagram Understanding: A Proof-of-Concept with XML-Driven Large Language Models Solutions

Shue Shiinoki, Ryo Koshihara, Hayato Motegi, Masumi Morishige

专题命中 视觉推理 :vision language model(title);vision-language model(abstract);VLM(abstract);分类 cs.AI

Comments The related code is available at \url{https://github.com/galirage/spreadsheet-intelligence}, which provides the core library developed for this research. The experimental code using this library can be found at \url{https://github.com/galirage/XMLDriven-Diagram-Understanding}

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.01487 2025-02-06 cs.CV cs.CL 83%

What Makes for Good Visual Instructions? Synthesizing Complex Visual Reasoning Instructions for Visual Instruction Tuning

Yifan Du, Hangyu Guo, Kun Zhou, Wayne Xin Zhao, Jinpeng Wang, Chuyuan Wang, Mingchen Cai, Ruihua Song, Ji-Rong Wen

专题命中 视觉推理 :visual reasoning(title,abstract);LLaVA(abstract);分类 cs.CV

Comments Accepted by COLING2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.17345 2025-01-16 cs.CV 83%

3VL: Using Trees to Improve Vision-Language Models' Interpretability

Nir Yellinek, Leonid Karlinsky, Raja Giryes

专题命中 视觉推理 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV

Comments accepted to IEEE TIP

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.06186 2025-01-13 cs.CV 83%

LlamaV-o1: Rethinking Step-by-step Visual Reasoning in LLMs

Omkar Thawakar, Dinura Dissanayake, Ketan More, Ritesh Thawkar, Ahmed Heakl, Noor Ahsan, Yuhao Li, Mohammed Zumri, Jean Lahoud, Rao Muhammad Anwer, Hisham Cholakkal, Ivan Laptev, Mubarak Shah, Fahad Shahbaz Khan, Salman Khan

专题命中 视觉推理 :visual reasoning(title,abstract);LLaVA(abstract);分类 cs.CV

Comments 15 pages, 5 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.16583 2024-12-24 cs.CV 83%

REO-VLM: Transforming VLM to Meet Regression Challenges in Earth Observation

Xizhe Xue, Guoting Wei, Hao Chen, Haokui Zhang, Feng Lin, Chunhua Shen, Xiao Xiang Zhu

专题命中 视觉推理 :VLM(title,abstract);vision language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.09951 2024-12-18 cs.CV 83%

WiseAD: Knowledge Augmented End-to-End Autonomous Driving with Vision-Language Model

Songyan Zhang, Wenhui Huang, Zihui Gao, Hao Chen, Chen Lv

专题命中 视觉推理 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.15714 2024-11-26 cs.CV 83%

ROOT: VLM based System for Indoor Scene Understanding and Beyond

Yonghui Wang, Shi-Yong Chen, Zhenxing Zhou, Siyi Li, Haoran Li, Wengang Zhou, Houqiang Li

专题命中 视觉推理 :VLM(title,abstract);vision language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.11360 2024-11-19 cs.CV 83%

CCExpert: Advancing MLLM Capability in Remote Sensing Change Captioning with Difference-Aware Integration and a Foundational Dataset

Zhiming Wang, Mingze Wang, Sheng Xu, Yanjing Li, Baochang Zhang

专题命中 视觉推理 :MLLM(title,abstract);multimodal large language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.09052 2024-11-15 cs.RO cs.LG 83%

ClevrSkills: Compositional Language and Visual Reasoning in Robotics

Sanjay Haresh, Daniel Dijkman, Apratim Bhattacharyya, Roland Memisevic

专题命中 视觉推理 :visual reasoning(title);vision language model(abstract);VLM(abstract);分类 cs.LG

Comments To appear at NeurIPS 2024 (D&B track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.05755 2024-11-11 cs.RO cs.CL cs.CV 83%

End-to-End Navigation with Vision Language Models: Transforming Spatial Reasoning into Question-Answering

Dylan Goetting, Himanshu Gaurav Singh, Antonio Loquercio

专题命中 视觉推理 :vision language model(title);vision-language model(abstract);VLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.20883 2024-11-04 cs.CV 83%

Improving Generalization in Visual Reasoning via Self-Ensemble

Tien-Huy Nguyen, Quang-Khai Tran, Anh-Tuan Quang-Hoang

专题命中 视觉推理 :visual reasoning(title,abstract);vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.13438 2024-10-31 cs.CV 83%

SpatialPIN: Enhancing Spatial Reasoning Capabilities of Vision-Language Models through Prompting and Interacting 3D Priors

Chenyang Ma, Kai Lu, Ta-Ying Cheng, Niki Trigoni, Andrew Markham

专题命中 视觉推理 :vision-language model(title);VLM(abstract);visual question answering(abstract);分类 cs.CV

Comments NeurIPS 2024; Project Page: https://dannymcy.github.io/zeroshot_task_hallucination/

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.03659 2024-10-14 cs.CV cs.CL 83%

Unraveling Cross-Modality Knowledge Conflicts in Large Vision-Language Models

Tinghui Zhu, Qin Liu, Fei Wang, Zhengzhong Tu, Muhao Chen

专题命中 视觉推理 :vision-language model(title,abstract);LLaVA(abstract);分类 cs.CV

Comments Website: https://darthzhu.github.io/cross-modality-knowledge-conflict/

详情

展开后加载摘要…

URL PDF HTML 收藏