arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 26117 信号源:cs.CV, cs.AI, cs.LG

1. 视觉推理 4478 篇

2502.20573 2025-03-03 cs.CV cs.CL 83%

Visual Reasoning at Urban Intersections: FineTuning GPT-4o for Traffic Conflict Detection

Sari Masri, Huthaifa I. Ashqar, Mohammed Elhenawy

专题命中 视觉推理 :visual reasoning(title,abstract);multimodal large language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.18735 2025-02-27 cs.RO cs.CV 83%

QueryAdapter: Rapid Adaptation of Vision-Language Models in Response to Natural Language Queries

Nicolas Harvey Chapman, Feras Dayoub, Will Browne, Christopher Lehnert

专题命中 视觉推理 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.11913 2025-02-17 cs.AI cs.RO 83%

On-Board Vision-Language Models for Personalized Autonomous Vehicle Motion Control: System Design and Real-World Validation

Can Cui, Zichong Yang, Yupeng Zhou, Juntong Peng, Sung-Yeon Park, Cong Zhang, Yunsheng Ma, Xu Cao, Wenqian Ye, Yiheng Feng, Jitesh Panchal, Lingxi Li, Yaobin Chen, Ziran Wang

专题命中 视觉推理 :vision-language model(title,abstract);VLM(abstract);分类 cs.AI

Comments arXiv admin note: substantial text overlap with arXiv:2410.15281

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.04389 2025-02-10 cs.SE cs.AI 83%

Overcoming Vision Language Model Challenges in Diagram Understanding: A Proof-of-Concept with XML-Driven Large Language Models Solutions

Shue Shiinoki, Ryo Koshihara, Hayato Motegi, Masumi Morishige

专题命中 视觉推理 :vision language model(title);vision-language model(abstract);VLM(abstract);分类 cs.AI

Comments The related code is available at \url{https://github.com/galirage/spreadsheet-intelligence}, which provides the core library developed for this research. The experimental code using this library can be found at \url{https://github.com/galirage/XMLDriven-Diagram-Understanding}

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.01487 2025-02-06 cs.CV cs.CL 83%

What Makes for Good Visual Instructions? Synthesizing Complex Visual Reasoning Instructions for Visual Instruction Tuning

Yifan Du, Hangyu Guo, Kun Zhou, Wayne Xin Zhao, Jinpeng Wang, Chuyuan Wang, Mingchen Cai, Ruihua Song, Ji-Rong Wen

专题命中 视觉推理 :visual reasoning(title,abstract);LLaVA(abstract);分类 cs.CV

Comments Accepted by COLING2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.17345 2025-01-16 cs.CV 83%

3VL: Using Trees to Improve Vision-Language Models' Interpretability

Nir Yellinek, Leonid Karlinsky, Raja Giryes

专题命中 视觉推理 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV

Comments accepted to IEEE TIP

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.06186 2025-01-13 cs.CV 83%

LlamaV-o1: Rethinking Step-by-step Visual Reasoning in LLMs

Omkar Thawakar, Dinura Dissanayake, Ketan More, Ritesh Thawkar, Ahmed Heakl, Noor Ahsan, Yuhao Li, Mohammed Zumri, Jean Lahoud, Rao Muhammad Anwer, Hisham Cholakkal, Ivan Laptev, Mubarak Shah, Fahad Shahbaz Khan, Salman Khan

专题命中 视觉推理 :visual reasoning(title,abstract);LLaVA(abstract);分类 cs.CV

Comments 15 pages, 5 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.16583 2024-12-24 cs.CV 83%

REO-VLM: Transforming VLM to Meet Regression Challenges in Earth Observation

Xizhe Xue, Guoting Wei, Hao Chen, Haokui Zhang, Feng Lin, Chunhua Shen, Xiao Xiang Zhu

专题命中 视觉推理 :VLM(title,abstract);vision language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.09951 2024-12-18 cs.CV 83%

WiseAD: Knowledge Augmented End-to-End Autonomous Driving with Vision-Language Model

Songyan Zhang, Wenhui Huang, Zihui Gao, Hao Chen, Chen Lv

专题命中 视觉推理 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.15714 2024-11-26 cs.CV 83%

ROOT: VLM based System for Indoor Scene Understanding and Beyond

Yonghui Wang, Shi-Yong Chen, Zhenxing Zhou, Siyi Li, Haoran Li, Wengang Zhou, Houqiang Li

专题命中 视觉推理 :VLM(title,abstract);vision language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.11360 2024-11-19 cs.CV 83%

CCExpert: Advancing MLLM Capability in Remote Sensing Change Captioning with Difference-Aware Integration and a Foundational Dataset

Zhiming Wang, Mingze Wang, Sheng Xu, Yanjing Li, Baochang Zhang

专题命中 视觉推理 :MLLM(title,abstract);multimodal large language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.09052 2024-11-15 cs.RO cs.LG 83%

ClevrSkills: Compositional Language and Visual Reasoning in Robotics

Sanjay Haresh, Daniel Dijkman, Apratim Bhattacharyya, Roland Memisevic

专题命中 视觉推理 :visual reasoning(title);vision language model(abstract);VLM(abstract);分类 cs.LG

Comments To appear at NeurIPS 2024 (D&B track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.05755 2024-11-11 cs.RO cs.CL cs.CV 83%

End-to-End Navigation with Vision Language Models: Transforming Spatial Reasoning into Question-Answering

Dylan Goetting, Himanshu Gaurav Singh, Antonio Loquercio

专题命中 视觉推理 :vision language model(title);vision-language model(abstract);VLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.20883 2024-11-04 cs.CV 83%

Improving Generalization in Visual Reasoning via Self-Ensemble

Tien-Huy Nguyen, Quang-Khai Tran, Anh-Tuan Quang-Hoang

专题命中 视觉推理 :visual reasoning(title,abstract);vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.13438 2024-10-31 cs.CV 83%

SpatialPIN: Enhancing Spatial Reasoning Capabilities of Vision-Language Models through Prompting and Interacting 3D Priors

Chenyang Ma, Kai Lu, Ta-Ying Cheng, Niki Trigoni, Andrew Markham

专题命中 视觉推理 :vision-language model(title);VLM(abstract);visual question answering(abstract);分类 cs.CV

Comments NeurIPS 2024; Project Page: https://dannymcy.github.io/zeroshot_task_hallucination/

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.03659 2024-10-14 cs.CV cs.CL 83%

Unraveling Cross-Modality Knowledge Conflicts in Large Vision-Language Models

Tinghui Zhu, Qin Liu, Fei Wang, Zhengzhong Tu, Muhao Chen

专题命中 视觉推理 :vision-language model(title,abstract);LLaVA(abstract);分类 cs.CV

Comments Website: https://darthzhu.github.io/cross-modality-knowledge-conflict/

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.06765 2024-10-10 cs.CL cs.CV 83%

To Preserve or To Compress: An In-Depth Study of Connector Selection in Multimodal Large Language Models

Junyan Lin, Haoran Chen, Dawei Zhu, Xiaoyu Shen

专题命中 视觉推理 :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.CV

Comments Accepted to EMNLP 2024 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.09788 2024-09-17 cs.CV cs.CL 83%

Reasoning Paths with Reference Objects Elicit Quantitative Spatial Reasoning in Large Vision-Language Models

Yuan-Hong Liao, Rafid Mahmood, Sanja Fidler, David Acuna

专题命中 视觉推理 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV

Comments 20 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.02231 2024-08-06 cs.CV 83%

REVISION: Rendering Tools Enable Spatial Fidelity in Vision-Language Models

Agneet Chatterjee, Yiran Luo, Tejas Gokhale, Yezhou Yang, Chitta Baral

专题命中 视觉推理 :vision-language model(title,abstract);multimodal large language model(abstract);分类 cs.CV

Comments Accepted to ECCV 2024. Project Page : https://agneetchatterjee.com/revision/

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.19666 2024-07-30 cs.CV 83%

Take A Step Back: Rethinking the Two Stages in Visual Reasoning

Mingyu Zhang, Jiting Cai, Mingyu Liu, Yue Xu, Cewu Lu, Yong-Lu Li

专题命中 视觉推理 :visual reasoning(title,abstract);visual question answering(abstract);分类 cs.CV

Comments ECCV 2024, Project page: https://mybearyzhang.github.io/projects/TwoStageReason/

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.16500 2024-07-30 cs.CV 83%

LLMGA: Multimodal Large Language Model based Generation Assistant

Bin Xia, Shiyin Wang, Yingfan Tao, Yitong Wang, Jiaya Jia

专题命中 视觉推理 :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.CV

Comments The paper is accepted by ECCV2024. The code is available at https://github.com/dvlab-research/LLMGA

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.12884 2024-07-23 cs.CV 83%

HYDRA: A Hyper Agent for Dynamic Compositional Visual Reasoning

Fucai Ke, Zhixi Cai, Simindokht Jahangard, Weiqing Wang, Pari Delir Haghighi, Hamid Rezatofighi

专题命中 视觉推理 :visual reasoning(title,abstract);vision-language model(abstract);分类 cs.CV

Comments Accepted by ECCV2024. Project page: https://hydra-vl4ai.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.02666 2024-07-04 cs.RO cs.AI 83%

Commonsense Reasoning for Legged Robot Adaptation with Vision-Language Models

Annie S. Chen, Alec M. Lessing, Andy Tang, Govind Chada, Laura Smith, Sergey Levine, Chelsea Finn

专题命中 视觉推理 :vision-language model(title,abstract);VLM(abstract);分类 cs.AI

Comments 27 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.02042 2024-07-03 cs.CL cs.AI 83%

Fake News Detection and Manipulation Reasoning via Large Vision-Language Models

Ruihan Jin, Ruibo Fu, Zhengqi Wen, Shuai Zhang, Yukun Liu, Jianhua Tao

专题命中 视觉推理 :vision-language model(title,abstract);LLaVA(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.15359 2024-06-25 cs.CL cs.CV 83%

Constructing Multilingual Visual-Text Datasets Revealing Visual Multilingual Ability of Vision Language Models

Jesse Atuhurra, Iqra Ali, Tatsuya Hiraoka, Hidetaka Kamigaito, Tomoya Iwakura, Taro Watanabe

专题命中 视觉推理 :vision language model(title,abstract);VLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.15915 2024-06-21 cs.CV 83%

ChartBench: A Benchmark for Complex Visual Reasoning in Charts

Zhengzhuo Xu, Sinan Du, Yiyan Qi, Chengjin Xu, Chun Yuan, Jian Guo

专题命中 视觉推理 :visual reasoning(title,abstract);multimodal large language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.06865 2024-06-12 cs.AI 83%

Eyeballing Combinatorial Problems: A Case Study of Using Multimodal Large Language Models to Solve Traveling Salesman Problems

Mohammed Elhenawy, Ahmed Abdelhay, Taqwa I. Alhadidi, Huthaifa I Ashqar, Shadi Jaradat, Ahmed Jaber, Sebastien Glaser, Andry Rakotonirainy

专题命中 视觉推理 :multimodal large language model(title,abstract);visual reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.01031 2024-05-28 cs.CL cs.AI 83%

Peacock: A Family of Arabic Multimodal Large Language Models and Benchmarks

Fakhraddin Alwajih, El Moatez Billah Nagoudi, Gagan Bhatia, Abdelrahman Mohamed, Muhammad Abdul-Mageed

专题命中 视觉推理 :multimodal large language model(title,abstract);visual reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.16006 2024-04-25 cs.CV 83%

MMT-Bench: A Comprehensive Multimodal Benchmark for Evaluating Large Vision-Language Models Towards Multitask AGI

Kaining Ying, Fanqing Meng, Jin Wang, Zhiqian Li, Han Lin, Yue Yang, Hao Zhang, Wenbo Zhang, Yuqi Lin, Shuo Liu, Jiayi Lei, Quanfeng Lu, Runjian Chen, Peng Xu, Renrui Zhang, Haozhe Zhang, Peng Gao, Yali Wang, Yu Qiao, Ping Luo, Kaipeng Zhang, Wenqi Shao

专题命中 视觉推理 :vision-language model(title,abstract);InternVL(abstract);分类 cs.CV

Comments 77 pages, 41 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.03052 2024-04-08 cs.CV cs.CL 83%

Visual Program Distillation: Distilling Tools and Programmatic Reasoning into Vision-Language Models

Yushi Hu, Otilia Stretcu, Chun-Ta Lu, Krishnamurthy Viswanathan, Kenji Hata, Enming Luo, Ranjay Krishna, Ariel Fuxman

专题命中 视觉推理 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV

Comments CVPR 2024 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏