arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 26117 信号源:cs.CV, cs.AI, cs.LG

1. 视觉推理 4478 篇

2403.20312 2025-03-13 cs.CV 79%

Learn "No" to Say "Yes" Better: Improving Vision-Language Models via Negations

Jaisidh Singh, Ishaan Shrivastava, Mayank Vatsa, Richa Singh, Aparna Bharati

专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.CV

Comments 14 pages + 6 figures in main manuscript (excluding references)

Journal ref WACV 2025 pages(7991-8001)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.07065 2025-03-11 cs.CV 79%

Boosting the Generalization and Reasoning of Vision Language Models with Curriculum Reinforcement Learning

Huilin Deng, Ding Zou, Rui Ma, Hongchen Luo, Yang Cao, Yu Kang

专题命中 视觉推理 :vision language model(title);vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.04801 2025-03-10 cs.CL cs.AI 79%

Exploring and Evaluating Multimodal Knowledge Reasoning Consistency of Multimodal Large Language Models

Boyu Jia, Junzhe Zhang, Huixuan Zhang, Xiaojun Wan

专题命中 视觉推理 :multimodal large language model(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.01632 2025-03-04 cs.AI 79%

CoT-VLM4Tar: Chain-of-Thought Guided Vision-Language Models for Traffic Anomaly Resolution

Tianchi Ren, Haibo Hu, Jiacheng Zuo, Xinhong Chen, Jianping Wang, Chun Jason Xue, Jen-Ming Wu, Nan Guan

专题命中 视觉推理 :vision-language model(title);VLM(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.05660 2025-02-11 cs.CV cs.CL 79%

Evaluating Vision-Language Models for Emotion Recognition

Sree Bhattacharyya, James Z. Wang

专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.CV

Comments Accepted to NAACL 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.08992 2025-02-03 cs.CV 79%

Contextual Emotion Recognition using Large Vision Language Models

Yasaman Etesam, Özge Nilay Yalçın, Chuxuan Zhang, Angelica Lim

专题命中 视觉推理 :vision language model(title,abstract);分类 cs.CV

Comments 8 pages, website: https://yasaman-etesam.github.io/Contextual-Emotion-Recognition/. arXiv admin note: text overlap with arXiv:2310.19995

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.09502 2025-01-17 cs.CV 79%

Omni-Emotion: Extending Video MLLM with Detailed Face and Audio Modeling for Multimodal Emotion Analysis

Qize Yang, Detao Bai, Yi-Xing Peng, Xihan Wei

专题命中 视觉推理 :MLLM(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.21534 2025-01-08 cs.CV 79%

ControlMLLM: Training-Free Visual Prompt Learning for Multimodal Large Language Models

Mingrui Wu, Xinyue Cai, Jiayi Ji, Jiale Li, Oucheng Huang, Gen Luo, Hao Fei, Guannan Jiang, Xiaoshuai Sun, Rongrong Ji

专题命中 视觉推理 :multimodal large language model(title,abstract);分类 cs.CV

Comments Accepted to NeurIPS 2024; Code:https://github.com/mrwu-mac/ControlMLLM

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.17339 2024-12-24 cs.AI cs.CL 79%

MineAgent: Towards Remote-Sensing Mineral Exploration with Multimodal Large Language Models

Beibei Yu, Tao Shen, Hongbin Na, Ling Chen, Denqi Li

专题命中 视觉推理 :multimodal large language model(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.19732 2024-12-23 cs.CL cs.CV 79%

Rethinking Visual Dependency in Long-Context Reasoning for Large Vision-Language Models

Yucheng Zhou, Zhi Rao, Jun Wan, Jianbing Shen

专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.11391 2024-12-17 cs.CV 79%

Temporal Contrastive Learning for Video Temporal Reasoning in Large Vision-Language Models

Rafael Souza, Jia-Hao Lim, Alexander Davis

专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.09817 2024-12-16 cs.CV cs.CL 79%

Enhancing Multimodal Large Language Models Complex Reason via Similarity Computation

Xiaofeng Zhang, Fanshuo Zeng, Yihao Quan, Zheng Hui, Jiawei Yao

专题命中 视觉推理 :multimodal large language model(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.00243 2024-12-03 cs.RO cs.AI 79%

Realistic Corner Case Generation for Autonomous Vehicles with Multimodal Large Language Model

Qiujing Lu, Meng Ma, Ximiao Dai, Xuanhan Wang, Shuo Feng

专题命中 视觉推理 :multimodal large language model(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.19716 2024-11-26 cs.CV cs.CL 79%

Enhancing Large Vision Language Models with Self-Training on Image Comprehension

Yihe Deng, Pan Lu, Fan Yin, Ziniu Hu, Sheng Shen, Quanquan Gu, James Zou, Kai-Wei Chang, Wei Wang

专题命中 视觉推理 :vision language model(title,abstract);分类 cs.CV

Comments 22 pages, 14 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.18570 2024-10-25 cs.RO cs.AI 79%

Zero-shot Object Navigation with Vision-Language Models Reasoning

Congcong Wen, Yisiyuan Huang, Hao Huang, Yanjia Huang, Shuaihang Yuan, Yu Hao, Hui Lin, Yu-Shen Liu, Yi Fang

专题命中 视觉推理 :vision-language model(title);vision language model(abstract);分类 cs.AI

Comments Accepted by the International Conference on Pattern Recognition (ICPR) for Oral presentation

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.15549 2024-10-22 cs.RO cs.CV 79%

A Dual Process VLA: Efficient Robotic Manipulation Leveraging VLM

ByungOk Han, Jaehong Kim, Jinhyeok Jang

专题命中 视觉推理 :VLM(title);vision-language model(abstract);分类 cs.CV

Comments 10 page

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.13510 2024-10-18 cs.CL cs.CV 79%

GeoCoder: Solving Geometry Problems by Generating Modular Code through Vision-Language Models

Aditya Sharma, Aman Dalmia, Mehran Kazemi, Amal Zouaq, Christopher J. Pal

专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.01584 2024-10-16 cs.CV 79%

SpatialRGPT: Grounded Spatial Reasoning in Vision Language Models

An-Chieh Cheng, Hongxu Yin, Yang Fu, Qiushan Guo, Ruihan Yang, Jan Kautz, Xiaolong Wang, Sifei Liu

专题命中 视觉推理 :vision language model(title,abstract);分类 cs.CV

Comments NeurIPS 2024, Project Page: https://www.anjiecheng.me/SpatialRGPT

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.12114 2024-10-14 cs.CV 79%

SPARK: Multi-Vision Sensor Perception and Reasoning Benchmark for Large-scale Vision-Language Models

Youngjoon Yu, Sangyun Chung, Byung-Kwan Lee, Yong Man Ro

专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.CV

Comments Codes and data are available at https://github.com/top-yun/SPARK

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.15272 2024-10-10 cs.CV 79%

MIBench: Evaluating Multimodal Large Language Models over Multiple Images

Haowei Liu, Xi Zhang, Haiyang Xu, Yaya Shi, Chaoya Jiang, Ming Yan, Ji Zhang, Fei Huang, Chunfeng Yuan, Bing Li, Weiming Hu

专题命中 视觉推理 :multimodal large language model(title,abstract);分类 cs.CV

Comments EMNLP 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.14156 2024-10-08 cs.CV 79%

Unveiling the Tapestry of Consistency in Large Vision-Language Models

Yuan Zhang, Fei Xiao, Tao Huang, Chun-Kai Fan, Hongyuan Dong, Jiawen Li, Jiacong Wang, Kuan Cheng, Shanghang Zhang, Haoyuan Guo

专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.CV

Comments Accepted by NeurIPS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.07053 2024-10-04 cs.CV 79%

Multimodal Self-Instruct: Synthetic Abstract Image and Visual Reasoning Instruction Using Language Model

Wenqi Zhang, Zhenglin Cheng, Yuanyu He, Mengna Wang, Yongliang Shen, Zeqi Tan, Guiyang Hou, Mingqian He, Yanna Ma, Weiming Lu, Yueting Zhuang

专题命中 视觉推理 :visual reasoning(title,abstract);分类 cs.CV

Comments The paper is accepted by EMNLP-24. Code: https://github.com/zwq2018/Multi-modal-Self-instruct dataset: https://huggingface.co/datasets/zwq2018/Multi-modal-Self-instruct Leaderboard: https://multi-modal-self-instruct.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.09486 2024-09-27 cs.CL cs.CV cs.SE 79%

MMCode: Benchmarking Multimodal Large Language Models for Code Generation with Visually Rich Programming Problems

Kaixin Li, Yuchen Tian, Qisheng Hu, Ziyang Luo, Zhiyong Huang, Jing Ma

专题命中 视觉推理 :multimodal large language model(title);visual reasoning(abstract);分类 cs.CV

Comments EMNLP 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.06450 2024-09-11 cs.RO cs.AI cs.ET 79%

Multimodal Large Language Model Driven Scenario Testing for Autonomous Vehicles

Qiujing Lu, Xuanhan Wang, Yiwei Jiang, Guangming Zhao, Mingyue Ma, Shuo Feng

专题命中 视觉推理 :multimodal large language model(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.12321 2024-08-27 cs.CL cs.CV cs.MM 79%

MaVEn: An Effective Multi-granularity Hybrid Visual Encoding Framework for Multimodal Large Language Model

Chaoya Jiang, Jia Hongrui, Haiyang Xu, Wei Ye, Mengfan Dong, Ming Yan, Ji Zhang, Fei Huang, Shikun Zhang

专题命中 视觉推理 :multimodal large language model(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.17379 2024-08-07 cs.CV cs.CL 79%

MMRA: A Benchmark for Evaluating Multi-Granularity and Multi-Image Relational Association Capabilities in Large Visual Language Models

Siwei Wu, Kang Zhu, Yu Bai, Yiming Liang, Yizhi Li, Haoning Wu, J. H. Liu, Ruibo Liu, Xingwei Qu, Xuxin Cheng, Ge Zhang, Wenhao Huang, Chenghua Lin

专题命中 视觉推理 :visual language model(title,abstract);分类 cs.CV

Comments VLMs, Multi-Image Association

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.02210 2024-08-06 cs.CV 79%

ExoViP: Step-by-step Verification and Exploration with Exoskeleton Modules for Compositional Visual Reasoning

Yuxuan Wang, Alan Yuille, Zhuowan Li, Zilong Zheng

专题命中 视觉推理 :visual reasoning(title,abstract);分类 cs.CV

Comments To Appear at COLM 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.14834 2024-07-23 cs.CV 79%

Can VLMs be used on videos for action recognition? LLMs are Visual Reasoning Coordinators

Harsh Lunia

专题命中 视觉推理 :visual reasoning(title);vision-language model(abstract);分类 cs.CV

Comments LLMs, VLMs, Action Recognition

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.10157 2024-07-23 cs.RO cs.AI 79%

RoboGolf: Mastering Real-World Minigolf with a Reflective Multi-Modality Vision-Language Model

Hantao Zhou, Tianying Ji, Lukas Sommerhalder, Michael Goerner, Norman Hendrich, Jianwei Zhang, Fuchun Sun, Huazhe Xu

专题命中 视觉推理 :vision-language model(title);VLM(abstract);分类 cs.AI

Comments Project page: https://jity16.github.io/RoboGolf/

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.16449 2024-07-19 cs.CV 79%

Evaluating and Analyzing Relationship Hallucinations in Large Vision-Language Models

Mingrui Wu, Jiayi Ji, Oucheng Huang, Jiale Li, Yuhang Wu, Xiaoshuai Sun, Rongrong Ji

专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.CV

Comments ICML2024; Project Page:https://github.com/mrwu-mac/R-Bench

详情

展开后加载摘要…

URL PDF HTML 收藏