arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 1565 信号源:cs.CV, cs.AI, cs.LG

1. 其他VLM 1565 篇

2506.23465 2025-07-01 cs.CV cs.AI 81%

Sanitizing Manufacturing Dataset Labels Using Vision-Language Models

Nazanin Mahjourian, Vinh Nguyen

机构 * Department of Mechanical Engineering - Engineering Mechanics(机械工程系)

专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05198 2025-06-06 cs.CV cs.LG 81%

Quantifying Cross-Modality Memorization in Vision-Language Models

Yuxin Wen, Yangsibo Huang, Tom Goldstein, Ravi Kumar, Badih Ghazi, Chiyuan Zhang

机构 * University of Maryland, College Park(马里兰大学学院公园分校)

专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.01419 2025-06-05 cs.CV cs.AI 81%

Visual Attention Never Fades: Selective Progressive Attention ReCalibration for Detailed Image Captioning in Multimodal Large Language Models

Mingi Jung, Saehyung Lee, Eunji Kim, Sungroh Yoon

专题命中 其他VLM :multimodal large language model(title,abstract);分类 cs.CV、cs.AI

Comments ICML 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20326 2025-05-28 cs.CY cs.AI cs.CL cs.CV 81%

Cultural Awareness in Vision-Language Models: A Cross-Country Exploration

Avinash Madasu, Vasudev Lal, Phillip Howard

机构 * Intel Labs(英特尔实验室) Thoughtworks

专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.09521 2025-05-19 cs.CV cs.AI 81%

Efficient and Comprehensive Feature Extraction in Large Vision-Language Model for Pathology Analysis

Shengxuming Zhang, Weihan Li, Tianhong Gao, Jiacong Hu, Haoming Luo, Xiuming Zhang, Jing Zhang, Mingli Song, Zunlei Feng

机构 * School of Software Technology, Zhejiang University(浙江大学软件技术学院) College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) First Affiliated Hospital, College of Medicine, Zhejiang University(浙江大学医学院第一附属医院)

专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.10453 2025-05-16 cs.CV cs.AI 81%

Vision language models have difficulty recognizing virtual objects

Tyler Tran, Sangeet Khemlani, J. G. Trafton

机构 * US Naval Research Laboratory(美国海军研究实验室)

专题命中 其他VLM :vision language model(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.05189 2025-05-09 cs.CV cs.AI 81%

Biomed-DPT: Dual Modality Prompt Tuning for Biomedical Vision-Language Models

Wei Peng, Kang Liu, Jianchen Hu, Meng Zhang

机构 * School of Future Technology(未来技术学院) Xi’an Jiaotong University(西安交通大学) School of Automation Science and Engineering(自动化科学与工程学院)

专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.13120 2025-04-30 cs.CV cs.AI cs.CL 81%

Probing and Inducing Combinational Creativity in Vision-Language Models

Yongqian Peng, Yuxi Ma, Mengmeng Wang, Yuxuan Wang, Yizhou Wang, Chi Zhang, Yixin Zhu, Zilong Zheng

机构 * Institute for Artificial Intelligence, Peking University(北京大学人工智能研究院) Yuanpei College, Peking University(北京大学元培学院) State Key Laboratory of General Artificial Intelligence, BIGAI(人工智能通用基础理论国家重点实验室) Center on Frontiers of Computing Studies, School of Computer Science, Peking University(计算机科学学院前沿计算研究中心)

专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV、cs.AI

Comments Project page: https://ppyyqq.github.io/aicc/ The first two authors contribute equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.10873 2025-04-16 cs.CV cs.AI cs.HC 81%

Can Vision-Language Models Understand and Interpret Dynamic Gestures from Pedestrians? Pilot Datasets and Exploration Towards Instructive Nonverbal Commands for Cooperative Autonomous Vehicles

Tonko E. W. Bossen, Andreas Møgelmose, Ross Greer

专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.04917 2025-04-15 cs.CV cs.AI 81%

Avoid Wasted Annotation Costs in Open-set Active Learning with Pre-trained Vision-Language Model

Jaehyuk Heo, Pilsung Kang

专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2208.13474 2025-04-15 cs.CV cs.AI 81%

Prompt Tuning with Soft Context Sharing for Vision-Language Models

Kun Ding, Ying Wang, Pengzhang Liu, Qiang Yu, Haojian Zhang, Shiming Xiang, Chunhong Pan

专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV、cs.AI

Comments 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.06838 2025-04-10 cs.CV cs.LG 81%

ZIP: An Efficient Zeroth-order Prompt Tuning for Black-box Vision-Language Models

Seonghwan Park, Jaehyeon Jeong, Yongjun Kim, Jaeho Lee, Namhoon Lee

专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV、cs.LG

Comments ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.23312 2025-04-01 cs.AI cs.CV 81%

LaViC: Adapting Large Vision-Language Models to Visually-Aware Conversational Recommendation

Hyunsik Jeon, Satoshi Koide, Yu Wang, Zhankui He, Julian McAuley

专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.19510 2025-03-26 cs.RO cs.AI cs.CV 81%

RoboFlamingo-Plus: Fusion of Depth and RGB Perception with Vision-Language Models for Enhanced Robotic Manipulation

Sheng Wang

专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.13817 2025-03-19 cs.AI cs.HC cs.LG cs.RO 81%

VARP: Reinforcement Learning from Vision-Language Model Feedback with Agent Regularized Preferences

Anukriti Singh, Amisha Bhaskar, Peihong Yu, Souradip Chakraborty, Ruthwik Dasyam, Amrit Bedi, Pratap Tokekar

专题命中 其他VLM :vision-language model(title,abstract);分类 cs.AI、cs.LG

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.02249 2025-03-14 cs.CV cs.AI 81%

Non-autoregressive Sequence-to-Sequence Vision-Language Models

Kunyu Shi, Qi Dong, Luis Goncalves, Zhuowen Tu, Stefano Soatto

专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV、cs.AI

Comments Accepted to CVPR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.08156 2025-03-12 cs.CV cs.LG 81%

Towards Large-scale Chemical Reaction Image Parsing via a Multimodal Large Language Model

Yufan Chen, Ching Ting Leung, Jianwei Sun, Yong Huang, Linyan Li, Hao Chen, Hanyu Gao

专题命中 其他VLM :multimodal large language model(title,abstract);分类 cs.CV、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.01863 2025-03-05 cs.CV cs.AI cs.CL cs.CY eess.IV 81%

Vision Language Models in Medicine

Beria Chingnabe Kalpelbe, Angel Gabriel Adaambiik, Wei Peng

专题命中 其他VLM :vision language model(title);vision-language model(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.13982 2025-02-26 cs.CV cs.LG 81%

Attribute-based Visual Reprogramming for Vision-Language Models

Chengyi Cai, Zesheng Ye, Lei Feng, Jianzhong Qi, Feng Liu

专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.15812 2025-02-25 cs.LG cs.AI 81%

InsightVision: A Comprehensive, Multi-Level Chinese-based Benchmark for Evaluating Implicit Visual Semantics in Large Vision Language Models

Xiaofei Yin, Yijie Hong, Ya Guo, Yi Tu, Weiqiang Wang, Gongshen Liu, Huijia zhu

专题命中 其他VLM :vision language model(title,abstract);分类 cs.AI、cs.LG

Comments 19 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.09838 2025-02-24 cs.CV cs.AI 81%

HealthGPT: A Medical Large Vision-Language Model for Unifying Comprehension and Generation via Heterogeneous Knowledge Adaptation

Tianwei Lin, Wenqiao Zhang, Sijing Li, Yuqian Yuan, Binhe Yu, Haoyuan Li, Wanggui He, Hao Jiang, Mengze Li, Xiaohui Song, Siliang Tang, Jun Xiao, Hui Lin, Yueting Zhuang, Beng Chin Ooi

专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV、cs.AI

Comments Comments: added project page

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.10967 2025-02-13 cs.CV cs.AI cs.CL 81%

Advancing General Multimodal Capability of Vision-language Models with Pyramid-descent Visual Position Encoding

Zhanpeng Chen, Mingxiao Li, Ziyang Chen, Nan Du, Xiaolong Li, Yuexian Zou

专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.08702 2025-02-11 cs.AI cs.CL cs.CV 81%

VLind-Bench: Measuring Language Priors in Large Vision-Language Models

Kang-il Lee, Minbeom Kim, Seunghyun Yoon, Minsung Kim, Dongryeol Lee, Hyukhun Koh, Kyomin Jung

专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV、cs.AI

Comments NAACL 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.14846 2025-02-10 cs.AI cs.CV 81%

A-VL: Adaptive Attention for Large Vision-Language Models

Junyang Zhang, Mu Yuan, Ruiguang Zhong, Puhan Luo, Huiyou Zhan, Ningkang Zhang, Chengchen Hu, Xiangyang Li

专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV、cs.AI

Comments AAAI 2025 Accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.05803 2025-01-28 cs.CV cs.AI 81%

Boosting Multimodal Large Language Models with Visual Tokens Withdrawal for Rapid Inference

Zhihang Lin, Mingbao Lin, Luxi Lin, Rongrong Ji

专题命中 其他VLM :multimodal large language model(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.14276 2025-01-27 cs.CV cs.AI 81%

Global Semantic-Guided Sub-image Feature Weight Allocation in High-Resolution Large Vision-Language Models

Yuxuan Liang, Xu Li, Xiaolei Chen, Haotian Chen, Yi Zheng, Chenghang Lai, Bin Li, Xiangyang Xue

专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV、cs.AI

Comments 10 pages, 10 figures and tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.05862 2025-01-14 cs.CL cs.AI cs.CV 81%

II-Bench: An Image Implication Understanding Benchmark for Multimodal Large Language Models

Ziqiang Liu, Feiteng Fang, Xi Feng, Xinrun Du, Chenhao Zhang, Zekun Wang, Yuelin Bai, Qixuan Zhao, Liyang Fan, Chengguang Gan, Hongquan Lin, Jiaming Li, Yuansheng Ni, Haihong Wu, Yaswanth Narsupalli, Zhigang Zheng, Chengming Li, Xiping Hu, Ruifeng Xu, Xiaojun Chen, Min Yang, Jiaheng Liu, Ruibo Liu, Wenhao Huang, Ge Zhang, Shiwen Ni

专题命中 其他VLM :multimodal large language model(title,abstract);分类 cs.CV、cs.AI

Comments 100 pages, 82 figures, add citations

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.02368 2024-12-04 cs.AI cs.CL cs.CV 81%

ScImage: How Good Are Multimodal Large Language Models at Scientific Text-to-Image Generation?

Leixin Zhang, Steffen Eger, Yinjie Cheng, Weihe Zhai, Jonas Belouadi, Christoph Leiter, Simone Paolo Ponzetto, Fahimeh Moafian, Zhixue Zhao

专题命中 其他VLM :multimodal large language model(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.18727 2024-12-02 cs.CV cs.AI 81%

Generative Visual Communication in the Era of Vision-Language Models

Yael Vinker

专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV、cs.AI

Comments PhD Thesis

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.17491 2024-11-27 cs.CV cs.AI 81%

What's in the Image? A Deep-Dive into the Vision of Vision Language Models

Omri Kaduri, Shai Bagon, Tali Dekel

专题命中 其他VLM :vision language model(title);vision-language model(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏