MVPruner: Dynamic Token Pruning for Accelerating Multi-view Vision-Language Models in Autonomous Driving
MVPruner: 用于加速自动驾驶中多视图视觉语言模型的动态令牌剪枝
Nan Yang, Zhanwen Liu, Linfeng Zhang, Shangyu Xie, Yang Wang, Wenzhuo Zhou, Xiangmo Zhao
机构
*
School of Information Engineering, Chang’an University, China(长安大学信息工程学院)
;
School of Artificial Intelligence, Shanghai Jiaotong University, China(上海交通大学人工智能学院)
CheXanatomy: Anatomy-Aware Vision-Language Modeling for Chest Radiographs
CheXanatomy: 面向胸部X光片的解剖感知视觉-语言建模
Sergios Gatidis, Curtis Langlotz, Christian Bluethgen
机构
*
Stanford Center for Artificial Intelligence in Medicine and Imaging, Stanford University(斯坦福大学医学与影像人工智能中心)
;
Department of Radiology, Stanford University(斯坦福大学放射学系)
DREAM: Extending Vision-Language Models with Dual-Objective Encoding for Cross-Modal Retrieval
DREAM: 通过双目标编码扩展视觉-语言模型用于跨模态检索
Kaleem Ullah, Altaf Hussain, Muhammad Munsif, Sung Wook Baik
机构
*
Sejong University(世宗大学)
;
Korea Advanced Institute of Science and Technology(韩国科学技术院)
;
Ulsan National Institute of Science and Technology(乌山国立科学研究院)