Attend, Transform, or Silence: Operator-Level Visual Skipping for Efficient Multimodal LLM Inference
关注、变换或静默:面向高效多模态大语言模型推理的算子级视觉跳跃
Zhaoyang Luo, Runmin Dong, Miao Yang, Fan Wei, Yushan Lai, Bin Luo, Haohuan Fu
机构
*
Tsinghua Shenzhen International Graduate School(清华大学深圳国际研究生院)
;
Sun Yat-sen University(中山大学)
;
National Supercomputing Center in Shenzhen(国家超级计算深圳中心)
;
Tsinghua University(清华大学)
机构
*
National University of Singapore(新加坡国立大学)
;
Tsinghua University(清华大学)
;
University of Science and Technology of China(中国科学技术大学)
;
University of Electronic Science and Technology of China(电子科技大学)
;
University of California, Berkeley(加州大学伯克利分校)
TOPS: First-Principles Visual Token Pruning via Constructing Token Optimal Preservation Sets for Efficient MLLM Inference
TOPS:通过构建令牌最优保留集实现高效多模态大语言模型推理的第一性原理视觉令牌剪枝
Tinghao Wang, Yichen Guo, Rui Huang, Zheng Lu, Qizhe Zhang, Chenxi Li, Yuan Zhang, Jiajun Cao, Zhirong Shen, Yaosong Du, Guangyan Gan, Wenya Wang, Lin William Cong, Shanghang Zhang
机构
*
State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(北京大学计算机学院多媒体信息处理国家重点实验室)
;
University of Electronic Science and Technology of China(电子科技大学)
;
Nanyang Technological University(南洋理工大学)
;
Beijing Academy of Artificial Intelligence (BAAI)(北京人工智能研究院)
Spectral Evolution-Guided Token Pruning in Multimodal Large Language Models
多模态大语言模型中基于谱演化引导的令牌剪枝
Bin Chen, Yuxiang Cai, Yadan Luo, Yi Zhang, Jianwei Yin, Zhi Chen
机构
*
School of Software Technology, Zhejiang University(浙江大学软件学院)
;
Zhejiang Key Laboratory of Digital-Intelligence Service Technology(浙江省数字化服务技术重点实验室)
;
The University of Queensland(昆士兰大学)
;
Singapore Management University(新加坡管理大学)
;
The University of Southern Queensland(南昆士兰大学)
Cross-Modal Knowledge Distillation without Paired Data: Theoretical Foundation and Algorithm
无配对数据的跨模态知识蒸馏:理论基础与算法
Trong Khiem Tran, Anh Duc Chu, Quang Hung Pham, Phi Le Nguyen, Trong Nghia Hoang
机构
*
School of Information and Communications Technology, Hanoi University of Science and Technology, Hanoi, Vietnam(信息与通信技术学院,河内科学技术大学,越南河内)
;
School of Electrical Engineering and Computer Science, Washington State University, Pullman, US(电气工程与计算机科学学院,华盛顿州立大学,华盛顿州普尔曼)
GRASP: Granularity-Aware Region Alignment and Semantic Prototype Learning for Fine-Grained Cross-Modal Understanding in Drone Views
GRASP:面向无人机视角细粒度跨模态理解的粒度感知区域对齐与语义原型学习
Jiahui Cui, Yan Zhao, Kan Wei, Enze Zhu, Peirong Zhang, Lei Wang, Yiru Wang
机构
*
Aerospace Information Research Institute, Chinese Academy of Sciences(中国科学院空天信息创新研究院)
;
University of Chinese Academy of Sciences(中国科学院大学)
;
School of Electronic, Electrical and Communication Engineering, University of Chinese Academy of Sciences(中国科学院大学电子电气与通信工程学院)
机构
*
University of Chinese Academy of Sciences(中国科学院大学)
;
School of Advanced Interdisciplinary Sciences(先进交叉科学学院)
;
School of Electronic, Electrical and Communication Engineering(电子电气与通信工程学院)
;
Shenzhen Institutes of Advanced Technology(深圳先进技术研究院)