Seeing the Forest and the Trees: Query-Aware Tokenizer for Long-Video Multimodal Language Models
看清森林与树木:面向长视频多模态语言模型的查询感知分词器
机构 * Queen Mary University of London(伦敦女王学院) ; University of Sheffield(谢菲尔德大学) ; Imperial College London(伦敦帝国学院) ; Pengcheng Laboratory(鹏城实验室) ; Meta Inc(Meta公司) ; Meituan Inc(美团公司) ; Nanjing University of Science(南京理工大学) ; University of Birmingham(伯明翰大学) ; Utrecht University(乌得勒支大学)
专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV
AI总结 QTSplus是一种轻量高效的视觉token选择模块,通过动态选择重要视觉证据提升长视频多模态语言模型的性能,显著降低计算成本并提高处理效率。