Frames2LoRA: Parametric Video Internalization for Vision-Language Models
Video2LoRA: 视觉-语言模型的参数化视频内化
机构 * University of Maryland, College Park(马里兰大学学院公园分校)
AI总结 提出Video2LoRA方法,通过感知器超网络从视频编码中直接生成LoRA适配器,实现零视觉令牌的视频查询,在保持性能的同时大幅降低计算成本。
Comments https://frames2lora.github.io/