VidLaDA: Bidirectional Diffusion Large Language Models for Efficient Video Understanding
VidLaDA:双向扩散大型语言模型用于高效视频理解
机构 * Shanghai Jiao Tong University(上海交通大学) ; Shanghai Innovation Institute(上海创新研究院) ; Fudan University(复旦大学) ; ZhongguanCun Academy(中关村学院) ; Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院)
专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI
AI总结 VidLaDA通过双向注意力和MARS-Cache技术,提升视频理解效率,实现比现有方法更优的性能与速度