AVA-Encoder: Towards Agent-Native Video Representation Learning
AVA-Encoder:面向智能体原生的视频表示学习
机构 * Qwen Business Unit of Alibaba(阿里巴巴通义千问业务部) ; ShanghaiTech University(上海科技大学) ; The Hong Kong University of Science and Technology(香港科技大学) ; Institute of Computing Technology(中国科学院计算技术研究所) ; Southeast University(东南大学)
AI总结 针对创意智能体缺乏从高质量电影学习的有效方式的问题,提出AVA-Encoder框架,其视频表示经重构优化后,在相关基准上性能优于现有方法,还发布了配套框架、基准及数据集。