LongAV-Compass: Towards Unified Evaluation of Minute-Scale Audio-Visual Generation Across T2AV, I2AV, and V2AV
LongAV-Compass:面向分钟级音视频生成在T2AV、I2AV和V2AV上的统一评估
机构 * Peking University(北京大学) ; Kling Team(Kling团队) ; Nanjing University(南京大学) ; SJTU(上海交通大学) ; HKUST(GZ)(香港科技大学(广州)) ; Shanghai AI Lab(上海人工智能实验室) ; Nanyang Technological University(南洋理工大学) ; CASIA(中国科学院自动化所) ; Tsinghua University(清华大学)
专题命中 音频语音多模态 :audio-visual(title,abstract);MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CV、cs.MM
AI总结 针对现有评估协议局限于短片段的问题,提出LongAV-Compass基准,通过284个测试用例和统一评估框架,系统评估分钟级音视频生成在文本、图像、视频条件下的质量、一致性和对齐。