MTAVG-Bench: A Diagnostic Benchmark for Multi-Talker Dialogue-Centric Audio-Video Generation
MTAVG-Bench: 多说话人对话中心音频视频生成的诊断基准
机构 * Beijing Institute of Technology(北京理工大学) ; Shanghai University(上海大学) ; OpenNLP Lab(OpenNLP实验室) ; Beijing University of Technology(北京工业大学) ; The University of Adelaide(阿德莱德大学) ; Tsinghua University(清华大学) ; Inkeverse Group Limited(Inkeverse集团)
专题命中 视频生成 :video generation(title,abstract);分类 cs.MM
AI总结 本文提出MTAVG-Bench,用于评估多说话人对话中心音频视频生成的失败模式诊断,通过半自动化流程生成1.8k视频并标注2.4k问答对,评估音频视频信号保真度、时间属性一致性、社交互动和电影表现四个层面。