Beyond Time Shifts: Adapting Omni-LLM as a Reference-Free Evaluator for Generative Audio-Visual Models
超越时间偏移:将全能语言模型(Omni-LLM)适配为生成式视听模型的无参考评估器
机构 * Zhejiang University(浙江大学) ; The Hong Kong Polytechnic University(香港理工大学) ; IROOTECH TECHNOLOGY(易路泰克科技)
专题命中 音频语音多模态 :audio-visual(title,abstract);cross-modal(abstract);分类 cs.CV
AI总结 研究针对视听生成模型跨模态同步评估难题,提出框架解决人类与自动化评估指标的矛盾。通过引入数据集、适配模型及提出优化方法,实现先进的人类偏好对齐,建立标准化基准推动评估从信号相关性到因果关系发展。
Comments Accepted to ECCV 2026