Don't Let the Video Speak: Audio-Contrastive Preference Optimization for Audio-Visual Language Models
别让视频说话:面向音频-视觉语言模型的音频对比偏好优化
机构 * University of Texas at Austin(德克萨斯大学奥斯汀分校)
AI总结 本文提出ACPO方法,通过引入输出对比和输入对比目标,解决音频-视觉语言模型中视频驱动的音频幻觉问题,提升音频真实性和多模态能力。
Comments Project page: https://vision.cs.utexas.edu/projects/acpo/