AVCap: Reinforcing Audio-Video Joint Caption with Detail-Aware Reward
AVCap:用细节感知奖励强化音视频联合字幕
机构 * MMLab, CUHK(香港中文大学MMLab) ; Peking University(北京大学)
专题命中 视频理解 :video understanding(abstract);分类 cs.CV
AI总结 针对音视频联合字幕的数据集、奖励信号、评估基准的局限,提出AVCap-100K数据集、AVCap模型及专用基准指标,通过Da-GRPO优化的AVCap模型性能优异。