Temporal and Cross-Modal Alignment for Enhanced Audiovisual Video Captioning
增强视听视频字幕的时间与跨模态对齐
机构 * Nanjing University, State Key Laboratory for Novel Software Technology(南京大学,计算机软件新技术国家重点实验室) ; Meituan(美团)
AI总结 提出TCA-Captioner框架,通过观察-检查-纠正迭代策略和密集交互数据集,解决视听字幕中的模态分离与时间不一致问题,实现精准的视听绑定与因果动态建模。
Comments ECCV 2026