TimeChat-Captioner: Scripting Multi-Scene Videos with Time-Aware and Structural Audio-Visual Captions
TimeChat-Captioner: 用时间感知和结构化的音视频字幕脚本化多场景视频
机构 * South China University of Technology(华南理工大学) ; Kling Team, Kuaishou Technology(快手科技 Kling 团队)
专题命中 视觉推理 :visual reasoning(abstract);grounding(abstract);分类 cs.CV
AI总结 提出Omni密集描述任务,通过六维结构模式生成带时间戳的类脚本描述,构建OmniDCBench基准和SodaM评估指标,训练TimeChat-Captioner-7B模型,在音视频推理和时间定位任务上超越Gemini-2.5-Pro。