Learning Transferable Temporal Primitives for Video Reasoning via Synthetic Videos
通过合成视频学习可迁移的时间原语以实现视频推理
机构 * Zhejiang University(浙江大学) ; Qwen Team, Alibaba Group(通义实验室,阿里巴巴集团) ; Shanghai Jiao Tong University(上海交通大学) ; Tsinghua University(清华大学)
专题命中 视频理解 :video reasoning(title);video generation(abstract);video understanding(abstract);分类 cs.CV
AI总结 本文提出SynRL框架,通过合成视频训练模型的时间原语,提升视频推理能力,在15个基准测试中取得显著成效,合成数据在复杂场景中表现优于真实数据。