VideoTemp-o3: Harmonizing Temporal Grounding and Video Understanding in Agentic Thinking-with-Videos
VideoTemp-o3:在智能视频思考中协调时间定位与视频理解
机构 * Shandong University(山东大学) ; Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; Beihang University(北航) ; Southern University of Science and Technology(南方科技大学)
专题命中 视频理解 :video understanding(title,abstract);long video(abstract);分类 cs.CV
AI总结 提出VideoTemp-o3统一框架,通过联合建模视频定位与问答、设计统一掩码机制和专用奖励,解决长视频理解中采样效率低、定位弱和工作流僵化问题。
Comments ICML 2026