Video Models Can Reason with Verifiable Rewards
视频模型可以借助可验证的奖励进行推理
机构 * University of California, Davis(加州大学戴维斯分校) ; Microsoft Research(微软研究院) ; University of Southern California(南加州大学) ; University of California, Santa Cruz(加州大学圣克鲁兹分校)
专题命中 视频扩散模型 :video generation(abstract);video diffusion(abstract);video reasoning(abstract);分类 cs.CV
AI总结 本文提出VideoRLVR方法,通过规则反馈优化视频扩散模型,提升可验证推理能力,在Maze、FlowFree和Sokoban任务中优于监督微调基线,证明可验证RL能推动视频模型超越感知模仿。
Comments Website: https://darthzhu.github.io/VideoRLVR-page/