Goal-Driven Reward by Video Diffusion Models for Reinforcement Learning
通过视频扩散模型实现目标驱动的奖励用于强化学习
机构 * Shanghai Jiao Tong University(上海交通大学) ; Ningbo Key Laboratory of Spatial Intelligence and Digital Derivative, Ningbo Institute of Digital Twin, Eastern Institute of Technology, Ningbo(宁波市空间智能与数字衍生重点实验室,东方理工高等研究院宁波数字孪生研究院,宁波) ; Zhejiang Key Laboratory of Industrial Intelligence and Digital Twin(浙江省工业智能与数字孪生重点实验室) ; Zhongguancun Academy(中关村学院) ; Department of Computing, The Hong Kong Polytechnic University(香港理工大学计算学系) ; Department of Mechanical Engineering, Yale University(耶鲁大学机械工程系)
AI总结 本文提出利用预训练的视频扩散模型为强化学习代理提供目标驱动的奖励信号,通过视频级和帧级目标提升轨迹的连贯性和目标导向性。
Comments Accepted by CVPR 2026. Project page: https://qiwang067.github.io/genreward