TimeRewarder: Learning Dense Reward from Passive Videos via Frame-wise Temporal Distance
TimeRewarder: 通过帧间时间距离从被动视频中学习密集奖励
机构 * Institute for Interdisciplinary Information Sciences, Tsinghua University, Beijing, China(清华大学交叉信息研究院) ; Shanghai Qi Zhi Institute(上海启智研究院) ; Shanghai Jiao Tong University(上海交通大学) ; University of Pennsylvania(宾夕法尼亚大学)
AI总结 本文提出TimeRewarder方法,通过帧间时间距离从被动视频中学习密集奖励,以提升强化学习在稀疏奖励任务中的性能,实验表明其在多个任务中显著提高了成功率和样本效率。
Comments ICML 2026 spotlight paper