Selective Timestep Weighting and Advantage-Based Replay for Sample-Efficient Diffusion RLHF
用于样本高效扩散强化学习从人类反馈中学习的选择性时间步加权和基于优势的重放
机构 * Carnegie Mellon University(卡内基梅隆大学) ; University of Maryland, College Park(马里兰大学帕克分校)
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV
AI总结 研究如何提高扩散模型中强化学习从人类反馈的效率,提出选择性时间步加权和基于优势的重放两种互补策略,通过强调信息丰富的时间步和轨迹优化,提升反馈效率,样本效率比基线提高6倍。
Comments 19 pages, 18 figures, 4 tables. Submission under review. A shorter, non-archival 4-page abstract version of this work was accepted to CVPR 2026 Workshops (GCV, CVEU)