Lagrangian Perturbation Diffusion Steering: Latent Reinforcement Learning for Generative Policies
拉格朗日扰动扩散引导:用于生成策略的潜在强化学习
机构 * University of Michigan(密歇根大学)
AI总结 提出拉格朗日扰动扩散引导(LP-DS),通过学习紧凑的噪声空间扰动来微调冻结的生成策略,利用拉格朗日信任区域目标优化,在保持潜在先验约束的同时提升下游价值,在多个基准上实现样本效率和回报提升。
Comments Accepted as a regular paper at ICML 2026