Reinforcement Learning from Rich Feedback with Distributional DAgger
利用丰富反馈的强化学习与分布式DAgger
机构 * University of Southern California(南加州大学)
AI总结 提出DistIL算法,通过分布式DAgger利用丰富反馈(如执行轨迹、工具输出等)进行前向交叉熵优化,实现单调策略改进和更好的Pass@N性能。
高校专区
利用丰富反馈的强化学习与分布式DAgger
机构 * University of Southern California(南加州大学)
AI总结 提出DistIL算法,通过分布式DAgger利用丰富反馈(如执行轨迹、工具输出等)进行前向交叉熵优化,实现单调策略改进和更好的Pass@N性能。