Self-Distilled Agentic Reinforcement Learning
自蒸馏代理强化学习
机构 * Zhejiang University(浙江大学) ; Meituan(美团) ; Tsinghua University(清华大学)
AI总结 本文提出SDAR方法,通过将OPSD作为辅助目标并保持RL为主优化,解决多轮代理中的稳定性问题,提升性能。
大厂专区
自蒸馏代理强化学习
机构 * Zhejiang University(浙江大学) ; Meituan(美团) ; Tsinghua University(清华大学)
AI总结 本文提出SDAR方法,通过将OPSD作为辅助目标并保持RL为主优化,解决多轮代理中的稳定性问题,提升性能。