Skill-SD: Skill-Conditioned Self-Distillation for Multi-turn LLM Agents
Skill-SD:基于多轮LLM代理的技能条件自蒸馏
机构 * Hangzhou Institute for Advanced Study, University of Chinese Academy of Sciences(中国科学院大学杭州高等研究院) ; The Chinese University of Hong Kong(香港中文大学) ; University of Science and Technology of China(中国科学技术大学) ; University of Chinese Academy of Sciences(中国科学院大学) ; vivo AI Lab(vivo AI实验室)
AI总结 Skill-SD通过将代理自身轨迹转化为动态训练监督,结合重要加权反KL损失稳定训练,提升多轮LLM代理性能,实验显示优于标准RL和OPD方法。
Comments Project page: https://k1xe.github.io/skill-sd/