ARKD: Adaptive Reinforcement Learning-Guided Bidirectional KL Divergence Distillation for Text Generation
ARKD: 自适应强化学习引导的双向KL散度蒸馏用于文本生成
机构 * Li Auto, Beijing, China(北京利亚自动化有限公司) ; School of Software and Microelectronics, Peking University, China(北京大学软件与微电子学院)
AI总结 针对单一KL目标难以平衡主分布拟合与长尾概率建模的问题,提出基于强化学习的自适应KL加权蒸馏框架,通过策略网络动态分配前向和反向KL散度权重,实现主模态和长尾模态的双重对齐,在Rouge-L和BertScore上持续提升。