arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

Li Auto(理想汽车)

2026-06-30 至 2026-06-30 共收录 1
2606.29869 2026-06-30 cs.CL cs.AI

ARKD: Adaptive Reinforcement Learning-Guided Bidirectional KL Divergence Distillation for Text Generation

ARKD: 自适应强化学习引导的双向KL散度蒸馏用于文本生成

Zilong Liu, Xuewen Zhang, Jinrui Xing, Juyi Qiao, Huiyong Wang, Junming Jiao

机构 * Li Auto, Beijing, China(北京利亚自动化有限公司) School of Software and Microelectronics, Peking University, China(北京大学软件与微电子学院)

AI总结 针对单一KL目标难以平衡主分布拟合与长尾概率建模的问题,提出基于强化学习的自适应KL加权蒸馏框架,通过策略网络动态分配前向和反向KL散度权重,实现主模态和长尾模态的双重对齐,在Rouge-L和BertScore上持续提升。

详情

展开后加载摘要…

URL PDF HTML 收藏