When RL Meets Adaptive Speculative Training: A Unified Training-Serving System
当强化学习遇见自适应推测训练:一个统一的训练-服务系统
AI总结 本文提出Aurora系统,通过强化学习实时学习推测器,解决传统方法中部署延迟和领域漂移问题,实验显示在多个模型上实现显著加速。
作者
Natural Language Processing
当强化学习遇见自适应推测训练:一个统一的训练-服务系统
AI总结 本文提出Aurora系统,通过强化学习实时学习推测器,解决传统方法中部署延迟和领域漂移问题,实验显示在多个模型上实现显著加速。
通过解码约束束搜索估计语言模型中的近原文提取风险
机构 * AVERI ; Stanford(斯坦福大学) ; Cornell(康奈尔大学) ; Google DeepMind(谷歌DeepMind)
AI总结 本文提出解码约束束搜索方法,以有效估计语言模型中的近原文提取风险,揭示更多可提取序列及模型规模对风险的影响。
Comments COLM 2026