arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

大厂专区

Snowflake

2026-04-02 至 2026-04-02 共收录 1
2604.00698 2026-04-02 cs.LG cs.AI cs.CL

Learning to Hint for Reinforcement Learning

为强化学习学习提示

Yu Xia, Canwen Xu, Zhewei Yao, Julian McAuley, Yuxiong He

机构 * University of California, San Diego(加州大学圣迭戈分校) Snowflake AI Research

AI总结 本文提出HiLL框架,通过联合训练提示策略和推理策略,解决强化学习中因提示不足导致的优势崩溃问题,通过提示依赖性理论提升提示的迁移效果,实验显示HiLL在多个基准上优于GRPO和传统提示方法。

详情

展开后加载摘要…

URL PDF HTML 收藏