Reinforcement Learning without Ground-Truth Solutions can Improve LLMs
无需真实解即可改进大语言模型的强化学习
机构 * University of California, San Diego(加州大学圣地亚哥分校) ; Snowflake AI Research
AI总结 提出RiVER框架,通过校准的连续奖励信号,在无真实解的任务上训练LLM,在AtCoder和精确解基准上均取得提升。
高校专区
无需真实解即可改进大语言模型的强化学习
机构 * University of California, San Diego(加州大学圣地亚哥分校) ; Snowflake AI Research
AI总结 提出RiVER框架,通过校准的连续奖励信号,在无真实解的任务上训练LLM,在AtCoder和精确解基准上均取得提升。
世界模型中的幻觉是可预测且可预防的
机构 * UC San Diego(加州大学圣迭戈分校)
AI总结 本文发现世界模型中的幻觉源于状态-动作空间的低覆盖区域,提出三种可预测幻觉的信号,并开发覆盖感知采样和好奇心奖励方法,仅需50条真实轨迹即可微调模型适应新环境。
Comments Interactive paper, live demo, code, dataset, and models: https://www.nicklashansen.com/mmbench2
科学发现作为元优化:一个组合优化案例研究
机构 * University of California San Diego(加州大学圣迭戈分校)
AI总结 提出将科学研究形式化为元优化,通过共识目标聚合方法,在3-SAT算法发现中实现从O(N^2.51)到O(N^1.33)的规模改进,最大实例加速约67倍。
Comments 35 pages, 6 figures
编译器驱动的超维计算近似调优
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; University of California San Diego(加州大学圣迭戈分校)
AI总结 提出ApproxHDC框架,通过编译器自动识别和应用超维计算中的领域特定近似,结合高效搜索与多硬件后端支持,实现性能大幅提升且精度损失极小。
JetFlow: 通过并行树草稿突破推测解码的缩放上限
机构 * UC San Diego(加州大学圣地亚哥分校) ; Zhejiang University(浙江大学) ; UIUC(伊利诺伊大学厄巴纳-香槟分校) ; Nanjing University(南京大学) ; StepFun(阶跃星辰)
AI总结 提出JetFlow框架,通过因果并行草稿头结合树推测解码,将更大草稿预算转化为更长接受前缀和更高端到端加速,在Qwen3模型上实现最高9.64倍加速。