Bootstrapped Mixed Rewards for RL Post-Training: Injecting Canonical Action Order
基于强化学习后训练的混合奖励:注入经典动作顺序
机构 * University of Michigan(密歇根大学)
AI总结 本文提出在强化学习后训练中引入混合奖励,通过结合稀疏任务奖励和顺序奖励,提升模型对经典求解顺序的适应能力,无需修改监督数据或架构。
高校专区
基于强化学习后训练的混合奖励:注入经典动作顺序
机构 * University of Michigan(密歇根大学)
AI总结 本文提出在强化学习后训练中引入混合奖励,通过结合稀疏任务奖励和顺序奖励,提升模型对经典求解顺序的适应能力,无需修改监督数据或架构。
学习最优的个性化决策规则以实现条件人口平等问题
机构 * Department of Applied Mathematics, The Hong Kong Polytechnic University(应用数学系,香港理工大学) ; Department of Biostatistics, City University of Hong Kong(生物统计学系,香港城市大学) ; Department of Biostatistics, University of Michigan(生物统计学系,密歇根大学)
AI总结 本文提出了一种结合人口平等问题和条件人口平等问题约束的框架,用于学习最优的个性化决策规则,以减少算法歧视并提高公平性。
当工具和规划如何帮助大语言模型思考?一个成本和延迟感知的基准测试
机构 * College of Engineering(工程学院) ; University of Michigan-Dearborn(密歇根大学-迪尔伯恩分校)
AI总结 研究通过对比不同配置评估工具和规划对大语言模型性能的影响,发现工具增强能显著提升准确性但增加延迟,而复杂工具协调易导致模型退化。
连续思维链实现并行探索与推理
机构 * University of Michigan - Ann Arbor(密歇根大学安娜堡分校) ; Google Research NYC(谷歌纽约研究)
AI总结 本文提出CoT2连续思维链方法,通过并行探索与推理提升模型性能,解决组合子集和问题并优化推理效率。
Comments ICLR 2026
VTool-R1: 通过在多模态工具使用上的强化学习使VLMs学会通过图像思考
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; University of Michigan Ann Arbor(密歇根大学安娜堡分校) ; Independent Researcher(独立研究者)
AI总结 VTool-R1通过强化学习训练视觉语言模型生成多模态思考链,提升其通过图像进行推理的能力。
Comments ICLR 2026