Multiscale Reward Hedging from Correct Demonstrations
基于正确示范的多尺度奖励对冲
机构 * Johns Hopkins University(约翰斯·霍普金斯大学)
AI总结 该研究针对从正确示范学习的问题,提出多尺度奖励对冲方法,获首个无时间范围的多项式有限界,在上下文推荐等任务中取得良好效果,且计算效率在特定场景下可优化。
高校专区
基于正确示范的多尺度奖励对冲
机构 * Johns Hopkins University(约翰斯·霍普金斯大学)
AI总结 该研究针对从正确示范学习的问题,提出多尺度奖励对冲方法,获首个无时间范围的多项式有限界,在上下文推荐等任务中取得良好效果,且计算效率在特定场景下可优化。
狄利克雷逐次学习器缩小多类别U校准的差距
机构 * Johns Hopkins University(约翰斯·霍普金斯大学)
AI总结 本研究提出狄利克雷逐次学习器算法,解决了多类别U校准中预测器的悔策率差距问题,得到的算法对有界和光滑真损失均达到最优悔策率。