arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Johns Hopkins University(约翰斯·霍普金斯大学)

2026-08-10 至 2026-08-10 共收录 2
2608.06825 2026-08-10 cs.LG 新提交

Multiscale Reward Hedging from Correct Demonstrations

基于正确示范的多尺度奖励对冲

Pahan Dewasurendra

机构 * Johns Hopkins University(约翰斯·霍普金斯大学)

AI总结 该研究针对从正确示范学习的问题,提出多尺度奖励对冲方法,获首个无时间范围的多项式有限界,在上下文推荐等任务中取得良好效果,且计算效率在特定场景下可优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06656 2026-08-10 cs.LG 新提交

Dirichlet Follow-the-Leader Closes the Gap in Simultaneous Multiclass U-Calibration

狄利克雷逐次学习器缩小多类别U校准的差距

Pahan Dewasurendra

机构 * Johns Hopkins University(约翰斯·霍普金斯大学)

AI总结 本研究提出狄利克雷逐次学习器算法,解决了多类别U校准中预测器的悔策率差距问题,得到的算法对有界和光滑真损失均达到最优悔策率。

详情

展开后加载摘要…

URL PDF HTML 收藏