Off-Policy Learning with Limited Supply
有限供应下的离策略学习
机构 * Keio University(Keio大学) ; Institute of Science Tokyo(东京科学研究所) ; Meiji University(Meiji大学) ; Yale University(Yale大学) ; LY Corporation(LY公司) ; Hanjuku-kaso, Co., Ltd.
AI总结 本文研究了在情境老虎机中受限供应下的离策略学习问题,提出了一种新的OPLS方法,通过考虑用户间的相对预期奖励来更高效地分配有限供应的物品,实验证明其在有限供应情境下的优越性。
Comments Published as a conference paper at WWW 2026