Session-Level Optimization for Large-Scale Retrieval using REINFORCE with Multi-Step Off-Policy Correction
基于离策略强化学习的大规模生成式检索长期优化
AI总结 将推荐视为会话级序贯决策问题,用离策略REINFORCE在预收集数据上训练生成式检索器,提出多步重要性权重近似,训练用户反馈模型用于离线评估,引入测试时缩放程序,实验表明方法能改进离线估计。
Comments Accepted at the 5th Workshop on End-End Customer Journey Optimization at KDD 2026