Beyond Penalization: Diffusion-based Out-of-Distribution Detection and Selective Regularization in Offline Reinforcement Learning
超越惩罚:基于扩散的分布外检测与选择性正则化在离线强化学习中
机构 * School of Computer Science and Technology, Tongji University, Shanghai, China(同济大学计算机科学与技术学院,上海,中国) ; MOE Key Lab of Embedded System and Service Computing, Tongji University, Shanghai, China(教育部嵌入式系统与服务计算重点实验室,同济大学,上海,中国) ; Shanghai Innovation Institute(上海创新研究院)
AI总结 本文提出DOSER框架,通过扩散模型捕捉行为策略和状态分布,利用单步去噪重构误差检测分布外动作,并通过评估预测转移区分有益与有害动作,提供理论保证和实验验证。
Comments 10 pages, 5 figures. Accepted to ICLR 2026