Redistribution-based Cost Inference Improves Sparse Safe Offline RL
基于重分配的代价推断改进稀疏安全离线强化学习
机构 * University of the Witwatersrand(威特沃特斯兰德大学)
AI总结 针对安全离线强化学习中稀疏轨迹级停止反馈问题,提出RCI框架转换为密集每步代价,经理论证明转换无损,实验在两类任务上违规率更低且鲁棒性好。
Comments Accepted at the 1st IJCAI Workshop on Safe Physical AI (SPAI 2026), affiliated with IJCAI/ECAI 2026