Deep SPI: Safe Policy Improvement via World Models
深度SPI:通过世界模型实现安全策略改进
机构 * AI Lab, Vrije Universiteit Brussel(人工智能实验室,布鲁塞尔自由大学) ; Cohere
AI总结 DeepSPI通过结合世界模型和表示学习,提出了一种在线策略改进算法,在保持理论保证的同时在ALE-57基准中表现优异。
Comments ICLR 2026, 10 pages main text, 21 pages appendix (excluding references)