Direct Advantage Estimation for Scalable and Sample-efficient Deep Reinforcement Learning
直接优势估计:可扩展且样本高效的深度强化学习
专题命中 模型式强化学习 :latent dynamics(abstract);分类 cs.LG;dynamics model(abstract)
AI总结 针对直接优势估计(DAE)在部分可观测域和高维观测下的局限性,本文扩展其理论框架并引入离散潜动态模型降低计算复杂度,在Arcade学习环境中验证了DAE的可扩展性和样本效率。
Comments Accepted at RLC2026