Convergence of Two-Timescale Markovian Stochastic Approximations with Applications in Reinforcement Learning
双时间尺度马尔可夫随机逼近的收敛性及其在强化学习中的应用
机构 * Department of Computer Science, University of Virginia, Charlottesville, VA, USA(弗吉尼亚大学计算机科学系) ; Data Science Lab, MIT, Cambridge, MA, USA(麻省理工学院数据科学实验室) ; Mitch Daniels School of Business, Purdue University, West Lafayette, IN, USA(普渡大学米切尔丹尼尔斯商学院) ; Division Office Physics, Math and Astronomy, California Institute of Technology, Pasadena, CA, USA(加州理工学院物理、数学和天文学分校)
AI总结 本文研究双时间尺度随机逼近在马尔可夫噪声下的稳定性与收敛性,通过用慢时间尺度参数的运行最大值控制快时间尺度参数,首次证明了带资格迹的TDC在离策略线性函数逼近下的几乎必然收敛。
Comments ICML 2026