arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

California Institute of Technology(加州理工学院)

2026-06-01 至 2026-06-01 共收录 2
2605.31172 2026-06-01 cs.LG stat.ML

Convergence of Two-Timescale Markovian Stochastic Approximations with Applications in Reinforcement Learning

双时间尺度马尔可夫随机逼近的收敛性及其在强化学习中的应用

Vagul Mahadevan, Claire Chen, Shuze Daniel Liu, Shangtong Zhang

机构 * Department of Computer Science, University of Virginia, Charlottesville, VA, USA(弗吉尼亚大学计算机科学系) Data Science Lab, MIT, Cambridge, MA, USA(麻省理工学院数据科学实验室) Mitch Daniels School of Business, Purdue University, West Lafayette, IN, USA(普渡大学米切尔丹尼尔斯商学院) Division Office Physics, Math and Astronomy, California Institute of Technology, Pasadena, CA, USA(加州理工学院物理、数学和天文学分校)

AI总结 本文研究双时间尺度随机逼近在马尔可夫噪声下的稳定性与收敛性,通过用慢时间尺度参数的运行最大值控制快时间尺度参数,首次证明了带资格迹的TDC在离策略线性函数逼近下的几乎必然收敛。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12386 2026-06-01 cs.MA cs.GT cs.LG

Provably Convergent Actor-Critic for MARL through Risk-aversion

通过风险厌恶实现可证明收敛的MARL演员-评论家算法

Yizhou Zhang, Eric Mazumdar

机构 * caltech(加州理工学院)

AI总结 针对无限时域一般和马尔可夫博弈,提出基于风险厌恶分位数响应均衡(RQE)的单时间尺度演员-评论家算法,利用RQE的正则性证明全局收敛并给出有限样本保证。

详情

展开后加载摘要…

URL PDF HTML 收藏