arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Stanford University(斯坦福大学)

2026-08-14 至 2026-08-14 共收录 3
2606.00367 2026-08-14 cs.LG cs.AI 版本更新

Reinforcement Learning with Pairwise Preferences in Long-Term Decision Problems

长期决策问题中基于成对偏好的强化学习

Jonathan Colaço Carr, Prakash Panangaden, Doina Precup, Benjamin Van Roy

机构 * School of Computer Science, McGill University, Montreal, Quebec, Canada(麦吉尔大学计算机科学学院) Mila - Quebec AI Institute, Montreal, Quebec, Canada(魁北克人工智能研究所) Department of Electrical Engineering, Stanford University, Stanford, California, USA(斯坦福大学电气工程系)

AI总结 针对长期决策问题中基于成对偏好的强化学习效率低且缺乏马尔可夫策略最优性保证的问题,提出马尔可夫决策竞赛模型,证明平稳马尔可夫策略最优性、求解复杂度为P,并给出亚线性收敛算法,在高维长期问题中显著提升学习效率。

Comments Accepted for ICML 2026. v2 has an updated abstract and introduction. Results and conclusions are unchanged

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31034 2026-08-14 cs.LG cs.AI 版本更新

Annealed Softmax Greedy in Many-Armed Bayesian Bandits

多臂贝叶斯老虎机中的退火Softmax贪婪算法

William Overman, Mohsen Bayati

机构 * Stanford University(斯坦福大学)

AI总结 本文研究退火Softmax贪婪算法在多臂贝叶斯伯努利老虎机中的贝叶斯遗憾,证明在先验满足线性上尾条件(β=1的β正则性)时,算法达到接近最优的贝叶斯遗憾率,并与RLVR方法形成结构类比。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24749 2026-08-14 cs.LG stat.ML 版本更新

The Optimal Sample Complexity of Multiclass and List Learning

多类和列表学习的最优样本复杂性

Chirag Pabbaraju

机构 * Stanford University(斯坦福大学)

AI总结 研究确定多类和列表学习的最优样本复杂性依赖于DS维度,证明了DS维度上限与最大超图密度的关系,解决了长期存在的猜想。

Comments tightened realizable list learning results

详情

展开后加载摘要…

URL PDF HTML 收藏