Faster Fixed-Point Methods for Multichain MDPs
多链MDP的更快固定点方法
AI总结 本文研究了在平均奖励准则下求解一般多链马尔可夫决策过程的值迭代算法,提出改进的导航子问题解决方法,实现更快收敛速度和更精确的复杂度度量。
Journal ref NeurIPS 2025
期刊&会议
Conference on Neural Information Processing Systems · 会议 · Machine Learning
多链MDP的更快固定点方法
AI总结 本文研究了在平均奖励准则下求解一般多链马尔可夫决策过程的值迭代算法,提出改进的导航子问题解决方法,实现更快收敛速度和更精确的复杂度度量。
Journal ref NeurIPS 2025
平均回报离线强化学习中单策略样本复杂度与瞬时覆盖的最优性
机构 * Department of Computer Sciences, University of Wisconsin-Madison(威斯康星大学麦迪逊分校计算机科学系)
AI总结 本文研究了平均回报MDP中的离线强化学习,提出基于目标策略的精确样本复杂度界,并首次处理一般弱连通MDP,引入改进的悲观折扣价值迭代算法。
Journal ref NeurIPS 2025
Auto-ART:结构化文献综合与自动化对抗鲁棒性测试
机构 * Independent Researcher(独立研究者)
AI总结 本文提出Auto-ART框架,通过结构化文献综合和自动化对抗鲁棒性测试,填补了领域内的知识空白,实现了多规范评估和合规性映射。
Comments NeurIPS 2026 Evaluations and Datasets Track Submission