arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

高校专区

EPFL(洛桑联邦理工学院)

2026-04-02 至 2026-04-02 共收录 3
2604.01024 2026-04-02 cs.LG

Model-Based Learning of Near-Optimal Finite-Window Policies in POMDPs

基于模型的学习在POMDPs中近最优有限窗口策略

Philip Jordan, Maryam Kamgarpour

机构 * SYCAMORE group, Institute of Mechanical Engineering, EPFL(SYCAMORE小组,机械工程研究所,瑞士洛桑联邦理工学院)

AI总结 研究基于模型的学习在POMDPs中有限窗口策略的近最优性,通过分析样本复杂性,提出高效的模型估计方法,结合价值迭代获得近最优策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.07555 2026-04-02 cs.LG

Graph-Dependent Regret Bounds in Multi-Armed Bandits with Interference

多臂老虎机中基于图的后悔界

Fateme Jamshidi, Mohammad Shahverdikondori, Negar Kiyavash

机构 * College of Management of Technology EPFL(EPFL技术管理学院)

AI总结 研究多臂老虎机在网络干扰下的表现,提出基于局部图结构的算法,推导出图依赖的后悔上界,并给出任意网络干扰下的下界,证明算法在密集和稀疏图中接近最优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00066 2026-04-02 cs.LG

Evolution Strategies for Deep RL pretraining

深度强化学习预训练的进化策略

Adrian Martínez, Ananya Gupta, Hanka Goralija, Mario Rico, Saúl Fenollosa, Tamar Alphaidze

机构 * École Polytechnique Fédérale de Lausanne (EPFL)(洛桑联邦理工学院)

AI总结 研究比较了进化策略与深度强化学习在不同难度任务中的性能,发现ES在简单任务中可提升DRL效果,但复杂任务中表现不优。

Comments 12 pages, 3 figures, 2 algorithms; EE-568 Reinforcement learning course project

详情

展开后加载摘要…

URL PDF HTML 收藏