Fitted Occupancy-Ratio Evaluation without Bellman Completeness
无需贝尔曼完备性的拟合占用比评估
机构 * Stanford University(斯坦福大学)
AI总结 针对离线强化学习分布偏移下的离策略评估问题,提出拟合占用比评估方法FORE,通过伴随贝尔曼递归估计占用比,仅需占用比可实现性,无需贝尔曼完备性等条件,保障离线策略评估收敛性。
高校专区
无需贝尔曼完备性的拟合占用比评估
机构 * Stanford University(斯坦福大学)
AI总结 针对离线强化学习分布偏移下的离策略评估问题,提出拟合占用比评估方法FORE,通过伴随贝尔曼递归估计占用比,仅需占用比可实现性,无需贝尔曼完备性等条件,保障离线策略评估收敛性。
基于评估的科学发现扩展
机构 * Wizard Intelligence Learning Lab, Stanford University(智能巫师学习实验室,斯坦福大学) ; Peking University(北京大学) ; Tsinghua University(清华大学) ; The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))
AI总结 本文提出SimpleTES框架,通过并行探索、反馈驱动精炼和局部选择,提升评估驱动的发现循环效率,解决科学发现扩展问题,展示在21个科学问题上超越基线模型的性能。