Poly-EPO: Training Exploratory Reasoning Models
Poly-EPO:训练探索性推理模型
机构 * Stanford University(斯坦福大学)
AI总结 本文提出Poly-EPO框架,通过集强化学习提升语言模型的探索与利用协同,增强推理能力与泛化性能。
作者
Robotics / Machine Learning
Poly-EPO:训练探索性推理模型
机构 * Stanford University(斯坦福大学)
AI总结 本文提出Poly-EPO框架,通过集强化学习提升语言模型的探索与利用协同,增强推理能力与泛化性能。
测试时对齐 via 假设重加权
机构 * Stanford University(斯坦福大学)
AI总结 本文提出HyRe方法,通过重加权集成成员实现实时个性化,仅需1-5个标记示例即可超越现有奖励模型。
Comments TMLR 2026