Tandem Reinforcement Learning with Verifiable Rewards
具有可验证奖励的串联强化学习
机构 * University of Toronto(多伦多大学) ; EPFL(瑞士联邦理工学院洛桑分校)
AI总结 提出串联强化学习(TRL),通过强弱模型交替生成推理链并共同奖励,在保持独立推理能力的同时提升模型间兼容性和可读性。
Comments 21 pages,7 figures,8 tables
高校专区
具有可验证奖励的串联强化学习
机构 * University of Toronto(多伦多大学) ; EPFL(瑞士联邦理工学院洛桑分校)
AI总结 提出串联强化学习(TRL),通过强弱模型交替生成推理链并共同奖励,在保持独立推理能力的同时提升模型间兼容性和可读性。
Comments 21 pages,7 figures,8 tables
SC3-Eval: 通过自洽视频生成评估机器人基础模型
机构 * University of Toronto(多伦多大学) ; Vector Institute(向量研究所) ; NVIDIA(英伟达) ; Physical Intelligence ; Stanford University(斯坦福大学) ; UC Berkeley(加州大学伯克利分校) ; Allen Institute for AI(艾伦人工智能研究所)
AI总结 提出SC3-Eval方法,利用前向-反向动力学一致性、跨视角一致性和测试时一致性,将预训练视频基础模型转化为准确的策略评估器,在7个真实世界策略上达到0.929的皮尔逊相关系数。