Tandem Reinforcement Learning with Verifiable Rewards
具有可验证奖励的串联强化学习
机构 * University of Toronto(多伦多大学) ; EPFL(瑞士联邦理工学院洛桑分校)
AI总结 提出串联强化学习(TRL),通过强弱模型交替生成推理链并共同奖励,在保持独立推理能力的同时提升模型间兼容性和可读性。
Comments 21 pages,7 figures,8 tables
高校专区
具有可验证奖励的串联强化学习
机构 * University of Toronto(多伦多大学) ; EPFL(瑞士联邦理工学院洛桑分校)
AI总结 提出串联强化学习(TRL),通过强弱模型交替生成推理链并共同奖励,在保持独立推理能力的同时提升模型间兼容性和可读性。
Comments 21 pages,7 figures,8 tables
历史文本中命名实体识别的时间融合策略研究
机构 * Digital Humanities Laboratory, EPFL, Lausanne, Switzerland(瑞士洛桑联邦理工学院数字人文实验室)
AI总结 针对历史文本中实体随时间漂移的问题,系统研究了将时间元数据嵌入NER模型的轻量级融合策略,实验表明后期融合在早期和噪声时期表现更鲁棒。
Journal ref International Conference on Theory and Practice of Digital Libraries 2025
宽度和数据如何影响二次神经网络中的泛化缩放定律
机构 * Statistical Physics of Computation Laboratory, École Polytechnique Fédérale de Lausanne (EPFL)(统计物理与计算实验室,洛桑联邦理工学院) ; Information, Learning and Physics Laboratory, École Polytechnique Fédérale de Lausanne (EPFL)(信息、学习与物理实验室,洛桑联邦理工学院)
AI总结 研究二次两层网络中泛化误差随样本数、宽度和正则化的缩放规律,揭示由目标谱结构控制的数据相关幂律和相变。
使用线性上下文赌博机学习同伴影响概率
机构 * University of Illinois Chicago(伊利诺伊大学芝加哥分校) ; École Polytechnique Fédérale de Lausanne(洛桑联邦理工学院)
AI总结 针对网络环境中同伴影响概率的异质性问题,提出基于线性上下文赌博机的在线学习框架,揭示遗憾最小化与估计误差之间的权衡,并设计可调参数的不确定性引导探索算法实现任意权衡点。
Journal ref In Proceedings of the 32nd ACM SIGKDD Conference on Knowledge Discovery and Data Mining V.2 (KDD '26), August 09-13, 2026, Jeju Island, Republic of Korea. ACM, New York, NY, USA, 12 pages