arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

International Conference on Learning Representations · 会议 · Machine Learning

2026-07-27 至 2026-07-27 共收录 2
2607.22039 2026-07-27 cs.CL 新提交

Enough is as good as a feast: A Comprehensive Analysis of How Reinforcement Learning Mitigates Task Conflicts in LLMs

过犹不及:强化学习如何减轻大语言模型中任务冲突的综合分析

Zixuan Ren, Jinliang Lu, Junhong Wu, Yang Zhao, Dai Dai, Hua Wu, Haifeng Wang, Chengqing Zong

机构 * Institute of Automation, CAS(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学) Baidu Inc.(百度公司)

AI总结 研究对比强化学习与监督微调训练的大语言模型的合并行为,经五项任务评估发现强化学习能减少任务冲突及合并后性能下降。通过实验和分析揭示三个关键因素,表明强化学习在模型合并中更具优势。

Comments Published in ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22012 2026-07-27 cs.LG 新提交

Cross-Domain Off-Policy Evaluation and Learning for Contextual Bandits

上下文博弈的跨域离策略评估与学习

Yuta Natsubori, Masataka Ushiku, Yuta Saito

机构 * Hakuhodo DY Holdings, Inc.(博报堂DY控股公司) Cornell University(康奈尔大学)

AI总结 研究上下文博弈中离策略评估与学习问题,提出跨域OPE/L新设置,可利用目标域和其他域日志数据,开发新估计器和策略梯度方法,有效解决现有方法面临的挑战,增强离策略评估与学习能力。

Comments 21 pages, 10 figures, accepted to ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏