arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

2026-05-08 至 2026-05-08 共收录 5
2605.06654 2026-05-08 cs.LG cs.AI math.OC

Optimizer-Model Consistency: Full Finetuning with the Same Optimizer as Pretraining Forgets Less

优化器-模型一致性:使用与预训练相同的优化器进行全微调可减少遗忘

Yuxing Liu, Jianyu Wang, Tong Zhang

机构 * UIUC(伊利诺伊大学香槟分校) Apple(苹果公司)

AI总结 本文发现使用与预训练相同的优化器进行全微调,在监督微调阶段能更少遗忘并保持性能,提出优化器-模型一致性概念,通过实验和理论分析揭示优化器对模型的影响及微调策略的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06614 2026-05-08 cs.AI cs.CL

SkillOS: Learning Skill Curation for Self-Evolving Agents

SkillOS: 为自演化代理学习技能编目

Siru Ouyang, Jun Yan, Yanfei Chen, Rujun Han, Zifeng Wang, Bhavana Dalvi Mishra, Rui Meng, Chun-Liang Li, Yizhu Jiao, Kaiwen Zha, Maohao Shen, Vishy Tirumalashetty, George Lee, Jiawei Han, Tomas Pfister, Chen-Yu Lee

机构 * Google Cloud AI Research(谷歌云人工智能研究) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Massachusetts Institute of Technology(麻省理工学院)

AI总结 SkillOS通过经验驱动的强化学习方法,解决自演化代理中复杂长期技能编目的学习问题,优于记忆-free和强记忆基线,在效果和效率上均表现优异,技能库逐步演变成更丰富的Markdown文件。

Comments 11 pages, 6 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18857 2026-05-08 cs.AI cs.LG

CORE: Concept-Oriented Reinforcement for Bridging the Definition-Application Gap in Mathematical Reasoning

CORE:面向概念的强化学习,弥合定义与应用之间的数学推理差距

Zijun Gao, Zhikun Xu, Xiao Ye, Ben Zhou

机构 * University of Illinois Urbana–Champaign(伊利诺伊大学厄巴纳-香槟分校) Arizona State University(亚利桑那州立大学)

AI总结 CORE通过引入概念导向的强化学习框架,解决大语言模型在数学推理中概念应用不足的问题,通过合成概念对齐习题和注入概念片段提升模型的推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05242 2026-05-08 cs.IR cs.AI

Beyond Semantic Similarity: Rethinking Retrieval for Agentic Search via Direct Corpus Interaction

超越语义相似性:通过直接语料交互重新思考代理搜索的检索

Zhuofeng Li, Haoxiang Zhang, Cong Wei, Pan Lu, Ping Nie, Yi Lu, Yuyang Bai, Shangbin Feng, Hangxiao Zhu, Ming Zhong, Yuyu Zhang, Jianwen Xie, Yejin Choi, James Zou, Jiawei Han, Wenhu Chen, Jimmy Lin, Dongfu Jiang, Yu Zhang

机构 * Texas A&M University(德克萨斯A&M大学) University of Waterloo(滑铁卢大学) UC San Diego(圣地亚哥大学) Stanford University(斯坦福大学) University of Washington(华盛顿大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Verdent AI Lambda

AI总结 本文提出直接语料交互(DCI)方法,通过通用终端工具直接搜索原始语料,无需嵌入模型或检索接口,有效提升代理搜索性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18257 2026-05-08 cs.LG cs.AI

Discovering What You Can Control: Interventional Boundary Discovery for Reinforcement Learning

发现你可以控制的东西:强化学习中的干预边界发现

Jiaxin Liu, Anzhe Cheng, Paul Bogdan

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Southern California(南加州大学)

AI总结 本文提出干预边界发现方法,通过随机化动作生成干预对比,利用FDR校正的两样本检验确定观测维度,有效识别可控状态维度。

详情

展开后加载摘要…

URL PDF HTML 收藏