Efficient Reinforcement Learning for Long-Horizon Tool-Use Agentic Tasks
面向长周期工具使用智能体任务的高效强化学习
机构 * Capital One(第一资本金融公司) ; AI Foundations(人工智能基础部门)
专题命中 规划决策 :tool-use(title,abstract);agentic(title);agent(abstract);分类 cs.AI、cs.LG
AI总结 本文提出 SINKFLEX-RL 模块化训练系统,通过整合环境接口等技术,在 Tau2Bench 测试中提升验证奖励并降低注意力路径显存占用,实现长周期工具使用智能体的高效 RL 训练。
Comments Published at the COLM 2026 Workshop on Efficient Reasoning