2607.14952
2026-07-28
cs.LG
cs.DC
版本更新
57%
LongStraw: Long-Context RL Beyond 2M Tokens under a Fixed GPU Budget
LongStraw:在固定GPU预算下超越200万个令牌的长上下文强化学习
Changhai Zhou, Kieran Liu, Yuhua Zhou, Qian Qiao, Jun Gao, Harry Zhang, Irvine Lu, Nolan Ho, Lucian Li, Andrew Lei, Cleon Cheng, Steven Chiang, Yihang Zeng, Di Zhang, Rio Yang, Kaijie Chen, Andrew Chen, Pony Ma, Weizhong Zhang, Cheng Jin
专题命中
记忆与上下文管理
:AI agent(abstract);分类 cs.LG
AI总结
研究针对推理上下文长度与强化学习后训练的差距问题,提出LongStraw架构感知执行堆栈,用GRPO优化,在固定GPU预算下实现百万令牌强化学习后训练,通过实验验证了其执行能力。