arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

高校专区

University of California, San Diego(加州大学圣迭戈分校)

2026-03-13 至 2026-03-13 共收录 2
2603.12151 2026-03-13 cs.LG cs.AI

IsoCompute Playbook: Optimally Scaling Sampling Compute for LLM RL

IsoCompute Playbook: 优化LLM RL中的采样计算规模

Zhoujun Cheng, Yutao Xie, Yuxiao Qu, Amrith Setlur, Shibo Hao, Varad Pimpalkhute, Tongtong Liang, Feng Yao, Zhengzhong Liu, Eric Xing, Virginia Smith, Ruslan Salakhutdinov, Zhiting Hu, Taylor Killian, Aviral Kumar

机构 * UC San Diego(UC圣地亚哥大学) MBZUAI-IFM Carnegie Mellon University(卡内基梅隆大学)

AI总结 本文研究了LLM RL中采样计算的最优分配,发现并行回放数随计算预算增加而增加并饱和,不同问题驱动机制不同,且增加并行回放可减少干扰,问题数影响训练稳定性。

Comments 29 pages, 27 figures. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11110 2026-03-13 cs.RO cs.AI

ResWM: Residual-Action World Model for Visual RL

ResWM:基于视觉强化学习的残差动作世界模型

Jseen Zhang, Gabriel Adineera, Jinzhou Tan, Jinoh Kim

机构 * University of California, San Diego(加州大学圣地亚哥分校) Texas A&M University-Commerce(德克萨斯A&M大学-科摩斯)

AI总结 ResWM通过将控制变量从绝对动作转换为残差动作,提升了视觉强化学习中世界模型的预测能力和稳定性,实现了更高效的样本利用和更平滑的控制策略。

Comments Submit KDD2026

详情

展开后加载摘要…

URL PDF HTML 收藏