Shuffle-R1: Efficient RL framework for Multimodal Large Language Models via Data-centric Dynamic Shuffle
Shuffle-R1: 通过数据导向的动态洗牌提升多模态大语言模型的强化学习框架
机构 * Huazhong University of Science and Technology(华中科技大学) ; MiLM Plus, Xiaomi Inc.(MiLM Plus,小米公司)
专题命中 视觉推理 :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.AI、cs.LG
AI总结 Shuffle-R1通过动态洗牌和轨迹采样提升多模态大语言模型的强化学习效率,实现更高效的训练效果。
Comments This paper has been accepted by ICLR 2026. Conference link: https://iclr.cc/virtual/2026/poster/10007559 OpenReview link: https://openreview.net/forum?id=mYP33u1QBK Project page at: https://xenozlh.github.io/Shuffle-R1/
Journal ref The Fourteenth International Conference on Learning Representations (ICLR), 2026