SVR-R1: Bootstrapping Multi-modal Reasoning with Self-verification in Reinforcement Learning
SVR-R1:在强化学习中通过自我验证引导多模态推理
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Meta
专题命中 图文多模态 :multi-modal(title);multimodal(abstract);分类 cs.AI
AI总结 SVR-R1是一个多轮强化学习框架,将模型自身验证转化为学习信号。通过GRPO和异步多轮展开框架实现,无需外部监督。在视觉语言推理基准上评估,大幅提高准确率,弥合推理时自我优化与强化学习训练交叉点,还将开源以促研究。
Comments Under submission