Co-RL: Unsupervised Reasoning Emerges from Diverse Cohort in Multi-agent RL
Co-RL:多智能体强化学习中多样群体涌现的无监督推理
机构 * University of Exeter(埃克塞特大学) ; ByteDance(字节跳动) ; Johns Hopkins University(约翰斯·霍普金斯大学) ; UC San Diego(加州大学圣迭戈分校)
AI总结 本研究提出Co-RL框架,通过参数不共享的多智能体协作训练,利用同伴奖励减少对真实标注的依赖,提升纯文本及多模态任务的推理性能,缓解训练崩溃与响应同质化问题。
Comments 30 pages, 5 figures, 11 tables