MADA-RL: Multi-Agent Debate-Aware Reinforcement Learning for Parameter-Efficient Reasoning in Compact Models
MADA-RL:用于紧凑模型中参数高效推理的多智能体辩论感知强化学习
AI总结 研究针对紧凑模型训练成本高问题,提出MADA-RL框架,将其分为生成器和评论家角色,用辩论感知信号训练,通过LoRA微调少量参数。核心是反事实评论家优势,提高了模型准确率,在数学推理基准测试中有显著效果。
Comments 20 pages, 3 figures, 9 tables, 2 algorithms, under review at TMLR