arXivDaily arXiv每日学术速递 周一至周五更新

PAPERDAILY REPORTS

不用标准答案也能练推理?字节等提出Co-RL,多智能体互评最高提升8.6%

arXiv 2608.17253 cs.AI · cs.CV · cs.LG

没有标准答案时,让模型给自己打分很容易把原有偏见越练越强。埃克塞特大学、字节跳动、约翰斯·霍普金斯大学、加州大学圣迭戈分校等机构提出Co-RL,让多个不共享参数的模型互相提供强化学习奖励,并用不同模型家族、规模和训练样本降低共同犯错。

论文在7项文本推理基准上报告平均提升3.0%至8.6%,在4项多模态基准上提升2.3%至7.2%,全程不使用真实标签。作者还称部分配置达到或超过有监督方法,但结论只覆盖所选模型、训练规模和基准,互评无法消除整个模型群体共享的知识缺口。

自我奖励为何容易把错误放大

可验证数学题或代码任务能用答案、编译器和测试提供奖励。开放推理没有稳定评分器时,研究者常让模型评判自己的输出。若模型偏好某种错误论证,它会给类似答案更高分,训练后样本分布进一步收窄,最终出现回答同质化甚至坍塌。

Co-RL把单模型自评改成群体互评。多个模型分别生成答案,奖励来自其他成员的反馈;每个模型独立更新,不共享参数。一个成员的错误只有得到同伴一致认可才会持续强化,因此错误相关性成为系统能否工作的关键。

Co-RL训练机制

多个独立模型生成答案并从同伴获得奖励,各自执行强化学习更新。

这不是简单多数投票。训练过程中,模型既是学习者也是其他成员的评价来源,奖励分布会随群体能力变化。作者因而持续观察准确率、答案多样性和训练健康度,判断提升是否来自真正的互补反馈。

异构群体比同质模型更能避免一起犯错

如果群体成员来自同一模型家族、同一规模并看到同样表述,它们的错误高度相关。增加成员数量未必增加有效信息,反而可能让共同偏见获得更强多数。Co-RL通过混合模型家族和参数规模,并对训练样本做不同改写,降低反馈相关性。

训练动态

训练曲线用于比较群体学习期间的准确率、多样性与坍塌现象。

论文实验显示,群体越多样,推理表现与行为多样性越稳定。同质自奖励设置更容易让回答集中到少数模式;异构成员提供不同解题路径和错误分布,使某一偏差不易垄断奖励。

这项观察有明确边界。不同模型也可能使用相似预训练数据和对齐方法,遇到共同未知事实时仍会一致判断错误。群体多样性降低的是相关错误概率,不会凭空产生缺失证据。

文本最高提升8.6%,多模态最高7.2%

Co-RL在文本和视觉—语言两类任务上测试。7项文本基准的平均增益范围为3.0%至8.6%,4项多模态基准为2.3%至7.2%。不同组合的起点、群体结构和任务难度不同,因此论文给出区间,而不是把最高值当作所有配置的固定收益。

不同奖励规模的表现

奖励实验比较不同群体与反馈设置,检查无标签信号能否持续改善推理。

部分实验中,Co-RL与有监督方法持平或更好。这里的“无标签”指训练阶段没有使用任务真实答案,不代表系统不含人工知识:基础模型已经经过预训练和对齐,基准题目也由人类设计。

异构与同质群体对比

对比结果显示,不同模型家族组成的群体更能维持答案多样性并减轻训练坍塌。

评测仍使用标准答案计算最终准确率,所以研究者可以判断训练有没有提升;真正面对完全未知问题时,没有这层外部标尺,奖励漂移更难被发现。

下一步是给互评加入外部证据

Co-RL适合标准答案稀缺但可以产生多条候选推理的任务,例如开放问答、多模态解释和早期科研假设筛选。部署时可以让群体先互评,再用检索、工具执行或少量人工抽查校准高风险样本,避免把同伴共识直接当成事实。

后续实验应测量共同错误率、训练成本和群体规模收益,并在医学、安全等领域加入独立证据源。互评的价值是利用模型差异提供训练信号;当所有成员共享同一盲点时,系统仍需要数据库、实验或人类专家打破共识。

参考资料

https://arxiv.org/abs/2608.17253