G-Zero: Self-Play for Open-Ended Generation from Zero Data
G-Zero:从零数据开始的自主开放生成自我学习
机构 * Washington University in St. Louis(华盛顿大学圣路易斯分校) ; University of Virginia(弗吉尼亚大学) ; University of Maryland(马里兰大学) ; University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)
专题命中 偏好对齐 :DPO(summary_cn,abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 G-Zero通过无验证器的共进化框架实现自主改进,利用Hint-δ内在奖励量化生成模型在无辅助响应与带提示响应间的预测偏移,通过GRPO训练提出者模型持续针对生成器的盲区,同时通过DPO优化生成器内部化提示引导的改进。