GASP: Guided Asymmetric Self-Play For Coding LLMs
GASP:指导性的非对称自我对弈用于编码大语言模型
机构 * University of Tübingen(图宾根大学) ; Max Planck Institute for Intelligent Systems(马克斯·普朗克智能系统研究所) ; ELLIS Institute Tübingen(图宾根ELLIS研究所) ; Tübingen AI Center(图宾根人工智能中心)
AI总结 GASP通过引入真实数据目标问题,改进了非对称自我对弈方法,提升了LiveCodeBench上的pass@20指标,并解决了其他方法无法达到的难题。
Comments Accepted at ICLR 2026 Workshop on AI with Recursive Self-Improvement (RSI 2026) as Spotlight, and ICLR 2026 Workshop on Lifelong Agents (LLA 2026)