ReflexiCoder: Teaching Large Language Models to Self-Reflect on Generated Code and Self-Correct It via Reinforcement Learning
ReflexiCoder:通过强化学习教大语言模型自我反思和自我纠正生成的代码
Juyong Jiang, Jiasi Shen, Sunghun Kim, Kang Min Yoo, Jeonghoon Kim, Sungju Kim
机构
*
The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))
;
The Hong Kong University of Science and Technology(香港科技大学)
;
Amazon AGI(亚马逊人工智慧实验室)
;
NAVER Cloud(NAVER云)
机构
*
National University of Singapore(新加坡国立大学)
;
University of California, Santa Barbara(加州大学圣巴巴拉分校)
;
Singapore University of Technology and Design(新加坡科技设计大学)
Training Long-Context, Multi-Turn Software Engineering Agents with Reinforcement Learning
Alexander Golubev, Maria Trofimova, Sergei Polezhaev, Ibragim Badertdinov, Maksim Nekrashevich, Anton Shevtsov, Simon Karasik, Sergey Abramov, Andrei Andriushchenko, Filipp Fisin, Sergei Skvortsov, Boris Yangel