GEPA: Reflective Prompt Evolution Can Outperform Reinforcement Learning
GEPA:反思式提示进化可以超越强化学习
Lakshya A Agrawal, Shangyin Tan, Dilara Soylu, Noah Ziems, Rishi Khare, Krista Opsahl-Ong, Arnav Singhvi, Herumb Shandilya, Michael J Ryan, Meng Jiang, Christopher Potts, Koushik Sen, Alexandros G. Dimakis, Ion Stoica, Dan Klein, Matei Zaharia, Omar Khattab
专题命中
后训练与偏好优化
:LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
Majority of the Bests: Improving Best-of-N via Bootstrapping
多数最佳:通过Bootstrap改进最佳-N
Amin Rakhsha, Kanika Madan, Tianyu Zhang, Amir-massoud Farahmand, Amir Khasahmadi
机构
*
University of Toronto(多伦多大学)
;
Vector Institute(向量研究所)
;
Autodesk(Autodesk公司)
;
Polytechnique Montréal(蒙特利尔理工学院)
;
Mila - Quebec AI Institute(魁北克人工智能研究所)
专题命中
后训练与偏好优化
:LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
GRAPH-GRPO-LEX: Contract Graph Modeling and Reinforcement Learning with Group Relative Policy Optimization
Moriya Dechtiar, Daniel Martin Katz, Mari Sundaresan, Sylvain Jaume, Hongming Wang
机构
*
Harvard University(哈佛大学)
;
Illinois Tech - Chicago Kent College of Law(伊利诺伊理工学院-芝加哥肯特法学院)
;
CLTDS, Bucerius Law School(CLTDS,布塞里乌斯法学院)
;
Yong Pung How School of Law, Singapore Management University(永丰何法学院,新加坡管理大学)
;
CodeX - The Stanford Center for Legal Informatics, Stanford University(CodeX-斯坦福法律信息中心,斯坦福大学)
;
Georgetown University(乔治城大学)
;
Massachusetts Institute of Technology(麻省理工学院)
专题命中
后训练与偏好优化
:LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
机构
*
DeepSeek-AI
;
Dept. of Computer Sci. & Tech., Tsinghua University(计算机科学与技术系,清华大学)
;
Institute for AI Industry Research (AIR), Tsinghua University(人工智能产业研究院(AIR),清华大学)
专题命中
后训练与偏好优化
:large language model(abstract);language model(abstract);post-training(abstract);分类 cs.CL、cs.AI、cs.LG