Composing Policy Gradients and Prompt Optimization for Language Model Programs
将策略梯度与提示优化组合用于语言模型程序
机构 * University of Notre Dame(诺特大学) ; Stanford University(斯坦福大学) ; UC Berkeley(伯克利大学) ; Anyscale ; CMU(卡内基梅隆大学) ; Zoom, Inc.(Zoom公司) ; Contextual AI ; MIT(麻省理工学院)
AI总结 本文研究了如何将GRPO与自动提示优化结合,以提升多提示程序的性能,实验表明这种组合在分类、多跳搜索和隐私保护委托任务中平均提升准确率11%。
Comments ACM CAIS 2026. Lakshya*, Dilara*, and Noah* contributed equally to this work