GRPO for Financial Advice Generation: Outperforming Commercial LLMs under CATE Evaluation
用于金融建议生成的GRPO:在CATE评估下优于商用大语言模型
机构 * Intuit(英图易(金融科技公司))
专题命中 后训练与偏好优化 :LLM(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本研究将金融建议生成建模为强化学习问题,用GRPO微调开放权重大语言模型,经独立于评判者的CATE审计,其毛利润提升约为最强商用基线的两倍,表现优于商用大语言模型。