CoFi-PGMA: Counterfactual Policy Gradients under Filtered Feedback for Multi-Agent LLMs
CoFi-PGMA:在多智能体LLM中基于过滤反馈的反事实策略梯度
机构 * Stanford Graduate School of Business(斯坦福商学院) ; Stanford University(斯坦福大学) ; Department of Mathematics(数学系)
专题命中 后训练与偏好优化 :LLM(title_cn,summary_cn);RLHF(summary_cn,abstract);large language model(abstract);language model(abstract)
AI总结 针对多智能体LLM中过滤反馈导致的RLHF目标不准确问题,提出CoFi-PGMA框架,通过边际贡献反事实目标修正路由和协作机制下的学习信号,并提供实用训练算法和实证研究。
Comments 17 pages, 0 figures