Reward Modeling for Multi-Agent Orchestration
多智能体编排的奖励建模
机构 * Rutgers University(罗杰斯大学) ; Salesforce AI Research(Salesforce人工智能研究)
专题命中 多智能体 :agent(title,abstract);multi-agent(title,abstract);分类 cs.AI、cs.CL、cs.LG
AI总结 提出OrchRM框架,通过自监督学习从多智能体执行中间产物构建奖励模型,无需人工标注,实现高效编排器训练和测试时扩展,在多个领域提升性能并降低计算成本。
Comments Preprint; work in progress