One Frozen Simulator Is Not Enough: Simulator Collapse in Multi-Agent RL
单个冻结模拟器不够:多智能体强化学习中的模拟器崩溃问题
机构 * Northeastern University(东北大学) ; New York University(纽约大学) ; UC Berkeley(加州大学伯克利分校) ; University of Washington(华盛顿大学) ; Stanford University(斯坦福大学)
AI总结 针对人机交互多智能体强化学习中单个LLM模拟器导致的策略泛化缺陷,提出Verbalized Sampling和Co-Training两种方案,在多轮基准测试和真实用户研究中显著提升了性能,发布了开源框架SCOPE。
Comments 41 pages, 28 figures