The Alignment Waltz: Jointly Training Agents to Collaborate for Safety
对齐之舞:联合训练代理以安全协作
机构 * Meta Superintelligence Labs(Meta超智能实验室) ; Johns Hopkins University(约翰·霍普金斯大学)
专题命中 安全训练 :alignment(title,abstract);safety(title,abstract);harmlessness(abstract);分类 cs.CL
AI总结 本文提出WaltzRL框架,通过联合训练对话代理和反馈代理,解决LLM在安全与帮助性间的平衡问题,实验表明其有效降低不安全响应和过度拒绝率。
Comments ICLR 2026