Same Dangerous Objective, Opposite Advice: Direct Exposure versus Multi-Agent Mediation
相同危险目标,相反建议:直接暴露与多智能体调解
机构 * University of Pennsylvania(宾夕法尼亚大学)
专题命中 其他安全 :safety(abstract);分类 cs.AI
AI总结 研究通过测试发现,语言模型直接面对危险目标和经智能体转换传递指令时表现不同,存在行为反向转变及组合安全漏洞,高性能模型可用于特定自动化工作流程的用户端组件,却未明确其内部机制。
Comments 21 pages; welcome comments