Diffuse AI Control on Fuzzy Tasks
模糊任务上的扩散AI控制
机构 * Anthropic Fellows Program (via MATS)(Anthropic 研究员计划(通过 MATS)) ; EPFL(洛桑联邦理工学院) ; Redwood Research(红木研究) ; Anthropic
专题命中 红队测试 :safety(abstract);AI safety(abstract);分类 cs.LG
AI总结 针对AI在模糊任务上的长期扩散威胁,提出蓝队与红队对抗框架,通过弱模型评分训练强模型,并发现红队可利用多目标进化提示优化找到评分高但性能差的子版本行为,蓝队则通过对抗优化提升鲁棒性。