Guardians and Offenders: A Survey on Harmful Content Generation and Safety Mitigation of LLM
守护者与违规者:大语言模型有害内容生成与安全缓解研究综述
机构 * University of South Florida(佛罗里达州立大学) ; Missouri University of Science and Technology(密苏里科技大学)
专题命中 偏好对齐 :safety(title,abstract);RLHF(abstract,abstract_cn);alignment(abstract);jailbreak(abstract)
AI总结 综述大语言模型在内容创作中带来的风险与挑战,系统回顾相关研究,提出危害与防御统一分类法,分析越狱策略,评估缓解措施,指出评估局限,明确未来研究方向以推动语言技术稳健且符合伦理发展。