LLM Output Detectability and Task Performance Can be Jointly Optimized
大语言模型输出可检测性与任务性能可以联合优化
机构 * Institute of Science Tokyo(东京科学研究所) ; MBZUAI ; National Institute of Advanced Industrial Science and Technology(国家先进工业科学与技术研究院) ; NII LLMC(日本信息基础设施中心LLMC)
专题命中 后训练与偏好优化 :LLM(title,abstract);分类 cs.CL
AI总结 本文提出PUPPET框架,通过强化学习优化大语言模型,使其输出更易检测且在下游任务中表现更优,实验表明其在长文问答、摘要和作文写作中均优于传统水印方法。
Comments 15 pages, 9 figures, 20 tables. Code: https://github.com/pakapaka333/PUPPET