One Token Away from Collapse: The Fragility of Instruction-Tuned Helpfulness
距离崩溃仅一步之遥:指令调制帮助性的脆弱性
机构 * University of Southern California(南加州大学) ; Intel AI(英特尔人工智能)
AI总结 研究探讨了指令调制大语言模型在简单约束下的帮助性稳定性,发现其在词汇约束下响应质量显著下降,揭示了指令调制对表面模板的依赖性。
大厂专区
距离崩溃仅一步之遥:指令调制帮助性的脆弱性
机构 * University of Southern California(南加州大学) ; Intel AI(英特尔人工智能)
AI总结 研究探讨了指令调制大语言模型在简单约束下的帮助性稳定性,发现其在词汇约束下响应质量显著下降,揭示了指令调制对表面模板的依赖性。