Can LLMs Reliably Self-Report Adversarial Prefills, and How?
LLM 能否可靠地自我报告对抗性预填充,以及如何实现?
机构 * KAIST(韩国科学技术院)
AI总结 研究LLM在安全场景中识别自身输出是否受对抗性预填充攻击的能力,发现模型平均27.3%声称预填充输出有意图,且内省信号主要来自安全/拒绝推理,LoRA微调方法扩大了意图-篡改探针差距并提高了攻击成功率。
Comments In submission
高校专区
LLM 能否可靠地自我报告对抗性预填充,以及如何实现?
机构 * KAIST(韩国科学技术院)
AI总结 研究LLM在安全场景中识别自身输出是否受对抗性预填充攻击的能力,发现模型平均27.3%声称预填充输出有意图,且内省信号主要来自安全/拒绝推理,LoRA微调方法扩大了意图-篡改探针差距并提高了攻击成功率。
Comments In submission
为什么自蒸馏(有时)会降低大语言模型的推理能力?
机构 * Microsoft Research(微软研究院) ; KAIST(韩国成均馆大学) ; Seoul National University(首尔国立大学)
AI总结 本文研究了自蒸馏在数学推理中降低大语言模型推理能力的原因,发现其通过抑制模型在推理过程中的不确定性表达,导致在未见过的问题上表现下降,强调了适当表达不确定性对鲁棒推理的重要性。
Comments Accepted to COLM 2026. Code is available at this https URL (https://github.com/beanie00/self-distillation-analysis)