arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Korea Advanced Institute of Science and Technology(韩国科学技术院)

2026-08-19 至 2026-08-19 共收录 2
2606.23671 2026-08-19 cs.CL 版本更新

Can LLMs Reliably Self-Report Adversarial Prefills, and How?

LLM 能否可靠地自我报告对抗性预填充,以及如何实现?

Quang Minh Nguyen, Uzair Ahmed, Taegyoon Kim

机构 * KAIST(韩国科学技术院)

AI总结 研究LLM在安全场景中识别自身输出是否受对抗性预填充攻击的能力,发现模型平均27.3%声称预填充输出有意图,且内省信号主要来自安全/拒绝推理,LoRA微调方法扩大了意图-篡改探针差距并提高了攻击成功率。

Comments In submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24472 2026-08-19 cs.CL cs.LG 版本更新

Why Does Self-Distillation (Sometimes) Degrade the Reasoning Capability of LLMs?

为什么自蒸馏(有时)会降低大语言模型的推理能力?

Jeonghye Kim, Xufang Luo, Minbeom Kim, Sangmook Lee, Dohyung Kim, Jiwon Jeon, Dongsheng Li, Yuqing Yang

机构 * Microsoft Research(微软研究院) KAIST(韩国成均馆大学) Seoul National University(首尔国立大学)

AI总结 本文研究了自蒸馏在数学推理中降低大语言模型推理能力的原因,发现其通过抑制模型在推理过程中的不确定性表达,导致在未见过的问题上表现下降,强调了适当表达不确定性对鲁棒推理的重要性。

Comments Accepted to COLM 2026. Code is available at this https URL (https://github.com/beanie00/self-distillation-analysis)

详情

展开后加载摘要…

URL PDF HTML 收藏