Invisible Safety Threat: Malicious Finetuning for LLM via Steganography
不可见的安全威胁:通过隐写术对LLM进行恶意微调
机构 * National University of Singapore(新加坡国立大学)
专题命中 安全训练 :safety(title,abstract);alignment(abstract);trustworthy(abstract);分类 cs.LG
AI总结 本文揭示了LLM中隐藏的安全威胁,通过隐写术在看似无害的回复中嵌入恶意内容,展示了对GPT-4.1及多个开源模型的攻击效果,验证了该方法的广泛适用性。
Comments Accepted at ICLR 2026