Critical-CoT: A Robust Defense Framework against Reasoning-Level Backdoor Attacks in Large Language Models
Critical-CoT: 一种针对大语言模型推理层后门攻击的稳健防御框架
机构 * INRS, University of Quebec(INRS大学魁北克分校)
专题命中 其他推理 :CoT(title,title_cn);reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI
AI总结 本文提出Critical-CoT,通过双阶段微调提升大语言模型的批判性思维,使其能自动识别潜在后门并拒绝生成恶意推理步骤,有效防御推理层后门攻击。