Perturbation Probing: A Two-Pass-per-Prompt Diagnostic for FFN Behavioral Circuits in Aligned LLMs
扰动探测:对齐语言模型中FFN行为电路的双次提示诊断
机构 * Palo Alto Networks(帕洛阿尔托网络公司)
专题命中 知识编辑与模型理解 :RLHF(summary_cn,abstract);LLM(summary_cn,abstract);large language model(abstract);language model(abstract)
AI总结 通过双次提示传递和无反向传播的扰动探测,识别LLM中两种行为电路结构,揭示RLHF组织的行为机制及模板层编辑工具。