Explainable LLM Unlearning Through Reasoning
通过推理实现可解释的LLM反学习
专题命中 隐私与版权 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出基于推理的反学习方法TRU,通过引入推理引导的反学习目标,实现更可靠且可解释的LLM反学习,同时保持模型通用能力。
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
通过推理实现可解释的LLM反学习
专题命中 隐私与版权 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出基于推理的反学习方法TRU,通过引入推理引导的反学习目标,实现更可靠且可解释的LLM反学习,同时保持模型通用能力。