Model Editing as a Double-Edged Sword: Steering Agent Ethical Behavior Toward Beneficence or Harm
专题命中 知识编辑与模型理解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL
Comments AAAI 2026 Oral. 14 pages (including appendix), 11 figures. Code, data, results, and additional resources are available at: https://model-editing.github.io