Follow the Norm: Accounting for Fine-Tuning and Prompt Effects on Model Rationales
遵循规范:考量微调与提示对模型理由的影响
专题命中 提示注入 :alignment(abstract);safety(abstract);分类 cs.AI、cs.CY
AI总结 该研究将AI视为代理主体,通过对LLaMA-3.2-11B等三个模型开展实验,发现违反规范的微调会改变模型的理由风格,而系统提示可覆盖该行为,支持对齐的分布式观点,为可争议监督提供了相关依据。
Comments Extended version with appendix; final version to appear in the Proceedings of AAAI/ACM AIES 2026