Mitigating Content Effects on Reasoning in Language Models through Fine-Grained Activation Steering
通过细粒度激活引导缓解语言模型中的内容影响
专题命中 代码与定理证明 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 本文通过激活引导技术缓解语言模型的推理偏见,发现对比引导方法能有效减少内容偏见,提升形式推理准确性,且在不同任务中具有鲁棒性。
Comments AAAI 2026