Multi-Attribute Steering of Language Models via Targeted Intervention
通过目标干预对语言模型进行多属性引导
机构 * UNC Chapel Hill(北卡罗来纳大学教堂山分校)
专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 研究如何对语言模型进行多属性引导,提出MAT-Steer框架,通过对齐目标学习引导向量,减少属性间冲突,在问答和生成任务中评估,该框架优于现有方法。
Comments ACL 2025 camera-ready, code link: https://github.com/duykhuongnguyen/MAT-Steer