Differentiable Faithfulness Alignment for Cross-Model Circuit Transfer
可微的忠实对齐用于跨模型电路转移
机构 * University of Cambridge(剑桥大学) ; Kempner Institute, Harvard University(哈佛大学凯普勒研究所) ; University of Edinburgh(爱丁堡大学) ; Technion(技术学院)
专题命中 数学推理 :reasoning(abstract);分类 cs.CL
AI总结 本文提出DFA框架,通过学习可微对齐将小模型的电路信息转移到大模型,实验证明在事实检索、多选推理和算术任务中,DFA在Llama-3 1B→3B任务中表现优异,且在某些情况下恢复的电路忠实度不低于直接归因。
Comments 10 pages, 5 figures