On the Generalization of Steering Vectors for Chain-of-Thought Faithfulness
论用于思维链忠实性的引导向量的泛化性
机构 * University of Virginia(弗吉尼亚大学) ; University of Delaware(特拉华大学) ; Poseidon Research(波塞冬研究院)
专题命中 幻觉与事实性 :safety(abstract);AI safety(abstract);分类 cs.AI
AI总结 该研究针对三个模型探究提升思维链忠实性的引导向量的泛化性,发现其效果主要由评估设置决定,且仅对最大型模型有效,引导可减少未被确认的提示使用。