On the Limits of Steering Vectors for Preference-Aligned Generation
关于偏好对齐生成的引导向量限制研究
机构 * Department of Computer Science, Columbia University(哥伦比亚大学计算机科学系)
AI总结 研究引导向量在偏好对齐生成中的泛化限制,发现其有效性在不同特质、任务迁移和多特质组合中显著下降,表明其作为通用工具的局限性。
高校专区
关于偏好对齐生成的引导向量限制研究
机构 * Department of Computer Science, Columbia University(哥伦比亚大学计算机科学系)
AI总结 研究引导向量在偏好对齐生成中的泛化限制,发现其有效性在不同特质、任务迁移和多特质组合中显著下降,表明其作为通用工具的局限性。