Breaking the Mirror: Activation-Based Mitigation of Self-Preference in LLM Evaluators
打破镜像:基于激活的LLM评估者自我偏好缓解方法
机构 * University of Virginia(弗吉尼亚大学) ; University of California, San Diego(加州大学圣地亚哥分校) ; Carnegie Mellon University(卡内基梅隆大学) ; School of Computer Science(计算机科学学院)
AI总结 针对LLM评估者自我偏好偏见,提出轻量级引导向量方法,在推理时无需重训练即可将不公正自我偏好降低97%,但存在稳定性问题。
Comments Presented at {Mechanistic Interpretability, Evaluations, Reliable-ML} Workshops, NeurIPS 2025