Inference-Time Mitigation of Adversarial Political Bias in Large Language Models
大语言模型推理时的对抗性政治偏见缓解
专题命中 偏好对齐 :RLHF(abstract,abstract_cn);DPO(abstract,abstract_cn);alignment(abstract);safety(abstract)
AI总结 针对大语言模型的对抗性政治偏见漏洞,提出思维链提示与直接偏好优化等策略,其中递归自校正方法可显著提升模型的政治中立性表现。