Inference-Time Mitigation of Adversarial Political Bias in Large Language Models
大语言模型推理时的对抗性政治偏见缓解
专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);RLHF(abstract,abstract_cn);LLM(abstract)
AI总结 针对大语言模型的对抗性政治偏见漏洞,提出思维链提示与直接偏好优化等策略,其中递归自校正方法可显著提升模型的政治中立性表现。