Reliability-Aware LLM Alignment from Inconsistent Human Feedback
从不一致的人类反馈中实现可靠性感知的大语言模型对齐
专题命中 后训练与偏好优化 :LLM(title,abstract);RLHF(abstract,abstract_cn);large language model(abstract);language model(abstract)
AI总结 研究如何解决人类反馈强化学习中人类注释不一致问题,提出可靠性引导的偏好优化框架RGPO,通过估计注释者可靠性、推断潜在真实标签及动态调整训练目标,有效减少训练数据不一致性和噪声,性能优于现有基线。