APPA: Adaptive Preference Pluralistic Alignment for Fair Federated RLHF of LLMs
APPA:自适应偏好多元对齐用于大语言模型公平联邦强化学习从人类反馈
机构 * University of California, Irvine(加利福尼亚大学尔湾分校)
专题命中 偏好对齐 :alignment(title,abstract);RLHF(title);分类 cs.AI、cs.LG
AI总结 本文提出APPA框架,通过动态调整群体奖励权重,提升联邦强化学习中多群体公平对齐效果,实验显示其在保持整体对齐性的同时,显著提升最差群体对齐性能。