FSPO: Few-Shot Optimization of Synthetic Preferences Personalizes to Real Users
FSPO:少样本优化合成偏好以个性化真实用户
机构 * Stanford University(斯坦福大学) ; OpenAI ; Google DeepMind(谷歌DeepMind)
AI总结 FSPO通过少样本优化合成偏好实现LLM个性化,利用用户描述理性化提升奖励建模和指令遵循,生成100万合成偏好数据,在三个领域实现87%的Alpaca Eval胜率。
Comments Website: https://fewshot-preference-optimization.github.io/