Online Distributionally Robust LLM Alignment via Regression to Relative Reward
通过回归相对奖励实现在线分布鲁棒LLM对齐
机构 * Department of Statistics and Data Science(统计与数据科学系) ; Cornell University(康奈尔大学)
专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract,abstract_cn);DPO(abstract,abstract_cn);分类 cs.LG
AI总结 本文提出DRO-REBEL方法,通过类型-p Wasserstein、KL和χ²模糊集实现分布鲁棒优化,证明了在偏好转移下的参数误差界,并在多个基准测试中优于现有基线。
Comments 70 pages, 7 figures, 1 table