AAPA: Adversarially Anchored Preference Alignment for Post-Training of Large Language Models
AAPA:用于大型语言模型后训练的对抗锚定偏好对齐
机构 * Southwest University of Finance and Economics(西南财经大学)
专题命中 后训练与偏好优化 :SFT(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);post-training(title,abstract)
AI总结 提出AAPA框架,通过固定轻量判别器对策略输出与专家响应进行句子级对抗锚定,增强SFT、GRPO等后训练目标,在指令遵循基准上持续提升性能。