Reward Shaping to Mitigate Reward Hacking in RLHF
奖励塑造以缓解强化学习从人类反馈中的奖励黑客
机构 * Fudan University(复旦大学)
专题命中 偏好对齐 :RLHF(title,summary_cn);alignment(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 PAR通过利用奖励模型中的潜在偏好信号,有效缓解RLHF中的奖励黑客问题,表现出更高的性能和数据效率。
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
奖励塑造以缓解强化学习从人类反馈中的奖励黑客
机构 * Fudan University(复旦大学)
专题命中 偏好对齐 :RLHF(title,summary_cn);alignment(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 PAR通过利用奖励模型中的潜在偏好信号,有效缓解RLHF中的奖励黑客问题,表现出更高的性能和数据效率。
SAGA:面向低资源北欧语言模型的分数加权自适应生成对齐
机构 * Linköping University(林雪平大学) ; University of Iceland(冰岛大学)
专题命中 偏好对齐 :alignment(title,abstract);DPO(abstract,abstract_cn);分类 cs.LG
AI总结 该研究提出SAGA框架,用依存句法分析器监督取代人类偏好标注,在丹麦语、冰岛语等低资源北欧语言上提升了GPT-SW3-1.3B的语法质量,为相关语言的语法对齐提供了实用替代方案。
Comments 18 pages, 7 figures
通过选择性上下文偏好优化学习何时信任
机构 * Duke University(杜克大学) ; National University of Singapore(新加坡国立大学) ; UC Berkeley(加州大学伯克利分校) ; UC Irvine(加州大学欧文分校) ; Northeastern University(东北大学) ; Nanyang Technological University(南洋理工大学)
专题命中 偏好对齐 :DPO(summary_cn,abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本研究针对语言模型易受误导性外部信号影响的问题,提出SCOPE方法,在含四种条件的MIST基准上优化DPO目标,降低SC2W的同时保持正常上下文下的准确率,主张以选择性信任评判模型。
Comments Project Page at https://worldbench.github.io/scope GitHub Repo at https://github.com/worldbench/SCOPE HF Dataset at https://huggingface.co/datasets/worldbench/MIST-Bench
面向胸部X射线报告生成的正例-无标签偏好优化
机构 * Columbia University(哥伦比亚大学) ; Stanford University(斯坦福大学) ; Emory University(埃默里大学)
专题命中 偏好对齐 :DPO(summary_cn,abstract);分类 cs.LG
AI总结 该研究针对放射报告生成VLM的遗漏噪声问题,提出PU-DPO框架,将未提及项视为无标签,通过对比对优化,提升病理检测率与隐藏正例恢复能力,增强对遗漏噪声的鲁棒性。
PolyAlign: 条件性人类分布对齐
机构 * NIT Silchar(印度国立理工学院锡尔恰尔分校) ; MBZUAI(穆罕默德·本·扎耶德人工智能大学)
专题命中 偏好对齐 :alignment(title,abstract);分类 cs.CL
AI总结 提出PolyAlign框架,通过桶感知SFT和人类分布偏好优化,实现语言模型在不同交互上下文中的条件性人类分布对齐,提升自然性和分布忠实度。
Comments 23 pages, 5 Figures, 13 Tables
MARS:面向奖励建模的边界与语义感知数据增强
机构 * University of Arizona(亚利桑那大学) ; Northeastern University London(伦敦东北大学)
专题命中 偏好对齐 :RLHF(abstract,abstract_cn);alignment(abstract);分类 cs.AI、cs.LG
AI总结 提出MARS框架,通过优先增强低边界偏好对并利用语义距离细化,提升奖励模型质量和对齐性能。
NormGuard: 流匹配强化学习中保持奖励的范数约束
机构 * The Hong Kong University of Science and Technology(香港科技大学) ; Kuaishou Technology(快手科技) ; University of Chinese Academy of Sciences(中国科学院大学)
专题命中 偏好对齐 :DPO(abstract,abstract_cn);alignment(abstract);分类 cs.LG
AI总结 针对流生成器强化学习后训练中感知质量下降的问题,提出NormGuard方法,通过铰链惩罚约束速度范数,在保持奖励的同时提升图像质量和真实性。
Comments v5: Fixed PDF rendering compatibility issue affecting Apple PDFKit (macOS Preview/iOS PDF viewer). No changes to technical content compared to v4
ASAT:结合人类反馈的自适应评分与阈值方法用于鲁棒分布外检测
机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校)
专题命中 偏好对齐 :safety(abstract);分类 cs.AI、cs.LG
AI总结 ASAT是结合人类反馈的人机协作框架,可实时更新评分函数与阈值,在静态条件下控制FPR并最大化TPR,非静态条件下适应分布漂移,在OpenOOD基准上性能优于现有方法。
Comments Published in TMLR (2026) with J2C Certification
Journal ref Transactions on Machine Learning Research (TMLR), 2026