arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-07-09 至 2026-07-09 共收录 1 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 1 篇

2511.01043 2026-07-09 cs.SE 版本更新 90%

DPO-F+: Aligning Code Repair Feedback with Developers' Preferences

DPO-F+:使代码修复反馈与开发者偏好对齐

Zihan Fang, Yifan Zhang, Yueke Zhang, Kevin Leach, Yu Huang

专题命中 偏好对齐 :DPO(title,title_cn);alignment(abstract)

AI总结 研究针对大语言模型在代码修复中开发者难解读输出的问题,提出DPO-f+框架,通过定义指标、构建数据集、微调模型及评估反馈质量,提升反馈准确性与对齐度,增强了代码理解和人机协作。

Comments 10 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏