arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-03-25 至 2026-03-25 共收录 4 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 4 篇

2603.22829 2026-03-25 cs.AI 90%

Improving Safety Alignment via Balanced Direct Preference Optimization

通过平衡直接偏好优化提升安全性对齐

Shiji Zhao, Mengyang Wang, Shukun Xiong, Fangzhou Chen, Qihui Zhu, Shouwei Ruan, Yisong Xiao, Ranjie Duan, Xun Chen, XingXing Wei

机构 * Institute of Artificial Intelligence, Beihang University, Beijing, China(北京航空航天大学人工智能研究院)

专题命中 偏好对齐 :alignment(title,abstract);safety(title,abstract);RLHF(abstract);DPO(abstract)

AI总结 本文提出B-DPO方法,通过平衡偏好与非偏好响应的优化强度,缓解偏好对齐中的过拟合问题,提升模型安全性同时保持竞争力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23184 2026-03-25 cs.CL cs.AI stat.AP 81%

ImplicitRM: Unbiased Reward Modeling from Implicit Preference Data for LLM alignment

ImplicitRM: 从隐式偏好数据中无偏奖励建模以实现语言模型对齐

Hao Wang, Haocheng Yang, Licheng Pan, Lei Shen, Xiaoxi Li, Yinuo Wang, Zhichao Chen, Yuan Lu, Haoxuan Li, Zhouchen Lin

机构 * Peking University(北京大学) Xiaohongshu Inc.(小红书公司) National University of Singapore(新加坡国立大学) Zhejiang University(浙江大学)

专题命中 偏好对齐 :alignment(title);RLHF(abstract);分类 cs.CL、cs.AI

AI总结 本文提出ImplicitRM,通过隐式反馈数据学习无偏奖励模型,解决隐式偏好数据中缺乏明确负样本和用户偏好偏差的问题,实验验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22944 2026-03-25 cs.HC 75%

From Morality Installation in LLMs to LLMs in Morality-as-a-System

从LLM中的道德安装到道德作为系统中的LLM

Gunter Bombaerts

专题命中 偏好对齐 :alignment(abstract);RLHF(abstract);safety(abstract)

AI总结 本文提出道德作为系统框架,重新定义道德行为的动态性与系统耦合问题,探讨道德属性在生命周期中的监测与跨组件一致性。

Comments 22pages, 1 figure, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22563 2026-03-25 stat.ML cs.LG 70%

Privacy-Preserving Reinforcement Learning from Human Feedback via Decoupled Reward Modeling

通过解耦奖励建模实现隐私保护的人类反馈强化学习

Young Hyun Cho, Will Wei Sun

机构 * Purdue University(普渡大学)

专题命中 偏好对齐 :alignment(abstract);RLHF(abstract);分类 cs.LG

AI总结 本文提出一种隐私保护框架,仅在奖励学习中施加差分隐私,通过私有奖励模型生成最终策略。理论分析显示隐私引入额外的误差项,且样本量和隐私水平影响主导项,实验验证了理论预测。

详情

展开后加载摘要…

URL PDF HTML 收藏