arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-02-26 至 2026-02-26 共收录 6 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 6 篇

2602.21346 2026-02-26 cs.CL cs.AI 93%

Alignment-Weighted DPO: A principled reasoning approach to improve safety alignment

基于对齐的DPO:一种原则性的推理方法以提高安全性对齐

Mengxuan Hu, Vivek V. Datla, Anoop Kumar, Zihan Guan, Sheng Li, Alfy Samuel, Daben Liu

机构 * University of Virginia(弗吉尼亚大学) Capital One

专题命中 偏好对齐 :alignment(title,abstract);DPO(title,abstract);safety(title,abstract);RLHF(abstract)

AI总结 本文提出基于对齐的DPO方法,通过引入推理意识的后训练和对齐加权机制,提升大语言模型的安全性对齐鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21765 2026-02-26 cs.LG cs.AI stat.ML 84%

Generalisation of RLHF under Reward Shift and Clipped KL Regularisation

基于奖励偏移和截断KL正则化的RLHF泛化

Kenton Tang, Yuzhu Chen, Fengxiang He

机构 * University of Edinburgh(爱丁堡大学) University of Science and Technology of China(中国科学技术大学)

专题命中 偏好对齐 :RLHF(title,abstract);alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文提出基于奖励偏移和截断KL正则化的RLHF泛化理论,分析了奖励偏移和KL截断对泛化误差的影响,并给出了优化KL截断阈值和预算分配的实践指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20498 2026-02-26 cs.CL 83%

Robust Preference Alignment via Directional Neighborhood Consensus

通过方向邻域共识实现鲁棒偏好对齐

Ruochen Mao, Yuling Shi, Xiaodong Gu, Jiaheng Wei

专题命中 偏好对齐 :alignment(title,abstract);DPO(abstract);分类 cs.CL

AI总结 通过方向邻域共识实现鲁棒偏好对齐,提升模型在多样化偏好下的稳定性与可靠性。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21745 2026-02-26 cs.AI cs.CY 62%

The ASIR Courage Model: A Phase-Dynamic Framework for Truth Transitions in Human and AI Systems

ASIR勇气模型:人类和人工智能系统中真相过渡的相动态框架

Hyo Jin Kim

机构 * Jinple Studio(jinple工作室)

专题命中 偏好对齐 :alignment(abstract);分类 cs.AI、cs.CY

AI总结 ASIR勇气模型通过相动态框架,将真相披露视为状态转换过程,适用于人类和AI系统在压力下的行为分析与建模。

Comments 13 pages, 5 figures. Version 1. Includes recursive feedback extension and simulation results. Data available via DOI: 10.5281/zenodo.18754266

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07922 2026-02-26 cs.LG 57%

SERL: Self-Examining Reinforcement Learning on Open-Domain

SERL:面向开放域的自我审查强化学习

Weixuan Ou, Yanzhao Zheng, Shuoshuo Sun, Wei Zhang, Baohua Dong, Hangcheng Zhu, Ruohui Huang, Gang Yu, Pengwei Yan, Yifan Qiao

专题命中 偏好对齐 :RLHF(abstract);分类 cs.LG

AI总结 SERL通过自我审查机制提升开放域任务中的LLM性能,无需外部信号,实现演员与裁判的协同改进。

Comments Accepted by the 40th AAAI Conference on Artificial Intelligence (AAAI 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20800 2026-02-26 cs.IR 50%

Mitigating Preference Leakage via Strict Estimator Separation for Normative Generative Ranking

通过严格估计分离缓解偏好泄漏以规范生成排序

Dalia Nahhas, Xiaohao Cai, Imran Razzak, Shoaib Jameel

专题命中 偏好对齐 :alignment(abstract)

AI总结 本文提出通过严格分离监督与评估模型,缓解偏好泄漏问题,提升生成排序的可信度。

详情

展开后加载摘要…

URL PDF HTML 收藏