arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 3229 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 3229 篇

2512.20806 2026-06-02 cs.AI 88%

Safety Alignment of LMs via Non-cooperative Games

通过非合作博弈实现语言模型的安全对齐

Anselm Paulus, Ilia Kulikov, Brandon Amos, Rémi Munos, Ivan Evtimov, Kamalika Chaudhuri, Arman Zharmagambetov

机构 * DeepMind, London, UK(深度Mind,伦敦,英国)

专题命中 偏好对齐 :alignment(title,abstract);safety(title,abstract);分类 cs.AI

AI总结 提出将安全对齐建模为攻击者与防御者语言模型之间的非零和博弈,通过在线强化学习联合训练,迭代提升安全性与实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09330 2026-06-02 cs.LG 88%

Safety Game: Inference-Time Alignment of Black-Box LLMs via Constrained Optimization

安全博弈:通过约束优化实现黑盒大语言模型的推理时对齐

Tuan Nguyen, Long Tran-Thanh

机构 * University of Southampton(南安普顿大学)

专题命中 偏好对齐 :alignment(title,abstract);safety(title,abstract);分类 cs.LG

AI总结 提出一种无需重新训练或访问模型内部结构的黑盒安全对齐框架,通过将安全与帮助性的权衡建模为二人零和博弈,并在推理时使用线性规划求解均衡策略,实现了黑盒LLM的安全对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30487 2026-06-01 cs.CL 88%

Configurable Reward Model for Balanced Safety Alignment

可配置奖励模型用于平衡安全对齐

Zhengping Jiang, Mehran Khodabandeh, Akash Bharadwaj, Manik Bhandari, Mayur Srungarapu, Anqi Liu, Benjamin Van Durme, Li Chen

机构 * Johns Hopkins University(约翰霍普金斯大学) Meta Superintelligence Labs(Meta超智能实验室)

专题命中 偏好对齐 :alignment(title,abstract);safety(title,abstract);分类 cs.CL

AI总结 提出可配置安全奖励模型(CSRM),通过配置目标数据增强和联合优化,实现对细粒度安全配置和对话细微差别的敏感性,在可配置安全基准上达到最优性能,并改善有用性与安全性的权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18061 2026-05-12 cs.AI cs.HC 88%

Expert Evaluation and the Limits of Human Feedback in Mental Health AI Safety Testing

专家评估与心理健康AI安全测试中人类反馈的局限性

Kiana Jafari, Paul Ulrich Nikolaus Rust, Duncan Eddy, Robbie Fraser, Nina Vasan, Darja Djordjevic, Akanksha Dadlani, Max Lamparth, Eugenia Kim, Mykel Kochenderfer

机构 * Stanford University(斯坦福大学) University College London(伦敦大学学院) Microsoft(微软)

专题命中 偏好对齐 :safety(title,abstract);AI safety(title);alignment(abstract);分类 cs.AI

AI总结 本研究探讨了在心理健康AI安全测试中,专家评估与人类反馈的有效性,发现专家间一致性差,揭示了专家分歧是社会技术现象,建议转向保留专家分歧的对齐方法。

Comments 17 pages, 7 pages of appendix, 21 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17210 2026-04-21 cs.LG 88%

Guardrails in Logit Space: Safety Token Regularization for LLM Alignment

对数空间中的Guardrails:用于LLM对齐的安全令牌正则化

Thong Bach, Truyen Tran

机构 * Applied Artificial Intelligence Initiative (A2I2)(应用人工智能倡议(A2I2)) Deakin University(德克萨斯大学)

专题命中 偏好对齐 :alignment(title,abstract);safety(title,abstract);分类 cs.LG

AI总结 本文提出安全令牌正则化(STR)方法,通过约束关键令牌的logits来保持细调模型的安全性,实验显示其在安全性和任务性能方面表现优异。

Comments 10 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13867 2026-02-17 cs.CL 88%

Bridging the Multilingual Safety Divide: Efficient, Culturally-Aware Alignment for Global South Languages

弥合多语言安全鸿沟:为全球南方语言实现高效、文化感知的对齐

Somnath Banerjee, Rima Hazra, Animesh Mukherjee

专题命中 偏好对齐 :alignment(title,abstract);safety(title,abstract);分类 cs.CL

AI总结 本文提出为全球南方低资源语言提供高效、文化感知的安全对齐方法,以解决现有安全机制在多语言环境中的失效问题。

Comments Accepted to the EGSAI Workshop at AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12158 2026-02-13 cs.LG 88%

SafeNeuron: Neuron-Level Safety Alignment for Large Language Models

SafeNeuron: 大语言模型的神经层面安全对齐

Zhaoxin Wang, Jiaming Liang, Fengbin Zhu, Weixiang Zhao, Junfeng Fang, Jiayi Ji, Handing Wang, Tat-Seng Chua

机构 * Xidian University, Xi'an, China(西安电子科技大学) Harbin Institute of Technology, Harbin, China(哈尔滨工业大学) National University of Singapore,Singapore(新加坡国立大学)

专题命中 偏好对齐 :alignment(title,abstract);safety(title,abstract);分类 cs.LG

AI总结 SafeNeuron通过神经层面安全对齐框架提升模型鲁棒性,减少攻击风险并保持通用能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11838 2025-12-16 cs.LG 88%

D-STEER - Preference Alignment Techniques Learn to Behave, not to Believe -- Beneath the Surface, DPO as Steering Vector Perturbation in Activation Space

D-STEER - 通过偏好对齐技术学习行为而非信念 -- 在表象之下,DPO作为激活空间中的低秩引导机制

Samarth Raina, Saksham Aggarwal, Aman Chadha, Vinija Jain, Amitava Das

机构 * IIIT Delhi(印度理工学院德里分校) Microsoft(微软) Apple (USA)(苹果(美国)) Google (USA)(谷歌(美国)) Pragya Lab, BITS Pilani, K. K. Birla Goa Campus(普拉吉亚实验室,比斯科大学,K.K. 布尔拉果阿校区)

专题命中 偏好对齐 :alignment(title,abstract);DPO(title,abstract);分类 cs.LG

AI总结 D-STEER研究揭示DPO通过引导激活空间中的低秩机制实现行为对齐,而非改变模型内部信念。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.02725 2025-10-08 cs.CL 88%

SAFER: Advancing Safety Alignment via Efficient Ex-Ante Reasoning

Kehua Feng, Keyan Ding, Yuhao Wang, Menghan Li, Fanjunduo Wei, Xinda Wang, Qiang Zhang, Huajun Chen

机构 * College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) ZJU-Hangzhou Global Scientific and Technological Innovation Center, Zhejiang University(浙江大学Hangzhou全球科技创新中心) Polytechnic Institute, Zhejiang University(浙江大学 polytechnic 院) School of Software Technology, Zhejiang University(浙江大学软件技术学院) ZJU-UIUC Institute, Zhejiang University(浙江大学UIUC研究院)

专题命中 偏好对齐 :alignment(title,abstract);safety(title,abstract);分类 cs.CL

Comments 22 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05289 2025-08-08 cs.LG 88%

RLHF Fine-Tuning of LLMs for Alignment with Implicit User Feedback in Conversational Recommenders

Zhongheng Yang, Aijia Sun, Yushang Zhao, Yinuo Yang, Dannier Li, Chengrui Zhou

专题命中 偏好对齐 :alignment(title,abstract);RLHF(title,abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.18053 2025-06-06 cs.CL cs.CV 88%

DREAM: Disentangling Risks to Enhance Safety Alignment in Multimodal Large Language Models

Jianyu Liu, Hangyu Guo, Ranjie Duan, Xingyuan Bu, Yancheng He, Shilong Li, Hui Huang, Jiaheng Liu, Yucheng Wang, Chenchen Jing, Xingwei Qu, Xiao Zhang, Yingshui Tan, Yanan Wu, Jihao Gu, Yangguang Li, Jianke Zhu

机构 * Alibaba Group(阿里巴巴集团) Zhejiang University(浙江大学) M-A-P The Chinese University of Hong Kong(香港中文大学)

专题命中 偏好对齐 :alignment(title,abstract);safety(title,abstract);分类 cs.CL

Comments [NAACL 2025] The first four authors contribute equally, 23 pages, repo at https://github.com/Kizna1ver/DREAM

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23634 2025-05-30 cs.LG cs.CR 88%

MCP Safety Training: Learning to Refuse Falsely Benign MCP Exploits using Improved Preference Alignment

John Halloran

机构 * Leidos(莱迪斯公司)

专题命中 偏好对齐 :alignment(title,abstract);safety(title);DPO(abstract);分类 cs.LG

Comments 27 pages, 19 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.02846 2025-03-05 cs.CL 88%

Mask-DPO: Generalizable Fine-grained Factuality Alignment of LLMs

Yuzhe Gu, Wenwei Zhang, Chengqi Lyu, Dahua Lin, Kai Chen

专题命中 偏好对齐 :alignment(title,abstract);DPO(title,abstract);分类 cs.CL

Comments Accepted by ICLR 2025. Code is available at https://github.com/open-compass/ANAH

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.03512 2025-02-11 cs.AI 88%

YINYANG-ALIGN: Benchmarking Contradictory Objectives and Proposing Multi-Objective Optimization based DPO for Text-to-Image Alignment

Amitava Das, Yaswanth Narsupalli, Gurpreet Singh, Vinija Jain, Vasu Sharma, Suranjana Trivedy, Aman Chadha, Amit Sheth

专题命中 偏好对齐 :alignment(title,abstract);DPO(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.14723 2025-02-11 cs.CL 88%

Insights into Alignment: Evaluating DPO and its Variants Across Multiple Tasks

Amir Saeidi, Shivanshu Verma, Md Nayem Uddin, Chitta Baral

专题命中 偏好对齐 :alignment(title,abstract);DPO(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.01798 2024-11-05 cs.LG 88%

SALSA: Soup-based Alignment Learning for Stronger Adaptation in RLHF

Atoosa Chegini, Hamid Kazemi, Iman Mirzadeh, Dong Yin, Maxwell Horton, Moin Nabi, Mehrdad Farajtabar, Keivan Alizadeh

专题命中 偏好对齐 :alignment(title,abstract);RLHF(title,abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.04481 2024-10-10 cs.AI 88%

Optimizing Autonomous Driving for Safety: A Human-Centric Approach with LLM-Enhanced RLHF

Yuan Sun, Navid Salami Pargoo, Peter J. Jin, Jorge Ortiz

专题命中 偏好对齐 :RLHF(title,abstract);safety(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.07772 2024-09-13 cs.LG 88%

Alignment with Preference Optimization Is All You Need for LLM Safety

Reda Alami, Ali Khalifa Almansoori, Ahmed Alzubaidi, Mohamed El Amine Seddik, Mugariya Farooq, Hakim Hacid

专题命中 偏好对齐 :alignment(title,abstract);safety(title,abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07642 2026-08-11 cs.AI cs.LG cs.MA 新提交 88%

Contextual Value Alignment via Multilayer Combinatorial Fusion

基于多层组合融合的上下文价值对齐

Yuanhong Wu, Djallel Bouneffouf, D. Frank Hsu

专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract,abstract_cn);trustworthy(abstract);分类 cs.AI、cs.LG

AI总结 本研究提出MCF-CVA框架,通过多层组合融合及EAR算法,结合多道德智能体的认知多样性缓解冲突冗余,在标准指标上优于单智能体等基线,提升LLM的上下文价值对齐能力。

Comments 12 pages, 5 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01692 2026-07-13 cs.AI cs.LG 版本更新 88%

A Descriptive and Normative Theory of Human Beliefs in RLHF

基于人类反馈强化学习中的人类信念描述性与规范性理论

Sylee Dandekar, Shripad Deshmukh, Frank Chiu, W. Bradley Knox, Scott Niekum

机构 * College of Information and Computer Sciences University of Massachusetts Amherst(信息与计算机科学学院 马萨诸塞大学阿姆赫斯特分校) Department of Computer Science The University of Texas at Austin(计算机科学系 德州大学奥斯汀分校)

专题命中 偏好对齐 :RLHF(title,summary_cn);分类 cs.AI、cs.LG

AI总结 研究 RLHF 中人类信念作用,提出新偏好模型,通过人类和综合实验,证实人类对智能体能力信念影响偏好,指出减少信念与能力不匹配可提升 RLHF 并给出新实践方向。

Comments Published at TMLR

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24004 2026-06-24 cs.CL cs.AI 新提交 88%

Towards Spec Learning: Inference-Time Alignment from Preference Pairs

面向规范学习:从偏好对进行推理时对齐

Dhriti Krishnan, Tejas Goyal, Jaromir Savelka

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 偏好对齐 :DPO(summary_cn,abstract);alignment(title);分类 cs.CL、cs.AI

AI总结 提出规范学习框架,利用少量用户指令和偏好判断生成自然语言规范,在推理时引导LLM行为,无需参数更新,在密集偏好信号领域优于DPO,且规范可解释。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20482 2026-06-19 cs.CL cs.HC cs.LG 新提交 88%

Your Mouse and Eyes Secretly Leak Your Preference: LLM Alignment using Implicit Feedback from Users

你的鼠标和眼睛悄悄泄露你的偏好:利用用户隐式反馈进行LLM对齐

Haw-Shiuan Chang, Jeffrey Gomez, Mehul Patwari, Aryan Sajith, Hamed Zamani

机构 * University of Massachusetts, Amherst(马萨诸塞大学阿默斯特分校) York University(约克大学)

专题命中 偏好对齐 :DPO(summary_cn,abstract);alignment(title);分类 cs.CL、cs.LG

AI总结 针对显式反馈稀缺的问题,提出利用鼠标轨迹和眼动数据等隐式反馈训练奖励模型,将文本奖励模型准确率从55%提升至64%,并显著提高DPO对齐后响应质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09850 2026-06-10 cs.LG cs.CL 新提交 88%

Mechanistic Analysis of Alignment Algorithms in Language Models

语言模型中对齐算法的机制分析

Aarush Sinha, Ishan Garg, Veeraraju Elluru, Arth Singh, Kushal Garg

机构 * University of Copenhagen(哥本哈根大学) Independent(独立研究者) IIT Jodhpur(印度理工学院焦特布尔分校) NIT Agartala(印度国立理工学院阿加尔塔拉分校) Narris

专题命中 偏好对齐 :alignment(title,abstract);DPO(abstract,abstract_cn);safety(abstract);分类 cs.CL、cs.LG

AI总结 本文通过层间线性探针、稀疏自编码器和交叉编码器,系统分析了六种偏好优化方法在语言模型中的内部机制,发现不同目标函数导致不同的表示几何变换,并揭示了行为对齐与内部结构变化的不一致性。

Comments Work in Progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00977 2026-05-15 cs.LG cs.CL 88%

It Takes Two: Your GRPO Is Secretly DPO

两人即可:你的GRPO其实暗含DPO

Yihong Wu, Liheng Ma, Lei Ding, Muzhi Li, Xinyu Wang, Kejia Chen, Zhan Su, Zhanguang Zhang, Chenyang Huang, Yingxue Zhang, Mark Coates, Jian-Yun Nie

机构 * UdeM(蒙特利尔大学) McGill(麦吉尔大学) Mila(Mila人工智能研究院) UManitoba(曼尼托巴大学) CUHK(香港中文大学) ZJU(浙江大学) UAlberta(阿尔伯塔大学) Amii(阿米人工智能研究院) Huawei Noah’s Ark Lab(华为诺亚实验室)

专题命中 偏好对齐 :DPO(title,title_cn);分类 cs.CL、cs.LG

AI总结 本文提出2-GRPO,通过仅两个rollouts构建对比信号,理论分析显示其性能接近16-GRPO,训练效率提升显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08577 2026-05-12 cs.LG cs.AI 88%

Distributionally Robust Token Optimization in RLHF

强化学习中对抗性令牌优化

Yeping Jin, Jiaming Hu, Ioannis Ch. Paschalidis

机构 * Department of System Engineering(系统工程系) Boston University(波士顿大学) Department of Math & Statistics(数学与统计学系)

专题命中 偏好对齐 :RLHF(title,summary_cn);分类 cs.AI、cs.LG

AI总结 本文提出DRTO方法,结合RLHF与DRO,通过构建f-散度模糊集增强策略优化中的困难响应段,提升多步骤推理任务在分布变化下的一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06850 2026-05-11 cs.LG cs.AI 88%

How to Compress KV Cache in RL Post-Training? Shadow Mask Distillation for Memory-Efficient Alignment

如何在RL后训练中压缩KV缓存?基于影子遮罩的内存高效对齐

Rui Zhu, Weiheng Bai, Qiushi Wu, Yang Ren, Haixu Tang, Yuchu Liu

机构 * Yale University(耶鲁大学) University of Minnesota Twin Cities(明尼苏达大学双城分校) Indiana University Bloomington(印第安纳大学布卢明顿分校)

专题命中 偏好对齐 :alignment(title);RLHF(abstract,abstract_cn);DPO(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 本文提出影子遮罩蒸馏方法,用于缓解RL后训练中KV缓存内存瓶颈问题,通过减少采样时的上下文密度来降低偏置,提升样本效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09457 2026-04-17 cs.CL cs.LG 88%

Towards Bridging the Reward-Generation Gap in Direct Alignment Algorithms

朝着弥合直接对齐算法中的奖励生成差距而努力

Zeguan Xiao, Yun Chen, Guanhua Chen, Ke Tang

机构 * Shanghai University of Finance and Economics(上海财经大学) Beihang University(北航) Southern University of Science and Technology(南方科技大学)

专题命中 偏好对齐 :alignment(title,abstract);DPO(abstract,abstract_cn);RLHF(abstract);分类 cs.CL、cs.LG

AI总结 本文探讨了直接对齐算法中奖励生成差距的问题,提出Prefix-Oriented Equal-length Training方法,通过截断响应长度来提升对齐效果,实验显示在AlpacaEval 2上提升显著。

Comments Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.14904 2026-01-21 cs.CL cs.AI 88%

Efficient Switchable Safety Control in LLMs via Magic-Token-Guided Co-Training

通过魔法令牌引导的协同训练实现LLM中的高效可切换安全控制

Jianfeng Si, Lin Sun, Zhewen Tan, Xiangzheng Zhang

机构 * Qiyuan Tech, Beijing, China(北京奇元科技)

专题命中 偏好对齐 :safety(title,abstract);alignment(abstract);RLHF(abstract);DPO(abstract)

AI总结 本文提出通过魔法令牌引导的协同训练框架,实现LLM内容安全的高效可切换控制,提升安全性能并降低训练与部署成本。

Comments 15 pages,3 figures,5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.06147 2026-01-21 cs.AI cs.CL 88%

DeAL: Decoding-time Alignment for Large Language Models

DeAL:大型语言模型的解码时间对齐

James Y. Huang, Sailik Sengupta, Daniele Bonadiman, Yi-An Lai, Arshit Gupta, Nikolaos Pappas, Saab Mansour, Katrin Kirchhoff, Dan Roth

机构 * University of Southern California(南加州大学) Ω WS AI Labs(Ω WS AI实验室)

专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract);safety(abstract);harmlessness(abstract)

AI总结 DeAL通过允许用户自定义奖励函数和实现解码时间对齐,改进了大型语言模型对齐目标的实现。

Comments ACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17579 2025-11-25 cs.LG cs.AI 88%

Multi-Value Alignment for LLMs via Value Decorrelation and Extrapolation

通过价值去相关与外推实现大语言模型的多值对齐

Hefei Xu, Le Wu, Chen Cheng, Hao Liu

专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract);DPO(abstract);safety(abstract)

AI总结 本文提出多值对齐框架MVA,通过价值去相关与外推策略,有效解决多价值观对齐中的稳定性与冲突处理问题,实验表明其在多值对齐任务中表现优于现有方法。

Comments accepted by AAAI26 oral; 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏