arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 30405 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 3229 篇

2412.13862 2024-12-19 cs.LG cs.CL 86%

Energy-Based Preference Model Offers Better Offline Alignment than the Bradley-Terry Preference Model

Yuzhong Hong, Hanshan Zhang, Junwei Bao, Hongfei Jiang, Yang Song

专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract);DPO(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.19332 2024-11-06 cs.LG cs.AI 86%

Self-Exploring Language Models: Active Preference Elicitation for Online Alignment

Shenao Zhang, Donghan Yu, Hiteshi Sharma, Han Zhong, Zhihan Liu, Ziyi Yang, Shuohang Wang, Hany Hassan, Zhaoran Wang

专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract);DPO(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.00832 2024-11-05 cs.CL cs.LG 86%

BoNBoN Alignment for Large Language Models and the Sweetness of Best-of-n Sampling

Lin Gui, Cristina Gârbacea, Victor Veitch

专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract);DPO(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.11715 2024-10-28 cs.LG cs.CL cs.SE 86%

Measuring memorization in RLHF for code completion

Aneesh Pappu, Billy Porter, Ilia Shumailov, Jamie Hayes

专题命中 偏好对齐 :RLHF(title,abstract);alignment(abstract);DPO(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.09362 2024-10-15 cs.LG cs.AI 86%

SeRA: Self-Reviewing and Alignment of Large Language Models using Implicit Reward Margins

Jongwoo Ko, Saket Dingliwal, Bhavana Ganesh, Sailik Sengupta, Sravan Bodapati, Aram Galstyan

专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract);DPO(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.00858 2024-09-06 cs.RO cs.AI cs.HC cs.LG 86%

Trustworthy Human-AI Collaboration: Reinforcement Learning with Human Feedback and Physics Knowledge for Safe Autonomous Driving

Zilin Huang, Zihao Sheng, Sikai Chen

专题命中 偏好对齐 :trustworthy(title,abstract);RLHF(abstract);safety(abstract);分类 cs.AI、cs.LG

Comments 33 pages, 20 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.11082 2024-06-04 cs.CL cs.AI 86%

Fundamental Limitations of Alignment in Large Language Models

Yotam Wolf, Noam Wies, Oshri Avnery, Yoav Levine, Amnon Shashua

专题命中 偏好对齐 :alignment(title,abstract);safety(abstract);AI safety(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.17931 2024-05-29 cs.CL cs.LG 86%

Online Merging Optimizers for Boosting Rewards and Mitigating Tax in Alignment

Keming Lu, Bowen Yu, Fei Huang, Yang Fan, Runji Lin, Chang Zhou

专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract);DPO(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.00486 2024-04-02 cs.CL cs.AI 86%

Dialectical Alignment: Resolving the Tension of 3H and Security Threats of LLMs

Shu Yang, Jiayuan Su, Han Jiang, Mengdi Li, Keyuan Cheng, Muhammad Asif Ali, Lijie Hu, Di Wang

专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract);DPO(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.08309 2024-03-15 cs.LG cs.AI 86%

HRLAIF: Improvements in Helpfulness and Harmlessness in Open-domain Reinforcement Learning From AI Feedback

Ang Li, Qiugen Xiao, Peng Cao, Jian Tang, Yi Yuan, Zijie Zhao, Xiaoyuan Chen, Liang Zhang, Xiangyang Li, Kaitong Yang, Weidong Guo, Yukang Gan, Xu Yu, Daniell Wang, Ying Shan

专题命中 偏好对齐 :harmlessness(title,abstract);RLHF(abstract);red teaming(abstract);分类 cs.AI、cs.LG

Comments 18 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.08635 2024-03-14 cs.LG cs.AI stat.ML 86%

Human Alignment of Large Language Models through Online Preference Optimisation

Daniele Calandriello, Daniel Guo, Remi Munos, Mark Rowland, Yunhao Tang, Bernardo Avila Pires, Pierre Harvey Richemond, Charline Le Lan, Michal Valko, Tianqi Liu, Rishabh Joshi, Zeyu Zheng, Bilal Piot

专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract);DPO(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.04792 2024-03-04 cs.AI cs.CL cs.HC 86%

Direct Language Model Alignment from Online AI Feedback

Shangmin Guo, Biao Zhang, Tianlin Liu, Tianqi Liu, Misha Khalman, Felipe Llinares, Alexandre Rame, Thomas Mesnard, Yao Zhao, Bilal Piot, Johan Ferret, Mathieu Blondel

专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract);DPO(abstract);分类 cs.CL、cs.AI

Comments 18 pages, 9 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.13136 2024-01-25 cs.CL cs.AI 86%

The Language Barrier: Dissecting Safety Challenges of LLMs in Multilingual Contexts

Lingfeng Shen, Weiting Tan, Sihao Chen, Yunmo Chen, Jingyu Zhang, Haoran Xu, Boyuan Zheng, Philipp Koehn, Daniel Khashabi

专题命中 偏好对齐 :safety(title,abstract);alignment(abstract);RLHF(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.12908 2023-11-23 cs.CV cs.AI cs.GR cs.LG 86%

Diffusion Model Alignment Using Direct Preference Optimization

Bram Wallace, Meihua Dang, Rafael Rafailov, Linqi Zhou, Aaron Lou, Senthil Purushwalkam, Stefano Ermon, Caiming Xiong, Shafiq Joty, Nikhil Naik

专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract);DPO(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.04350 2025-04-16 cs.CL 86%

TIS-DPO: Token-level Importance Sampling for Direct Preference Optimization With Estimated Weights

Aiwei Liu, Haoping Bai, Zhiyun Lu, Yanchao Sun, Xiang Kong, Simon Wang, Jiulong Shan, Albin Madappally Jose, Xiaojiang Liu, Lijie Wen, Philip S. Yu, Meng Cao

专题命中 偏好对齐 :DPO(title,abstract);alignment(abstract);harmlessness(abstract);分类 cs.CL

Comments Published in ICLR 2025, code in https://github.com/exlaw/TIS-DPO

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24937 2026-07-28 cs.AI cs.CL cs.IR cs.LG 版本更新 86%

The Hitchhiker's Guide to Agentic AI: From Foundations to Systems

《智能体AI的搭车指南:从基础到系统》

Haggai Roitman

机构 * Haggai Roitman

专题命中 偏好对齐 :RLHF(abstract,abstract_cn);DPO(abstract,abstract_cn);alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文为构建自主AI系统提供全面实践参考,覆盖从Transformer架构、训练优化到对齐、推理、检索增强生成、记忆系统、智能体设计模式及多智能体协调的完整技术栈。

Comments version 1.3

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11712 2026-06-11 cs.CL cs.AI cs.LG 新提交 86%

Substrate Asymmetry in User-Side Memory: A Diagnostic Framework

用户侧记忆中的子模块不对称性:一个诊断框架

Youwang Deng

机构 * EpistemicaLab — Independent Research(EpistemicaLab — 独立研究)

专题命中 偏好对齐 :RLHF(summary_cn,abstract);alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出一个诊断框架,将LLM用户侧记忆分解为行为一致性、事实存在和事实缺失三个正交子模块,发现参数记忆与检索记忆在不同子模块上存在不对称性,且RLHF调优加剧了这种不对称性。

Comments Preprint. Code: https://github.com/EpistemicaLab/substrate-asymmetry-memory

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21183 2026-05-11 cs.LG cs.AI cs.CL 86%

MaPPO: Maximum a Posteriori Preference Optimization with Prior Knowledge

MaPPO:结合先验知识的最大后验偏好优化

Guangchen Lan, Sipeng Zhang, Tianle Wang, Yuwei Zhang, Daoan Zhang, Xinpeng Wei, Xiaoman Pan, Hongming Zhang, Dong-Jun Han, Christopher G. Brinton

机构 * Purdue University(普渡大学) University of California, San Diego(加州大学圣地亚哥分校) Amazon(亚马逊) Meta, FAIR Yonsei University(延世大学)

专题命中 偏好对齐 :DPO(summary_cn,abstract);alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 MaPPO通过整合先验奖励知识优化偏好学习,提升对齐性能,无需额外超参数,适用于离线和在线设置,支持DPO变体插件,实验显示在多个基准上效果显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.15334 2025-06-09 cs.CV 86%

Modality-Fair Preference Optimization for Trustworthy MLLM Alignment

Songtao Jiang, Yan Zhang, Ruizhe Chen, Tianxiang Hu, Yeying Jin, Qinglin He, Yang Feng, Jian Wu, Zuozhu Liu

机构 * Zhejiang University(浙江大学) ByteDance(字节跳动) National University of Singapore(新加坡国立大学) Angelalign Inc., China(中国Angelalign公司)

专题命中 偏好对齐 :alignment(title,abstract);trustworthy(title)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13069 2026-08-14 cs.AI 新提交 85%

Behavioral Reprogramming of Open-Weights Models: Cognitive Plasticity and Alignment Bounds

开放权重模型的行为重编程:认知可塑性与对齐边界

Lucia Malíčková

机构 * National Supercomputing Centre, Slovakia(斯洛伐克国家超级计算中心)

专题命中 偏好对齐 :alignment(title,abstract);DPO(abstract,abstract_cn);分类 cs.AI

AI总结 该研究通过大规模并行超参数搜索等方法,对开放权重LLMs进行行为重编程,实现了主动苏格拉底式对话框架,明确了PEFT的边界等关键结论,为跨语言行为修改提供了实证框架。

Comments Preprint submitted to arXiv, August 12, 2026. 13 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25077 2026-08-05 cs.AI 版本更新 85%

Evaluating Risks in Weak-to-Strong Alignment: A Bias-Variance Perspective

在弱到强对齐中评估风险:从偏差-方差视角出发

Hamid Osooli, Kareema Batool, Rick Gentry, Tiasa Singha Roy, Ashwin Gupta, Anirudha Ramesh

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Microsoft(微软) InstaDeep New York University(纽约大学)

专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract,abstract_cn);分类 cs.AI

AI总结 本文从偏差-方差视角分析弱到强对齐的风险,通过连续置信度分数研究经验组件,发现强模型方差是欺骗的主要预测因素,表明弱强依赖性的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13430 2026-07-16 cs.CL 新提交 85%

Exploring Post-Training Alignment of Small Language Models for Biomedical Data-to-Text Generation: A Case Study of Medication Leaflet

探索用于生物医学数据到文本生成的小语言模型的训练后对齐:以药品说明书为例

Xi Yang, Guodong Liu, Chuqin Li, Fan Wu, Ergin Soysal, Min Jiang, Xing He, Jiang Bian, Yi Guo, Shams Zaman, Thomas Fuchs, Todd Sanger, Yonghui Wu

专题命中 偏好对齐 :alignment(title,abstract);DPO(abstract,abstract_cn);分类 cs.CL

AI总结 该研究对生物医学数据到文本生成任务训练小语言模型的方法进行比较分析,在药品说明书数据集上用基于Qwen的SLMs探索多种训练后方法,通过整理数据评估模型,结果显示对齐后的SLMs性能优异,GRPO跨数据集性能最稳健。

Comments 10 pages, 1 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15765 2026-07-07 cs.LG cs.GT stat.ML 版本更新 85%

Shapley-based Data Valuation for LLM Alignment via Sequential Preference Optimization

基于Shapley值的大语言模型对齐数据估值:通过顺序偏好优化

Mélissa Tamine, Otmane Sakhi, Benjamin Heymann, Maxime Vono, Patrick Loiseau

机构 * Criteo AI lab(Criteo AI实验室) FairPlay joint team(FairPlay联合团队) CREST ENSAE Institut Polytechnique de Paris(巴黎理工学院) Inria(法国国家科学与技术研究院)

专题命中 偏好对齐 :alignment(title,abstract);DPO(abstract,abstract_cn);分类 cs.LG

AI总结 研究大语言模型对齐中数据估值问题,针对基于Shapley值估值计算量大的挑战,提出顺序偏好优化方法,可高效近似Shapley值,计算真实偏好数据集的Shapley值并揭示各源对模型对齐的作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27210 2026-06-26 cs.CL 新提交 85%

Paved with True Intents: Intent-Aware Training Improves LLM Safety Classification Across Training Regimes

以真实意图铺路:意图感知训练提升跨训练机制下的LLM安全分类

Jeremias Ferrao, Niclas Müller-Hof, Iustin Sîrbu, Traian Rebedea, Yftah Ziser

机构 * University of Groningen(格罗宁根大学) University Politehnica of Bucharest(布加勒斯特理工大学) NVIDIA(英伟达)

专题命中 偏好对齐 :safety(title,abstract);DPO(abstract,abstract_cn);分类 cs.CL

AI总结 提出意图感知训练方法,通过显式建模用户意图信号提升安全分类器鲁棒性,在多个训练机制下取得最优平均性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19527 2026-06-19 cs.AI 新提交 85%

Emergent Alignment

涌现对齐

Martin Kolář

机构 * CIIRC, Czech Technical University in Prague(捷克理工大学CIIRC)

专题命中 偏好对齐 :alignment(title,abstract);DPO(abstract,abstract_cn);分类 cs.AI

AI总结 提出一种在线对齐技术,通过引入良心步骤和基于直接偏好优化的对齐损失,使大语言模型在训练、微调、对抗提示和零样本学习中自我纠正非伦理输出。

Comments Rejected from ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16276 2026-06-18 cs.AI 新提交 85%

SpecAlign: Efficient Specification-Grounded Alignment of Large Language Models via Synthetic Data

SpecAlign: 通过合成数据实现高效的大语言模型规范对齐

Wenjie Wang, Yue Huang, Zhengqing Yuan, Han Bao, Shiyi Du, Yuchen Ma, Yue Zhao, Yanfang Ye, Xiangliang Zhang

机构 * University of Notre Dame(圣母大学) Carnegie Mellon University(卡内基梅隆大学) LMU Munich(慕尼黑大学) University of Southern California(南加州大学)

专题命中 偏好对齐 :alignment(title,abstract);safety(abstract);分类 cs.AI

AI总结 提出规范对齐新范式,通过从规范文档合成数据(SpecAlign框架),结合结构化规则标注、可控规范实例化和多智能体对抗数据合成,生成细粒度偏好对,提升规则遵守度且不损害通用能力。

Comments 58 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26169 2026-06-03 cs.LG 85%

Alignment-Aware Decoding

对齐感知解码

Frédéric Berdoz, Luca A. Lanzendörfer, René Caky, Roger Wattenhofer

机构 * EPFL, Switzerland(瑞士联邦理工学院)

专题命中 偏好对齐 :alignment(title,abstract);DPO(abstract,abstract_cn);分类 cs.LG

AI总结 提出一种推理时增强模型对齐的方法——对齐感知解码(AAD),可解释为隐式奖励优化,无需额外训练,在多种基准和模型规模上优于强基线,并能生成合成数据改善数据受限场景下的对齐。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30888 2026-06-01 cs.CL 85%

The Flip Side of RLHF: On-Policy Feedback for Reward Model Self-Supervised Improvement

RLHF的另一面:用于奖励模型自监督改进的在线策略反馈

Xiaobo Wang, Tong Wu, Min Tang, Jiaqi Li, Qi Liu, Zilong Zheng

机构 * State Key Laboratory of Cognitive Intelligence, University of Science and Technology of China(认知智能国家重点实验室,中国科学技术大学) University of Science and Technology of China(中国科学技术大学) Institute of Artificial Intelligence, Hefei Comprehensive National Science Center(合肥综合性国家科学中心人工智能研究院) State Key Laboratory of General Artificial Intelligence, BIGAI(通用人工智能国家重点实验室,BIGAI)

专题命中 偏好对齐 :RLHF(title,title_cn);alignment(abstract);分类 cs.CL

AI总结 提出SAVE框架,利用价值函数生成在线策略反馈,通过对比学习更新奖励模型,在六个基准上超越现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20408 2026-05-21 cs.LG 85%

Spectral Souping: A Unified Framework for Online Preference Alignment

谱汤:一种在线偏好对齐的统一框架

Yinlam Chow, Guy Tennenholtz, Ted Yun, James Harrison, Arthur Gretton, Andre Barreto, Bo Dai

机构 * Google DeepMind(谷歌DeepMind) Google Research(谷歌研究)

专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract,abstract_cn);分类 cs.LG

AI总结 本文提出了一种统一的在线偏好对齐框架Spectral Souping,通过发现LLM中的通用谱表示,实现了高效的模型合并,从而在不需昂贵在线重训练的情况下快速适应个体用户偏好。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04909 2026-05-18 cs.LG 85%

Learning Where It Matters: Geometric Anchoring for Robust Preference Alignment

在关键领域学习:用于鲁棒偏好对齐的几何锚定

Youngjae Cho, Jongsuk Kim, Ji-Hoon Kim

机构 * PYLER KAIST(韩国科学技术院)

专题命中 偏好对齐 :alignment(title,abstract);DPO(abstract,abstract_cn);分类 cs.LG

AI总结 GAPO通过动态几何锚定机制改进偏好对齐,通过局部敏感度自适应调整偏好对重要性,减少噪声影响,提升模型鲁棒性。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏