arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 3229 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 3229 篇

2411.04127 2024-11-08 cs.AI 85%

Combining Theory of Mind and Kindness for Self-Supervised Human-AI Alignment

Joshua T. S. Hewson

专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract);safety(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.18853 2024-10-29 cs.LG 85%

Decoding-Time Language Model Alignment with Multiple Objectives

Ruizhe Shi, Yifang Chen, Yushi Hu, Alisa Liu, Hannaneh Hajishirzi, Noah A. Smith, Simon S. Du

专题命中 偏好对齐 :alignment(title,abstract);DPO(abstract);safety(abstract);分类 cs.LG

Comments NeurIPS accepted version

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.04834 2024-10-28 cs.CL 85%

As Simple as Fine-tuning: LLM Alignment via Bidirectional Negative Feedback Loss

Xin Mao, Feng-Lin Li, Huimin Xu, Wei Zhang, Wang Chen, Anh Tuan Luu

专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract);DPO(abstract);分类 cs.CL

Comments 20 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.09834 2024-09-02 cs.AI 85%

Minor DPO reject penalty to increase training robustness

Shiming Xie, Hong Chen, Fred Yu, Zeye Sun, Xiuyu Wu, Yingfan Hu

专题命中 偏好对齐 :DPO(title,abstract);alignment(abstract);RLHF(abstract);分类 cs.AI

Comments 8 pages, 19 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.11907 2024-08-16 cs.CL 85%

Direct Large Language Model Alignment Through Self-Rewarding Contrastive Prompt Distillation

Aiwei Liu, Haoping Bai, Zhiyun Lu, Xiang Kong, Simon Wang, Jiulong Shan, Meng Cao, Lijie Wen

专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract);DPO(abstract);分类 cs.CL

Comments 24 pages, 5 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.17092 2024-06-26 cs.CR cs.AI 85%

BEEAR: Embedding-based Adversarial Removal of Safety Backdoors in Instruction-tuned Language Models

Yi Zeng, Weiyu Sun, Tran Ngoc Huynh, Dawn Song, Bo Li, Ruoxi Jia

专题命中 偏好对齐 :safety(title,abstract);RLHF(abstract);AI safety(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.04879 2024-06-10 cs.CL 85%

A Deep Dive into the Trade-Offs of Parameter-Efficient Preference Alignment Techniques

Megh Thakkar, Quentin Fournier, Matthew D Riemer, Pin-Yu Chen, Amal Zouaq, Payel Das, Sarath Chandar

专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract);DPO(abstract);分类 cs.CL

Comments Accepted to ACL (Main) 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.06390 2024-04-16 cs.CL 85%

Latent Distance Guided Alignment Training for Large Language Models

Haotian Luo

专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract);DPO(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.03047 2023-12-05 cs.LG cs.AI cs.CL cs.CY 85%

Principle-Driven Self-Alignment of Language Models from Scratch with Minimal Human Supervision

Zhiqing Sun, Yikang Shen, Qinhong Zhou, Hongxin Zhang, Zhenfang Chen, David Cox, Yiming Yang, Chuang Gan

专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract);分类 cs.CL、cs.AI、cs.CY

Comments Accepted at NeurIPS 2023 (Spotlight). Project page: https://github.com/IBM/Dromedary

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.00819 2023-10-03 cs.CL 85%

Parameter-Efficient Tuning Helps Language Model Alignment

Tianci Xue, Ziqi Wang, Heng Ji

专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract);DPO(abstract);分类 cs.CL

Comments 21 pages, 11 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.18252 2025-04-29 cs.LG cs.AI cs.CL 85%

Asynchronous RLHF: Faster and More Efficient Off-Policy RL for Language Models

Michael Noukhovitch, Shengyi Huang, Sophie Xhonneux, Arian Hosseini, Rishabh Agarwal, Aaron Courville

机构 * Mila Quebec AI Institute(魁北克AI研究所) Université de Montréal(蒙特利尔大学) Allen Institute for AI(人工智能研究院) Google Deepmind(谷歌DeepMind) Canada CIFAR AI Chair(加拿大CIFAR人工智能主席)

专题命中 偏好对齐 :RLHF(title,abstract);DPO(abstract);分类 cs.CL、cs.AI、cs.LG

Comments accepted at ICLR 2025, code at https://github.com/mnoukhov/async_rlhf, integrated into the open-instruct library https://github.com/allenai/open-instruct

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.02144 2023-09-06 cs.CL cs.AI cs.LG 85%

Making Large Language Models Better Reasoners with Alignment

Peiyi Wang, Lei Li, Liang Chen, Feifan Song, Binghuai Lin, Yunbo Cao, Tianyu Liu, Zhifang Sui

专题命中 偏好对齐 :alignment(title,abstract);DPO(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Large Language Models; Reasoning; Alignment

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00042 2026-08-04 cs.CL cs.AI 新提交 85%

Trustworthiness Costs of Domain Adaptation in Small Language Models:A Cross-Architecture Empirical Study

小语言模型领域适应的可信性代价:一项跨架构实证研究

Ramesh B. Paramkusham

专题命中 偏好对齐 :DPO(abstract,abstract_cn);safety(abstract,abstract_cn);alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文通过对三类SLM架构、三个领域、两类训练数据及四种微调策略的216组实验,量化了领域适应的可信性代价,发现对抗扰动训练数据可提升适应质量且不降低可信性,部分安全策略反而增加对抗伤害易感性。

Comments 13 pages, 7 tables, 2 appendices (Reproducibility Checklist; Software and Data Availability). Code, model checkpoints, and datasets publicly available at https://github.com/rbpdlf/slm-trw

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17946 2026-07-21 cs.LG cs.AI 新提交 85%

A Geometric Perspective on Stabilizing Value Conflict Resolution

稳定价值冲突解决的几何视角

Saket Reddy, Andy Liu

机构 * University of Illinois - Urbana-Champaign(伊利诺伊大学厄巴纳 - 香槟分校) Carnegie Mellon University(卡内基梅隆大学)

专题命中 偏好对齐 :RLHF(summary_cn,abstract);alignment(abstract);分类 cs.AI、cs.LG

AI总结 研究大语言模型在RLHF训练中应对价值冲突的问题,核心方法是利用思维链推理,通过几何视角分析其作用,创建新的以价值冲突为重点的CoT设计,提升了道德推理性能,为改进模型处理复杂价值冲突请求的性能提供新途径。

Comments Accepted to ICML Workshop on High-Dimensional Learning Dynamics

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.04539 2026-07-20 cs.CL cs.AI 版本更新 85%

RLearner-LLM: Balancing Logical Grounding and Fluency in Large Language Models via Hybrid Direct Preference Optimization

RLearner-LLM: 通过混合直接偏好优化平衡大语言模型中的逻辑性与流畅性

Qiming Bao, Juho Leinonen, Paul Denny, Michael J. Witbrock

机构 * University of Auckland(奥克兰大学) Aalto University(阿alto大学)

专题命中 偏好对齐 :RLHF(abstract,abstract_cn);DPO(abstract,abstract_cn);alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文提出RLearner-LLM,通过融合DeBERTa-v3 NLI信号与验证器LLM评分,解决直接偏好优化在知识密集型生成中的逻辑对齐问题,实现NLI指标显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10569 2026-06-10 cs.CL cs.AI 新提交 85%

Hidden Consensus:Preference-Validity Compression in Human Feedback

隐藏共识:人类反馈中的偏好有效性压缩

Dorcas Chia Ern Chua, Karen Myn Hui Lee, Jia Yue Tan, Zhen Xue Gue, Norzalena Abdul Hamid, Azima Binti Azmi, Keat Mei Yeong, Aizat Izyani binti Mujab, Hafsah Noor Azam, Chee Guo Khoo, Han Ying Lim, Chee Seng Chan

机构 * YTL AI Labs Universiti Malaya(马来亚大学) Monash University Malaysia(莫纳什大学马来西亚校区) Universiti Malaysia Sarawak(马来西亚沙捞越大学)

专题命中 偏好对齐 :RLHF(summary_cn,abstract);alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文提出偏好有效性压缩问题,即RLHF将多元有效反馈压缩为单一奖励目标,导致对齐测量偏差。通过马来西亚语料分析,79%的提示存在多个多数支持响应,表明多数聚合测量的是argmax可接受性而非多元对齐。

Comments 28 pages. When AI learns from human feedback, it forces a single "correct" answer, but sometimes multiple answers are all genuinely valid, and that nuance gets thrown away

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06674 2026-06-08 cs.CL cs.CY 新提交 85%

What Do People Actually Want From AI? Mapping Preference Plurality

人们真正希望从AI中得到什么?偏好多元性映射

Julia Sepúlveda Coelho, Scott A. Hale

机构 * Oxford Internet Institute, University of Oxford(牛津大学互联网研究所) Meedan

专题命中 偏好对齐 :RLHF(summary_cn,abstract);alignment(abstract);分类 cs.CL、cs.CY

AI总结 通过分析75个国家1500份开放式回答,发现不同人对AI的期望各异,多数价值观仅被少数人要求,且同一词语(如“真实性”)含义分歧,某些能力存在争议,揭示当前RLHF偏好聚合方法的根本缺陷。

Comments Accepted at the 2026 ACM Conference on Fairness, Accountability, and Transparency (FAccT '26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09084 2026-05-26 cs.LG cs.AI 85%

PageLLM: A Multi-Grained Reward Framework for Whole-Page Optimization with Large Language Models

PageLLM:面向整页优化的大语言模型多粒度奖励框架

Xinyuan Wang, Liang Wu, Dongjie Wang, Yanjie Fu

机构 * Arizona State University(亚利桑那州立大学) Nokia(诺基亚) University of Kansas(堪萨斯大学)

专题命中 偏好对齐 :RLHF(summary_cn,abstract);alignment(abstract);分类 cs.AI、cs.LG

AI总结 针对整页优化中人工标注成本高和页面级连贯性与项目级放置粒度不匹配的问题,提出PageLLM框架,通过将隐式反馈解耦为粗粒度页面级奖励和细粒度项目级奖励,结合PPO的RLHF进行微调,显著提升排序性能并在线上部署中取得收益。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13878 2026-05-26 cs.LG cs.CL 85%

InfiFPO: Implicit Model Fusion via Preference Optimization in Large Language Models

InfiFPO:通过偏好优化实现大型语言模型的隐式模型融合

Yanggan Gu, Yuanyi Wang, Zhaoyi Yan, Yiming Zhang, Qi Zhou, Fei Wu, Hongxia Yang

机构 * The Hong Kong Polytechnic University (PolyU)(香港理工大学) Zhejiang University(浙江大学) PolyU-Daya Bay Technology and Innovation Research Institute(香港理工大学-大亚湾技术与创新研究院)

专题命中 偏好对齐 :DPO(summary_cn,abstract);alignment(abstract);分类 cs.CL、cs.LG

AI总结 提出InfiFPO方法,通过将DPO中的参考模型替换为融合源模型,在序列级别合成多源概率,实现隐式模型融合,从而在偏好对齐阶段有效融合多个LLM并提升性能。

Journal ref NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05660 2026-05-22 cs.CR cs.AI cs.CL 85%

Optimus: A Robust Defense Framework for Mitigating Toxicity while Fine-Tuning Conversational AI

Optimus: 一种用于在微调对话AI时缓解毒性行为的稳健防御框架

Aravind Cheruvu, Shravya Kanchi, Sifat Muhammad Abdullah, Nicholas Ka-Shing Kong, Daphne Yao, Murtuza Jadliwala, Bimal Viswanath

机构 * University of Texas at San Antonio(德克萨斯大学圣安东尼奥分校)

专题命中 偏好对齐 :DPO(abstract,abstract_cn);alignment(abstract);safety(abstract);jailbreak(abstract)

AI总结 本研究提出Optimus框架,通过整合训练无关的毒性分类方案和双重策略对齐过程,有效缓解微调过程中的毒性问题,并在有毒性分类器偏差时仍能保持高召回率,优于现有最佳防御方法StarDSS。

Comments Accepted at ACM CODASPY 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27401 2026-05-01 cs.CL cs.LG 85%

Perturbation Probing: A Two-Pass-per-Prompt Diagnostic for FFN Behavioral Circuits in Aligned LLMs

扰动探测:对齐语言模型中FFN行为电路的双次提示诊断

Hongliang Liu, Tung-Ling Li, Yuhao Wu

机构 * Palo Alto Networks(帕洛阿尔托网络公司)

专题命中 偏好对齐 :RLHF(summary_cn,abstract);safety(abstract);分类 cs.CL、cs.LG

AI总结 通过双次提示传递和无反向传播的扰动探测,识别LLM中两种行为电路结构,揭示RLHF组织的行为机制及模板层编辑工具。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11079 2026-04-28 cs.LG cs.AI 85%

Probe-Based Data Attribution: Discovering and Mitigating Undesirable Behaviors in LLM Post-Training

基于探针的数据归因:发现并缓解LLM微调后的不良行为

Frank Xiao, Santiago Aranguri

机构 * California Institute of Technology(加利福尼亚理工学院)

专题命中 偏好对齐 :DPO(summary_cn,abstract);safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出基于探针的数据归因方法,通过分析测试提示和偏好对的激活差异向量,识别导致特定行为的数据点,并通过重新训练验证归因。该方法在OLMo 2的生产DPO训练中发现有害行为,过滤数据点可显著减少此类行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15780 2026-04-20 cs.LG cs.CL 85%

Pruning Unsafe Tickets: A Resource-Efficient Framework for Safer and More Robust LLMs

裁剪不安全的票据:一种资源高效的更安全且更稳健的大语言模型框架

Wai Man Si, Mingjie Li, Michael Backes, Yang Zhang

机构 * CISPA Helmholtz Center for Information Security(CISPA海德堡信息安全中心)

专题命中 偏好对齐 :RLHF(abstract,abstract_cn);alignment(abstract);safety(abstract);jailbreak(abstract)

AI总结 本文提出一种资源高效的剪枝框架,通过识别并移除与不安全行为相关的参数,减少不安全生成并提高对抗鲁棒性,同时保持模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14177 2026-04-17 cs.CL cs.AI 85%

Listen, Correct, and Feed Back: Spoken Pedagogical Feedback Generation

倾听、纠正与反馈:口语教学反馈生成

Junhong Liang, Yifan Lu, Ekaterina Kochmar, Fajri Koto

机构 * Mohamed bin Zayed University of Artificial Intelligence(莫扎德·本·扎耶德人工智能大学)

专题命中 偏好对齐 :DPO(summary_cn,abstract);alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文提出SPFG数据集,基于Speak & Improve 2025语料,结合流畅性转录与GEC目标及人工验证的教师风格反馈,评估三种LLM在生成纠错与反馈中的表现,发现SFT效果最佳,DPO/KTO效果不一致,纠错与反馈质量弱相关。

Comments NLP8506 course project

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02617 2026-08-05 cs.CL cs.AI cs.LG 新提交 85%

Preferred, Not Safer: Pairwise Preference Is a Poor Proxy for Clinical Safety

偏好而非安全:成对偏好并非临床安全的可靠替代指标

Fay Elhassan, David Sasu, Alexandra Kulinkina, Lars Henning Klein, Mary-Anne Hartley

机构 * EPFL(洛桑联邦理工学院) LiGHT Laboratory(LiGHT实验室)

专题命中 偏好对齐 :safety(title,abstract);harmlessness(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究表明临床医生成对偏好并非LLM临床安全的可靠替代指标,其排名靠前的模型仍存在大量临床安全失败,提出结合偏好与安全反馈的临床调整排名方法,支持分离偏好与安全的评估实践。

Comments 27 pages,10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26787 2026-06-26 cs.LG cs.AI cs.CL 新提交 85%

AIGP: An LLM-Based Framework for Long-Term Value Alignment in E-Commerce Pricing

AIGP:基于LLM的电商定价长期价值对齐框架

Chennan Ma, Yanning Zhang, Siqi Hong, Xiuchong Wang, Fei Xiao, Keping Yang

机构 * Taobao & Tmall Group of Alibaba(阿里巴巴淘宝天猫集团)

专题命中 偏好对齐 :alignment(title);DPO(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 提出AIGP框架,利用大语言模型结合领域知识与结构化数据,通过离线强化学习训练的长期价值评估器进行偏好优化,实现可解释的定价决策,在淘宝工厂的在线实验中GMV提升13.21%。

Comments Accepted by KDD 2026 Applied Data Science Track (Oral presentation)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01060 2026-06-09 cs.CL cs.AI cs.LG 版本更新 85%

MENTIS: What Belief Changes Under Alignment? Measuring Multi-Scale Latent Torsion in Language Models

MENTIS: 对齐改变了什么信念?语言模型中多尺度潜在扭转的测量

Partha Pratim Saha, Samarth Raina, Mayur Parvatikar, Amit Dhanda, Vinija Jain, Aman Chadha, Amitava Das

机构 * Pragya Lab, BITS Pilani Goa, India(BITS Pilani 去掉 Goa 的机构名,因为该机构名中包含 'Goa',但根据规则,如果机构已有常见中文名,使用常见中文名。'Pragya Lab, BITS Pilani' 是 BITS Pilani 的一个实验室,因此翻译为 'BITS Pilani 实验室') IIIT Delhi, India(德里印度理工学院) Amazon, USA(美国亚马逊) Meta, USA(美国Meta) Apple, USA(美国苹果)

专题命中 偏好对齐 :alignment(title,abstract);prompt injection(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出MENTIS框架,通过层间协方差扭转范数、谱扭转诊断和能量-辐射-激活度量,测量偏好对齐在语言模型内部计算中引起的选择性、深度局部的几何结构变化。

Comments Submitted to EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02495 2026-05-26 cs.CL cs.AI cs.LG 85%

Reward-free Alignment for Conflicting Objectives

无奖励的冲突目标对齐

Peter Chen, Xiaopeng Li, Xi Chen, Tianyi Lin

机构 * Columbia University(哥伦比亚大学)

专题命中 偏好对齐 :alignment(title,abstract);safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出RACO框架,通过冲突规避梯度下降的裁剪变体直接利用成对偏好数据解决多目标冲突,实现帕累托最优对齐。

Comments Accepted to ICML 2026 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04410 2026-04-07 cs.LG cs.AI cs.CL stat.ML 85%

Relative Density Ratio Optimization for Stable and Statistically Consistent Model Alignment

相对密度比优化用于稳定且统计一致的模型对齐

Hiroshi Takahashi, Tomoharu Iwata, Atsutoshi Kumagai, Sekitoshi Kanai, Masanori Yamada, Kosuke Nishida, Kazutoshi Shinoda

机构 * NTT, Inc.(日本电信电话株式会社) NTT DOCOMO, INC.(NTT DOCOMO公司)

专题命中 偏好对齐 :alignment(title,abstract);safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出一种稳定且统计一致的模型对齐方法,通过相对密度比优化,改进了直接密度比优化的稳定性与收敛性。

Comments Code is available at https://github.com/takahashihiroshi/rdro

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12050 2026-03-16 cs.CL cs.AI cs.LG 85%

AdaBoN: Adaptive Best-of-N Alignment

AdaBoN: 适应性最佳N对齐

Vinod Raman, Hilal Asi, Satyen Kale

专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出一种适应性最佳N对齐策略,通过两阶段算法高效分配推理计算资源,实验证明其在不同提示批次中优于均匀分配方法。

Comments 25 pages

详情

展开后加载摘要…

URL PDF HTML 收藏