arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 30372 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 3227 篇

2510.05526 2025-12-10 cs.LG cs.AI 91%

Provably Mitigating Corruption, Overoptimization, and Verbosity Simultaneously in Offline and Online RLHF/DPO Alignment

可证明地同时缓解离线和在线RLHF/DPO对齐中的腐败、过度优化和冗余

Ziyi Chen, Junyi Li, Peiran Yu, Heng Huang

专题命中 偏好对齐 :RLHF(title,abstract);DPO(title,abstract);alignment(title);分类 cs.AI、cs.LG

AI总结 本文提出RLHF-COV和DPO-COV算法,同时缓解离线和在线RLHF/DPO对齐中的腐败、过度优化和冗余问题,并通过理论证明和实验验证其有效性。

Comments Edited a few incorrect numbers in Tables 2 and 3

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11026 2026-03-24 cs.LG cs.AI cs.CL 91%

RLHF in an SFT Way: From Optimal Solution to Reward-Weighted Alignment

通过SFT方式实现RLHF:从最优解到奖励加权对齐

Yuhao Du, Zhuo Li, Pengyu Cheng, Zhihong Chen, Yuejiao Xie, Xiang Wan, Anningzhe Gao

机构 * Shenzhen Research Institute of Big Data(深圳大数据研究院) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Qwen LLM Application Team, Alibaba(阿里巴巴Qwen大模型应用团队) Stanford University(斯坦福大学)

专题命中 偏好对齐 :alignment(title,abstract);RLHF(title,abstract);DPO(abstract);harmlessness(abstract)

AI总结 本文提出VAR方法,通过变分推断视角简化RLHF,将对齐目标转化为离线奖励驱动的加权监督微调形式,提升训练稳定性和效果,实验证明其在帮助性和无害性指标上优于DPO,且在计算效率和收敛速度上优于在线采样方法。

Comments Published in TMLR-2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05179 2026-06-02 cs.CL 91%

From Fragments to Facts: A Curriculum-Driven DPO Approach for Generating Hindi News Veracity Explanations

从碎片到事实:一种课程驱动的DPO方法用于生成印地语新闻真实性解释

Pulkit Bansal, Raghvendra Kumar, Shakti Singh, Adam Jatowt, Sriparna Saha

机构 * TCS Research(TCS研究) Department of Computer Science and Engineering, Indian Institute of Technology Patna(印度理工学院帕纳布计算机科学与工程系) Indian Institute of Technology Patna(印度理工学院帕纳布) University of Innsbruck(因斯布鲁克大学)

专题命中 偏好对齐 :DPO(title,title_cn);alignment(abstract);分类 cs.CL

AI总结 针对印地语等低资源语言的虚假信息检测,提出一种结合直接偏好优化(DPO)与课程学习的框架,通过引入“实际性”和“精炼度”参数优化解释质量,实验验证了生成连贯、相关解释的有效性。

Comments Accepted at ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23244 2026-05-25 cs.LG 91%

Convex Optimization for Alignment and Preference Learning on a Single GPU

单GPU上的对齐与偏好学习的凸优化

Miria Feng, Mert Pilanci

机构 * Department of Electrical Engineering, Stanford University, California, United States(斯坦福大学电气工程系,加州,美国)

专题命中 偏好对齐 :DPO(summary_cn,abstract);alignment(title,abstract);RLHF(abstract,abstract_cn);分类 cs.LG

AI总结 提出COALA算法,利用凸优化重表述消除参考模型,在单GPU上高效训练,性能与DPO相当但计算量仅为其17.6%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27355 2026-06-01 cs.AI cs.CL cs.LG 91%

Alignment Tampering: How Reinforcement Learning from Human Feedback Is Exploited to Optimize Misaligned Biases

对齐篡改:人类反馈强化学习如何被利用以优化错位偏见

Dongyoon Hahm, Dylan Hadfield-Menell, Kimin Lee

机构 * MIT(麻省理工学院)

专题命中 偏好对齐 :alignment(title,abstract);RLHF(summary_cn,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出对齐篡改漏洞,即对齐中的LLM通过影响偏好数据集使RLHF放大不良行为,并通过实验展示多种偏见的放大,指出现有缓解方法难以在不牺牲质量的情况下解决该问题。

Comments Accepted at ICML 2026, Source code: https://alignment-tampering.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12991 2026-08-11 cs.LG cs.AI 版本更新 91%

Not Just RLHF: Why Alignment Alone Won't Fix Multi-Agent Sycophancy

不只是RLHF:为何仅对齐不足以解决多智能体趋同

Adarsh Kumarappan, Ananya Mujoo

机构 * California Institute of Technology(加州理工学院) Evergreen Valley College(艾弗绿谷学院)

专题命中 偏好对齐 :RLHF(title,title_cn);alignment(title);分类 cs.AI、cs.LG

AI总结 本文研究了多智能体系统在模拟同伴分歧下的错误率问题,发现预训练基础模型与指令模型存在相似的替换模式,且错误率较高。通过激活修补发现错误集中在中间层,修复后可恢复大部分正确率差距。研究还指出压力抑制了清洁推理特征,而非激活新的趋同回路。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01239 2026-07-03 cs.CL cs.AI 新提交 91%

Breaking Safety at the Token Boundary: How BPE Tokenization Creates Exploitable Gaps in LLM Alignment

在Token边界打破安全:BPE分词如何在LLM对齐中制造可利用的漏洞

Tung-Ling Li, Hongliang Liu, Yuhao Wu

机构 * Palo Alto Networks

专题命中 偏好对齐 :alignment(title,abstract);safety(title,abstract);DPO(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 研究发现BPE分词将安全关键词拆分为子词,导致对齐数据集缺乏此类碎片化输入,通过优化碎片化可绕过80-100%的安全拒绝,并定位到模型最后约30%层。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26057 2026-06-25 cs.AI cs.CR cs.LG 新提交 91%

The Unfireable Safety Kernel: Execution-Time AI Alignment for AI Agents and Other Escapable AI Systems

不可解雇的安全内核:面向AI代理及其他可逃逸AI系统的执行时AI对齐

Seth Dobrin, Łukasz Chmiel

机构 * ARYA Labs PBC

专题命中 偏好对齐 :alignment(title,abstract);safety(title,abstract);RLHF(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 提出一种架构性控制机制“不可解雇的安全内核”,通过进程隔离、前置强制、故障关闭和外部验证四个属性实现执行时AI对齐,在可逃逸AI系统中阻止逃逸尝试。

Comments Pre-print submitted for publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27382 2026-05-29 cs.HC cs.AI cs.CL 91%

The Alignment Floor: How Persona Customization Breaks Safety in Weakly-Aligned LLMs

对齐下限:角色定制如何破坏弱对齐大语言模型的安全性

Xing Zhang, Guanghui Wang, Yanwei Cui, Wei Qiu, Ziyuan Li, Bing Zhu, Peiyang He

机构 * AWS Generative AI Innovation Center(AWS生成式人工智能创新中心) HSBC Holdings Plc., HSBC Technology Center, China(汇丰控股有限公司,汇丰技术中心,中国)

专题命中 偏好对齐 :alignment(title,abstract);safety(title,abstract);RLHF(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 通过对比强对齐与弱对齐模型在不同角色条件下的谄媚率变化,定义对齐下限Δ_floor作为评估模型角色定制安全性的审计指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07892 2026-05-13 cs.LG cs.CL 91%

Safety Alignment as Continual Learning: Mitigating the Alignment Tax via Orthogonal Gradient Projection

安全对齐作为持续学习:通过正交梯度投影缓解对齐税

Guanglong Sun, Siyuan Zhang, Liyuan Wang, Jun Zhu, Hang Su, Yi Zhong

机构 * School of Life Sciences, IDG/McGovern Institute for Brain Research(生命科学学院,IDG/麦戈文脑科学研究所) Dept. of Comp. Sci. and Tech., Institute for AI, Tsinghua-Bosch Joint ML Center, THBI Lab, BNRist Center(计算机科学与技术系,人工智能研究所,清华大学-博世联合机器学习中心,THBI实验室,BNRist中心) Tsinghua University, Beijing, China(清华大学,北京,中国)

专题命中 偏好对齐 :alignment(title,abstract);safety(title,abstract);DPO(abstract,abstract_cn);分类 cs.CL、cs.LG

AI总结 本文通过持续学习视角研究安全对齐与通用能力退化之间的权衡,提出OGPSA方法通过正交梯度投影提升安全性和实用性,实验显示在不同训练流程中显著改善安全-效用权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.03710 2025-10-31 cs.CL cs.CR cs.LG 91%

Improving LLM Safety Alignment with Dual-Objective Optimization

Xuandong Zhao, Will Cai, Tianneng Shi, David Huang, Licong Lin, Song Mei, Dawn Song

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 偏好对齐 :alignment(title,abstract);safety(title,abstract);DPO(abstract);jailbreak(abstract)

Comments ICML 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.15513 2025-06-17 cs.AI cs.CL 91%

PKU-SafeRLHF: Towards Multi-Level Safety Alignment for LLMs with Human Preference

Jiaming Ji, Donghai Hong, Borong Zhang, Boyuan Chen, Juntao Dai, Boren Zheng, Tianyi Qiu, Jiayi Zhou, Kaile Wang, Boxuan Li, Sirui Han, Yike Guo, Yaodong Yang

机构 * Peking University(北京大学) The Hong Kong University of Science and Technology(香港科学与技术大学) Infinigence-AI

专题命中 偏好对齐 :alignment(title,abstract);safety(title,abstract);RLHF(abstract);harmlessness(abstract)

Comments Accepted by ACL2025 Main, a sibling project to SafeRLHF and BeaverTails

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01043 2026-07-09 cs.SE 版本更新 90%

DPO-F+: Aligning Code Repair Feedback with Developers' Preferences

DPO-F+:使代码修复反馈与开发者偏好对齐

Zihan Fang, Yifan Zhang, Yueke Zhang, Kevin Leach, Yu Huang

专题命中 偏好对齐 :DPO(title,title_cn);alignment(abstract)

AI总结 研究针对大语言模型在代码修复中开发者难解读输出的问题,提出DPO-f+框架,通过定义指标、构建数据集、微调模型及评估反馈质量,提升反馈准确性与对齐度,增强了代码理解和人机协作。

Comments 10 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10078 2026-06-10 cs.IR 新提交 90%

Mult-DPO: Multinomial Direct Preference Optimization for Recommender Systems

Mult-DPO:用于推荐系统的多项直接偏好优化

Yaochen Zhu, Harald Steck, James McInerney, Aditya Sinha, Yinhan He, Nathan Kallus, Jundong Li

专题命中 偏好对齐 :DPO(title,title_cn);alignment(abstract)

AI总结 针对推荐系统中集合级偏好(多个正项)的LLM对齐问题,提出Mult-DPO,通过可计算的多项式替代似然实现直接偏好优化,并证明其是边际化Plackett-Luce DPO损失的可计算上界。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03376 2026-06-04 cs.CV cs.AI cs.CL cs.LG 90%

P$^2$-DPO: Grounding Hallucination in Perceptual Processing via Calibration Direct Preference Optimization

P²-DPO:通过校准直接偏好优化在感知处理中锚定幻觉

Ruipeng Zhang, Zhihao Li, Haozhang Yuan, C. L. Philip Chen, Tong Zhang

机构 * Guangdong Provincial Key Laboratory of Computational AI Models and Cognitive Intelligence, School of Computer Science & Engineering, South China University of Technology(广东省计算人工智能模型与认知智能重点实验室,计算机科学与工程学院,华南理工大学) Pazhou Lab, Guangzhou, China(琶洲实验室,广州,中国) Engineering Research Center of the Ministry of Education on Health Intelligent Perception and Paralleled Digital-Human, Guangzhou, China(教育部健康智能感知与并行数字人工程研究中心,广州,中国)

专题命中 偏好对齐 :DPO(title,title_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 针对大型视觉语言模型中的幻觉问题,提出P²-DPO训练范式,通过模型自生成偏好对和校准损失,直接优化感知瓶颈和视觉鲁棒性,无需昂贵人工反馈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03238 2026-06-02 cs.HC 90%

RLHF May Not Reflect Genuine Preferences

RLHF 可能不反映真实偏好

Bijean Ghafouri, Eun Cheol Choi, Priyanka Dey, Emilio Ferrara

专题命中 偏好对齐 :RLHF(title,title_cn);alignment(abstract)

AI总结 本文指出 RLHF 中的标注响应可能并非真实偏好,通过提出测量有效性诊断方法,发现不一致性具有系统性偏差,过滤高不一致标注者会显著改变模型输出。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01167 2026-06-02 cs.LG cs.AI cs.CL 90%

Simultaneous Multi-objective Alignment Across Verifiable and Non-verifiable Rewards

同时多目标对齐:可验证与不可验证奖励

Yiran Shen, Yu Xia, Jonathan Chang, Prithviraj Ammanabrolu

机构 * ucsd(加州大学圣地亚哥分校)

专题命中 偏好对齐 :alignment(title,abstract);DPO(summary_cn,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出MAHALO框架,通过标准化PRM训练、多动作头DPO和PRM引导解码,实现大语言模型在可验证与不可验证奖励上的多目标对齐,减少目标冲突并支持推理时控制。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23398 2026-05-25 cs.IR 90%

TPMM-DPO: Trajectory-aware Preference-guided Model Merging for Iterative Direct Preference Optimization

TPMM-DPO:轨迹感知偏好引导的模型合并用于迭代直接偏好优化

Lingling Fu, Yongfu Xu

专题命中 偏好对齐 :DPO(title,title_cn);alignment(abstract)

AI总结 针对迭代DPO中噪声累积导致的过优化和性能退化问题,提出TPMM-DPO方法,通过将迭代策略模型序列视为优化轨迹并自适应融合,构建更平滑鲁棒的参考模型,从而提升训练稳定性和生成质量。

Comments 11 pages,6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27578 2026-06-29 cs.LG cs.AI 新提交 90%

PEBS: Per-rater Empirical-Bayes Shrinkage for RLHF Reward-Model Calibration

PEBS: 用于RLHF奖励模型校准的每评分者经验贝叶斯收缩

Arnav Raj

专题命中 偏好对齐 :RLHF(title,title_cn);分类 cs.AI、cs.LG;alignment(comments)

AI总结 针对RLHF中奖励模型忽略评分者个体差异的问题,提出PEBS方法,对每个评分者拟合仿射校准器并应用经验贝叶斯收缩,在PRISM和PluriHarms数据集上分别降低RMSE 8.58%和9.66%。

Comments Accepted at the ICML 2026 Workshop on Pluralistic Alignment. Code: https://github.com/deadsmash07/pebs-pluralistic

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22829 2026-03-25 cs.AI 90%

Improving Safety Alignment via Balanced Direct Preference Optimization

通过平衡直接偏好优化提升安全性对齐

Shiji Zhao, Mengyang Wang, Shukun Xiong, Fangzhou Chen, Qihui Zhu, Shouwei Ruan, Yisong Xiao, Ranjie Duan, Xun Chen, XingXing Wei

机构 * Institute of Artificial Intelligence, Beihang University, Beijing, China(北京航空航天大学人工智能研究院)

专题命中 偏好对齐 :alignment(title,abstract);safety(title,abstract);RLHF(abstract);DPO(abstract)

AI总结 本文提出B-DPO方法,通过平衡偏好与非偏好响应的优化强度,缓解偏好对齐中的过拟合问题,提升模型安全性同时保持竞争力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.02384 2025-06-30 cs.CL 90%

STAIR: Improving Safety Alignment with Introspective Reasoning

Yichi Zhang, Siyuan Zhang, Yao Huang, Zeyu Xia, Zhengwei Fang, Xiao Yang, Ranjie Duan, Dong Yan, Yinpeng Dong, Jun Zhu

机构 * Tsinghua University(清华大学) Beihang University(北航) Alibaba Group(阿里巴巴集团)

专题命中 偏好对齐 :alignment(title,abstract);safety(title,abstract);jailbreak(abstract);harmlessness(abstract)

Comments 22 pages, 8 figures, ICML2025 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16869 2025-05-23 cs.CL 90%

MPO: Multilingual Safety Alignment via Reward Gap Optimization

Weixiang Zhao, Yulin Hu, Yang Deng, Tongtong Wu, Wenxuan Zhang, Jiahe Guo, An Zhang, Yanyan Zhao, Bing Qin, Tat-Seng Chua, Ting Liu

专题命中 偏好对齐 :alignment(title,abstract);safety(title,abstract);RLHF(abstract);DPO(abstract)

Comments To Appear at ACL 2025 (Main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.09420 2025-04-15 cs.CL 90%

SaRO: Enhancing LLM Safety through Reasoning-based Alignment

Yutao Mou, Yuxiao Luo, Shikun Zhang, Wei Ye

专题命中 偏好对齐 :alignment(title,abstract);safety(title,abstract);DPO(abstract);jailbreak(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.04657 2023-11-08 cs.CL 90%

BeaverTails: Towards Improved Safety Alignment of LLM via a Human-Preference Dataset

Jiaming Ji, Mickel Liu, Juntao Dai, Xuehai Pan, Chi Zhang, Ce Bian, Chi Zhang, Ruiyang Sun, Yizhou Wang, Yaodong Yang

专题命中 偏好对齐 :alignment(title,abstract);safety(title,abstract);RLHF(abstract);harmlessness(abstract)

Comments Published at NeurIPS 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29758 2026-07-28 cs.LG cs.AI 版本更新 90%

PS-PPO: Prefix-Sampling PPO for Critic-Free RLHF

PS-PPO: 用于无评论者RLHF的前缀采样PPO

Doo Hwan Hwang, Kee-Eung Kim

专题命中 偏好对齐 :RLHF(title,title_cn);分类 cs.AI、cs.LG

AI总结 提出PS-PPO方法,通过前缀采样和重要性加权修正,在无评论者RLHF中减少训练计算和内存,保持准确率。

Journal ref ICML 2026 published

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04145 2026-06-16 cs.LG cs.AI cs.DC 版本更新 90%

EvalStop: Using World Feedback to Detect and Correct Reward Overoptimization in Multi-Tenant RLHF Platforms

EvalStop:利用世界反馈检测和纠正多租户RLHF平台中的奖励过度优化

Guilin Zhang, Chuanyi Sun, Kai Zhao, Xu Chu, Shahryar Sarkani, John M. Fossaceca

机构 * DeepMind, London, UK(深度Mind, 英国伦敦) University of Cambridge, UK(英国剑桥大学) University of Washington, USA(美国华盛顿大学)

专题命中 偏好对齐 :RLHF(title,title_cn);分类 cs.AI、cs.LG

AI总结 提出EvalStop调度原语,通过检测评估分数连续下降来终止作业、释放GPU并保留最佳检查点,以纠正奖励过度优化,在RLHF负载上实现高精度检测并提升JCT。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01023 2026-06-10 cs.IR cs.AI cs.LG 90%

Unifying Ranking and Generation in Query Auto-Completion via Retrieval-Augmented Generation and Multi-Objective Alignment

通过检索增强生成和多目标对齐统一查询自动补全中的排序与生成

Kai Yuan, Anthony Zheng, Jia Hu, Divyanshu Sheth, Hemanth Velaga, Kylee Kim, Matteo Guarrera, Besim Avci, Jianhua Li, Xuetao Yin, Rajyashree Mukherjee, Sean Suchter

机构 * Apple(苹果公司) UC Berkeley(加州大学伯克利分校)

专题命中 偏好对齐 :DPO(summary_cn,abstract);alignment(title,abstract);safety(abstract);分类 cs.AI、cs.LG

AI总结 提出一个统一框架,通过检索增强生成(RAG)和多目标直接偏好优化(DPO)将查询自动补全重构为端到端列表生成,解决传统流水线长尾覆盖不足和生成方法幻觉风险的问题,并在大规模商业搜索平台上验证了有效性。

Comments 11 pages, 4 figures

Journal ref Proceedings of the 32nd ACM SIGKDD Conference on Knowledge Discovery and Data Mining V.2 (KDD '26), August 09--13, 2026, Jeju Island, Republic of Korea

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05342 2026-06-02 cs.LG cs.AI 90%

Margin Adaptive DPO: Leveraging Reward Model for Granular Control in Preference Optimization

Margin Adaptive DPO: 利用奖励模型实现偏好优化中的细粒度控制

Hyung Gyu Rho

机构 * Independent Researcher(独立研究者)

专题命中 偏好对齐 :DPO(title,title_cn);分类 cs.AI、cs.LG

AI总结 提出Margin-Adaptive Direct Preference Optimization (MADPO)方法,通过奖励模型估计偏好边界并自适应调整DPO损失权重,实现实例级别的细粒度控制,在摘要任务上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30873 2026-06-01 cs.LG cs.AI cs.DC 90%

Federated Variational Preference Alignment with Gumbel-Softmax Prior for Personalized User Preferences

联邦变分偏好对齐与Gumbel-Softmax先验用于个性化用户偏好

Jabin Koo, Hoyoung Kim, Minwoo Jang, Jungseul Ok

机构 * Graduate School of AI, POSTECH, Pohang, Republic of Korea(POSTECH人工智能研究生院) Department of CSE, POSTECH, Pohang, Republic of Korea(POSTECH计算机科学与工程系) National AI Research Lab, Seoul, Republic of Korea(首尔国家人工智能研究实验室)

专题命中 偏好对齐 :RLHF(summary_cn,abstract);alignment(title,abstract);harmlessness(abstract);分类 cs.AI、cs.LG

AI总结 提出FedVPA-GP框架,通过联邦混合先验和正交损失解决联邦学习中用户偏好冲突和个性化问题,在HH-RLHF数据集上优于单一模型。

Comments 21 pages, 4 figures. Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06977 2026-05-11 cs.LG cs.AI cs.IT math.IT stat.ML 90%

$f$-Divergence Regularized RLHF: Two Tales of Sampling and Unified Analyses

$f$-Divergence Regularized RLHF:采样两则与统一分析

Di Wu, Chengshuai Shi, Jing Yang, Cong Shen

机构 * Department of Electrical and Computer Engineering, University of Virginia, Virginia, United States(弗吉尼亚大学电气与计算机工程系) Princeton Language and Intelligence, Princeton University, New Jersey, United States(普林斯顿大学语言与智能)

专题命中 偏好对齐 :RLHF(title,title_cn);分类 cs.AI、cs.LG

AI总结 本文提出基于一般$f$-散度正则化的在线RLHF框架,通过两种采样策略实现统一理论分析,证明了算法在$O(\log T)$ regret和$O(1/T)$ sub-optimality gap下的效率。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏