arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-04-20 至 2026-04-20 共收录 9 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 9 篇

2509.19104 2026-04-20 cs.LG stat.ML 89%

Online Distributionally Robust LLM Alignment via Regression to Relative Reward

通过回归相对奖励实现在线分布鲁棒LLM对齐

Sharan Sahu, Martin T. Wells

机构 * Department of Statistics and Data Science(统计与数据科学系) Cornell University(康奈尔大学)

专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract,abstract_cn);DPO(abstract,abstract_cn);分类 cs.LG

AI总结 本文提出DRO-REBEL方法,通过类型-p Wasserstein、KL和χ²模糊集实现分布鲁棒优化,证明了在偏好转移下的参数误差界,并在多个基准测试中优于现有基线。

Comments 70 pages, 7 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15780 2026-04-20 cs.LG cs.CL 85%

Pruning Unsafe Tickets: A Resource-Efficient Framework for Safer and More Robust LLMs

裁剪不安全的票据:一种资源高效的更安全且更稳健的大语言模型框架

Wai Man Si, Mingjie Li, Michael Backes, Yang Zhang

机构 * CISPA Helmholtz Center for Information Security(CISPA海德堡信息安全中心)

专题命中 偏好对齐 :RLHF(abstract,abstract_cn);alignment(abstract);safety(abstract);jailbreak(abstract)

AI总结 本文提出一种资源高效的剪枝框架,通过识别并移除与不安全行为相关的参数,减少不安全生成并提高对抗鲁棒性,同时保持模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16027 2026-04-20 cs.CL cs.AI cs.LG 75%

Where does output diversity collapse in post-training?

在微调后输出多样性为何会崩溃?

Constantinos Karouzos, Xingwei Tan, Nikolaos Aletras

机构 * School of Computer Science University of Sheffield(计算机科学学院 伦敦大学谢菲尔德分校)

专题命中 偏好对齐 :DPO(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 研究探讨了微调后输出多样性的崩溃原因,发现数据组成和训练方法共同影响多样性,揭示多样性崩溃发生在训练阶段而非推理阶段。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15705 2026-04-20 cs.LG 70%

Towards Robust Endogenous Reasoning: Unifying Drift Adaptation in Non-Stationary Tuning

迈向稳健的内生推理:统一非平稳调谐中的漂移适应

Xiaoyu Yang, En Yu, Wei Duan, Jie Lu

机构 * Australian Artificial Intelligence Institute (AAII)(澳大利亚人工智能研究所) Faculty of Engineering and Information Technology(工程与信息技术学院)

专题命中 偏好对齐 :alignment(abstract);safety(abstract);分类 cs.LG

AI总结 本文提出CPO++框架,解决多模态大语言模型在内生推理中的漂移问题,通过反事实推理与领域知识结合,提升推理连贯性和决策精度,适用于医疗诊断和自动驾驶等安全关键领域。

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.15549 2026-04-20 cs.CL 57%

WildFeedback: Aligning LLMs With In-situ User Interactions And Feedback

WildFeedback: 对齐大语言模型与实时用户交互与反馈

Taiwei Shi, Zhuoer Wang, Longqi Yang, Ying-Chun Lin, Zexue He, Mengting Wan, Pei Zhou, Sujay Jauhar, Sihao Chen, Shan Xia, Hongfei Zhang, Jieyu Zhao, Xiaofeng Xu, Xia Song, Jennifer Neville

机构 * Microsoft Corporation(微软公司) Purdue University(普渡大学) Texas A&M University(德克萨斯农工大学) University of California San Diego(加州大学圣地亚哥分校) University of Southern California(南加州大学)

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL

AI总结 本文提出WildFeedback框架,通过实时用户反馈自动创建偏好数据集,提升大语言模型对用户偏好的对齐能力,解决了现有方法的可扩展性、主观性和偏见问题。

Comments ACL 2026 Camera-ready. 25 pages, 6 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15602 2026-04-20 cs.CL 57%

GroupDPO: Memory efficient Group-wise Direct Preference Optimization

GroupDPO:内存高效的组级直接偏好优化

Jixuan Leng, Si Si, Hsiang-Fu Yu, Vinod Raman, Inderjit S. Dhillon

机构 * CMU(卡内基梅隆大学) Google Deepmind(谷歌DeepMind) Google(谷歌)

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL

AI总结 本文提出GroupDPO,通过解耦样本和保留梯度实现高效的组级偏好优化,减少内存使用,提升大规模训练效果,且在离线和在线对齐中均优于单对训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14518 2026-04-20 cs.AI 57%

Mind DeepResearch Technical Report

Mind DeepResearch 技术报告

MindDR Team, Li Auto Inc

机构 * MindDR Team(MindDR团队) Li Auto Inc(Li Auto公司)

专题命中 偏好对齐 :alignment(abstract);分类 cs.AI

AI总结 MindDR通过高效多智能体深度研究框架,在仅30B参数模型下实现领先性能,采用精心设计的数据合成和多阶段训练流程,其核心创新为三智能体架构及四阶段智能体专用训练流程,展现竞争力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18142 2026-04-20 cs.HC cs.CY cs.IR 57%

Mirroring Users: Towards Building Preference-aligned User Simulator with User Feedback in Recommendation

镜像用户:构建基于用户反馈的偏好对齐用户模拟器

Tianjun Wei, Huizhong Guo, Yingpeng Du, Zhu Sun, Huang Chen, Dongxia Wang, Jie Zhang

专题命中 偏好对齐 :alignment(abstract);分类 cs.CY

AI总结 本文提出一种基于用户反馈的用户模拟器构建框架,通过生成高质量模拟数据提升推荐系统与用户偏好的对齐能力,并通过实验验证其有效性。

Comments ACL 2026 Main. Github: https://github.com/Joinn99/UserMirrorer

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02261 2026-04-20 cs.IR cs.LG 57%

What Makes LLMs Effective Sequential Recommenders? A Study on Preference Intensity and Temporal Context

是什么让大语言模型(LLMs)成为有效的序列推荐者?对偏好强度和时间上下文的研究

Zhongyu Ouyang, Qianlong Wen, Chunhui Zhang, Yanfang Ye, Soroush Vosoughi

机构 * Department of Computer Science, Dartmouth College(达特茅斯大学计算机科学系) ByteDance, US(字节跳动(美国)) Department of Computer Science and Engineering, University of Notre Dame(诺丁汉大学计算机科学与工程系)

专题命中 偏好对齐 :alignment(abstract);分类 cs.LG

AI总结 本文研究了LLMs在序列推荐中有效性的关键因素,提出RecPO框架通过整合显式和隐式反馈,提升推荐性能,强调偏好强度和时间上下文的重要性。

Comments Accepted The 64th Annual Meeting of the Association for Computational Linguistics (ACL 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏