arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 3235 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 3235 篇

2406.15178 2024-06-24 cs.CL 79%

Hybrid Alignment Training for Large Language Models

Chenglong Wang, Hang Zhou, Kaiyan Chang, Bei Li, Yongyu Mu, Tong Xiao, Tongran Liu, Jingbo Zhu

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.CL

Comments accepted by ACL (Findings) 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.08657 2024-06-14 cs.CL 79%

Mistral-C2F: Coarse to Fine Actor for Analytical and Reasoning Enhancement in RLHF and Effective-Merged LLMs

Chen Zheng, Ke Sun, Xun Zhou

专题命中 偏好对齐 :RLHF(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.08469 2024-06-13 cs.LG 79%

PAL: Pluralistic Alignment Framework for Learning from Heterogeneous Preferences

Daiwei Chen, Yi Chen, Aniket Rege, Ramya Korlakai Vinayak

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.LG

Comments 22 pages, 14 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.05882 2024-06-11 cs.LG stat.ML 79%

Distributional Preference Alignment of LLMs via Optimal Transport

Igor Melnyk, Youssef Mroueh, Brian Belgodere, Mattia Rigotti, Apoorva Nitsure, Mikhail Yurochkin, Kristjan Greenewald, Jiri Navratil, Jerret Ross

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.06886 2024-06-04 cs.LG math.OC stat.ML 79%

Principled Penalty-based Methods for Bilevel Reinforcement Learning and RLHF

Han Shen, Zhuoran Yang, Tianyi Chen

专题命中 偏好对齐 :RLHF(title,abstract);分类 cs.LG

Comments Shorter version accepted to ICML 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.02030 2024-05-24 cs.CL 79%

Panacea: Pareto Alignment via Preference Adaptation for LLMs

Yifan Zhong, Chengdong Ma, Xiaoyuan Zhang, Ziran Yang, Haojun Chen, Qingfu Zhang, Siyuan Qi, Yaodong Yang

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.09824 2024-04-16 cs.CL 79%

Impact of Preference Noise on the Alignment Performance of Generative Language Models

Yang Gao, Dana Alon, Donald Metzler

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.01730 2024-04-03 cs.LG cs.IT math.IT stat.ML 79%

Asymptotics of Language Model Alignment

Joy Qiping Yang, Salman Salamatian, Ziteng Sun, Ananda Theertha Suresh, Ahmad Beirami

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.08785 2024-02-15 cs.CL 79%

InstructGraph: Boosting Large Language Models via Graph-centric Instruction Tuning and Preference Alignment

Jianing Wang, Junda Wu, Yupeng Hou, Yao Liu, Ming Gao, Julian McAuley

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.CL

Comments 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.06080 2024-01-15 cs.AI 79%

Secrets of RLHF in Large Language Models Part II: Reward Modeling

Binghai Wang, Rui Zheng, Lu Chen, Yan Liu, Shihan Dou, Caishuang Huang, Wei Shen, Senjie Jin, Enyu Zhou, Chenyu Shi, Songyang Gao, Nuo Xu, Yuhao Zhou, Xiaoran Fan, Zhiheng Xi, Jun Zhao, Xiao Wang, Tao Ji, Hang Yan, Lixing Shen, Zhan Chen, Tao Gui, Qi Zhang, Xipeng Qiu, Xuanjing Huang, Zuxuan Wu, Yu-Gang Jiang

专题命中 偏好对齐 :RLHF(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.08372 2023-11-06 cs.CL 79%

Improving Factual Consistency for Knowledge-Grounded Dialogue Systems via Knowledge Enhancement and Alignment

Boyang Xue, Weichao Wang, Hongru Wang, Fei Mi, Rui Wang, Yasheng Wang, Lifeng Shang, Xin Jiang, Qun Liu, Kam-Fai Wong

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.CL

Comments EMNLP2023 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.09055 2023-09-19 cs.CL 79%

Exploring the impact of low-rank adaptation on the performance, efficiency, and regularization of RLHF

Simeng Sun, Dhawal Gupta, Mohit Iyyer

专题命中 偏好对齐 :RLHF(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2204.05196 2022-04-12 cs.LG 79%

Automatically Learning Fallback Strategies with Model-Free Reinforcement Learning in Safety-Critical Driving Scenarios

Ugo Lecerf, Christelle Yemdji-Tchassi, Sébastien Aubert, Pietro Michiardi

专题命中 偏好对齐 :safety(title,abstract);分类 cs.LG

Comments To appear in proceedings of International Conference on Machine Learning Technologies (ICMLT) 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2012.07228 2020-12-15 cs.AI 79%

Trustworthy Preference Completion in Social Choice

Lei Li, Minghe Xue, Huanhuan Chen, Xindong Wu

专题命中 偏好对齐 :trustworthy(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23102 2026-08-12 cs.AI cs.CL 版本更新 79%

Multiplayer Nash Preference Optimization

多玩家纳什偏好优化

Fang Wu, Xu Huang, Weihao Xuan, Zhiwei Zhang, Yijia Xiao, Guancheng Wan, Xiaomin Li, Bing Hu, Peng Xia, Jure Leskovec, Yejin Choi

机构 * Stanford University(斯坦福大学) Georgia Institute of Technology(佐治亚理工学院) The University of Tokyo(东京大学) RIKEN AIP(日本理化学研究所智能系统研究中心) Pennsylvania State University(宾夕法尼亚州立大学) University of California, Los Angeles(加州大学洛杉矶分校) Harvard University(哈佛大学) UNC–Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 偏好对齐 :RLHF(abstract,abstract_cn);alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文提出多玩家纳什偏好优化框架,扩展了传统的两玩家纳什对齐方法,通过引入多玩家博弈机制,提升对复杂非传递性人类偏好的对齐能力,并在多个基准测试中表现更优。

Journal ref ICLR 2026 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17658 2026-08-07 cs.LG cs.AI cs.IT math.IT 版本更新 79%

MARS: Margin and Semantic-Aware Data Augmentation for Reward Modeling

MARS:面向奖励建模的边界与语义感知数据增强

Payel Bhattacharjee, Osvaldo Simeone, Ravi Tandon

机构 * University of Arizona(亚利桑那大学) Northeastern University London(伦敦东北大学)

专题命中 偏好对齐 :RLHF(abstract,abstract_cn);alignment(abstract);分类 cs.AI、cs.LG

AI总结 提出MARS框架,通过优先增强低边界偏好对并利用语义距离细化,提升奖励模型质量和对齐性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02689 2026-08-05 cs.CL cs.LG 新提交 79%

Stuck on "A": Diagnosing and Repairing Interface Injury in Attention-to-KDA Linearization of a 0.6B Language Model

困在“A”上:诊断与修复0.6B语言模型的KDA线性化注意力中的接口损伤

Ronglong Bao

专题命中 偏好对齐 :DPO(abstract,abstract_cn);alignment(abstract);分类 cs.CL、cs.LG

AI总结 本研究将Qwen3-0.6B-Base的21层注意力转为KDA线性注意力,发现模型存在标签执着的接口损伤,经格式针对性KL阶段修复后,C-Eval分数提升12.48分,相关成果已开源。

Comments Code and models: https://github.com/Sisyphbaous-DT-Project/open-qingyi ; https://huggingface.co/shiershuihesaixiliya/qingyi-kda-0.6b . A version of this preprint is archived on Zenodo (DOI: 10.5281/zenodo.21722356)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06133 2026-08-04 cs.SE cs.AI cs.LG cs.LO 版本更新 79%

TLA-Prover: Verifiable TLA+ Specification Synthesis via Preference-Optimized Low-Rank Adaptation

TLA-Prover: 通过偏好优化低秩适配实现可验证的 TLA+ 规范合成

Eric Spencer, Arslan Bisharat, Brian Ortiz, Khushboo Bhadauria, Mujtaba Nazari, TaiNing Wang, George K. Thiruvathukal, Konstantin Laufer, Mohammed Abuhamad

机构 * Department of Computer Science, Loyola University Chicago(洛约拉芝加哥大学计算机科学系)

专题命中 偏好对齐 :DPO(abstract,abstract_cn);safety(abstract);分类 cs.AI、cs.LG

AI总结 提出 TLA-Prover 模型,结合监督微调和基于修复的组相对策略优化,在 TLC 模型检查器上实现 TLA+ 规范合成,Gold/Diamond 级别通过率达 30%,约为未调优基线的 3.5 倍。

Comments 12 pages, 5 tables, 3 figures. In Proceedings at the 21st International Conference on Software Technologies (ICSOFT 2026)

Journal ref ICSOFT 2026, pp. 627-636, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22649 2026-07-28 cs.AI cs.CL 新提交 79%

STAIF: A Stage-wise Optimization for Complex Instruction Following

STAIF:一种用于复杂指令跟随的逐阶段优化方法

Jian Hong, Chen Cheng, Quan Liu, Yuhao Chen, Enhong Chen

机构 * University of Science and Technology of China(中国科学技术大学) iFLYTEK Research Group(科大讯飞研究院)

专题命中 偏好对齐 :DPO(abstract,abstract_cn);alignment(abstract);分类 cs.CL、cs.AI

AI总结 针对大语言模型遵循复杂指令的挑战,提出STAIF逐阶段优化框架,先通过偏好优化提高软约束敏感度,再用可验证奖励强化学习确保硬约束遵守,构建相关数据集,验证了该方法的设计并展现出领先性能和泛化能力。

Comments 16 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15095 2026-07-20 cs.CL cs.AI cs.MA 版本更新 79%

Digital Pantheon: Simulating and Auditing Coalition Formation with LLM Agents

数字万神殿:使用大语言模型智能体模拟和审计联盟形成

Dylan Van Mulders, Matthias Bogaert, Dirk Van den Poel

机构 * Ghent University(根特大学)

专题命中 偏好对齐 :alignment(abstract);RLHF(abstract);DPO(abstract);分类 cs.CL、cs.AI

AI总结 该研究针对政治联盟形成谈判,提出结合多种技术的多智能体框架,在弗拉芒选举中实施,通过引入相关拓扑、分数和检验使其可解释,模拟产生稳定结果,能可靠预测现实,提供了探索政党兼容性等的测试平台。

Comments 11 pages, 2 figures, 5 tables, To be published in the AIDEM Workshop proceedings of the ECML PKDD 2026 Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11228 2026-07-14 cs.CY cs.AI 新提交 79%

DeepBias: Adaptive In-depth Probing of Social Biases in LVLMs

深度偏差:对大型视觉语言模型中社会偏差的自适应深度探测

Anqi Li, Jie Zhang, Zhongqi Wang, Songkai Xue, Jiahao Wang, Shiguang Shan, Xilin Chen

专题命中 偏好对齐 :DPO(abstract,abstract_cn);safety(abstract);分类 cs.AI、cs.CY

AI总结 研究大型视觉语言模型中社会偏差问题,提出DeepBias自适应框架,通过“生成-演化-探测”循环及智能体深度探测偏差,构建DeepBiasBench基准,实验证明其有效性,为LVLM安全评估建立进化范式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19139 2026-07-07 cs.CL cs.AI 版本更新 79%

The Rise of Verbal Tics in Large Language Models: A Systematic Analysis Across Frontier Models

大语言模型中言语 tic 的兴起:前沿模型的系统分析

Shuai Wu, Xue Li, Yanna Feng, Yufang Li, Zhijun Wang, Ran Wang

机构 * Lead Researcher(研究员) Research Assistant(研究助理) Academic Advisor(学术顾问) Research Consultant(研究顾问)

专题命中 偏好对齐 :RLHF(abstract,abstract_cn);alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文系统分析了八个前沿大语言模型中言语 tic 的现象,通过定制评估框架评估10,000个提示,发现 Gemini 3.1 Pro tic 值最高,DeepSeek V3.2 最低,并揭示了 tic 在多轮对话中的累积效应及跨语言差异。

Comments 17 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07468 2026-07-07 cs.LG cs.CL cs.MA 版本更新 79%

Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models

通过在线自我博弈强化学习追踪移动目标以实现更安全的语言模型

Mickel Liu, Liwei Jiang, Yancheng Liang, Simon Shaolei Du, Yejin Choi, Tim Althoff, Natasha Jaques

专题命中 偏好对齐 :alignment(abstract);RLHF(abstract);safety(abstract);分类 cs.CL、cs.LG

AI总结 研究传统大语言模型安全对齐问题,引入Self-RedTeam算法,通过在线自我博弈多智能体强化学习持续共同进化攻防策略,有理论安全保障,实证效果好,推动从被动修补到主动协同进化转变。

Comments ICML 2026 Poster

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11082 2026-06-10 cs.CL cs.CY 新提交 79%

The Shibboleth Effect: Auditing the Cross-Lingual Distributional Skew of Large Language Models

示播列效应:审计大型语言模型的跨语言分布偏斜

Hakan Mehmetcik

机构 * Kellogg Institute for International Studies, University of Notre Dame(凯洛格国际研究学院,圣约翰大学) Marmara University(马尔马拉大学)

专题命中 偏好对齐 :RLHF(abstract,abstract_cn);alignment(abstract);分类 cs.CL、cs.CY

AI总结 本研究通过多智能体地缘政治兵棋推演,发现前沿LLM在跨语言条件下存在行为偏斜,且该效应依赖于模型架构与训练机制,而非西方起源模型的普遍属性。

Comments 25 pages, 2 figures, 6 tables, Research Article

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.23286 2026-06-09 cs.CV cs.AI cs.LG 版本更新 79%

VideoGPA: Distilling Geometry Priors for 3D-Consistent Video Generation

VideoGPA: 通过几何先验知识蒸馏实现3D一致的视频生成

Hongyang Du, Junjie Ye, Xiaoyan Cong, Runhao Li, Jingcheng Ni, Aman Agarwal, Zeqi Zhou, Zekun Li, Randall Balestriero, Yue Wang

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 偏好对齐 :DPO(abstract,abstract_cn);alignment(abstract);分类 cs.AI、cs.LG

AI总结 VideoGPA通过几何先验知识蒸馏提升视频生成的3D一致性,利用数据高效的自监督框架引导视频扩散模型,显著增强时间稳定性、几何合理性与运动一致性。

Comments 8 pages, 5 figures, ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.10515 2026-05-26 cs.LG cs.CL 79%

Adaptive Preference Optimization with Uncertainty-aware Utility Anchor

基于不确定性感知效用锚点的自适应偏好优化

Xiaobo Wang, Zixia Jia, Jiaqi Li, Qi Liu, Zilong Zheng

机构 * State Key Laboratory of Cognitive Intelligence, University of Science and Technology of China(认知智能国家重点实验室,中国科学技术大学) Institute of Artificial Intelligence, Hefei Comprehensive National Science Center(人工智能研究院,合肥综合性国家科学中心) State Key Laboratory of General Artificial Intelligence, BIGAI(通用人工智能国家重点实验室,BIGAI)

专题命中 偏好对齐 :DPO(abstract,abstract_cn);alignment(abstract);分类 cs.CL、cs.LG

AI总结 提出一种通用离线偏好优化框架UAPO,通过引入锚点函数估计偏好数据标注的不确定性,支持非配对数据训练,提升数据利用效率和训练鲁棒性。

Comments Accepted by EMNLP 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16345 2026-05-19 cs.LG cs.AI 79%

Goal-Conditioned Supervised Learning for LLM Fine-Tuning

面向目标的监督学习用于大语言模型微调

Shijun Li, Kaiwen Dong, Xiang Gao, Joydeep Ghosh

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) Intuit AI Research(Intuit人工智能研究)

专题命中 偏好对齐 :DPO(abstract,abstract_cn);alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文提出目标条件监督学习(GCSL)框架,通过将反馈信号作为显式目标,利用监督学习生成高质量响应,改进了传统监督微调和直接偏好优化的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.28010 2026-05-19 cs.LG cs.AI 79%

Learning from Disagreement: Clinician Overrides as Implicit Preference Signals for Clinical AI in Value-Based Care

从分歧中学习:临床医生的覆盖作为价值医疗中临床AI的隐含偏好信号

Prabhjot Singh, Abhishek Gupta, Chris Betz, Abe Flansburg, Brett Ives, Sudeep Lama, Jung Hoon Son

机构 * Altitude

专题命中 偏好对齐 :RLHF(abstract,abstract_cn);alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种框架,将临床医生对AI建议的覆盖视为隐含偏好数据,通过引入五类覆盖分类法和双学习架构,解决抑制偏差问题,以提升价值医疗中AI的决策能力。

Comments 22 pages, 2 tables, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08313 2026-05-12 cs.CR cs.AI cs.LG 79%

Seed Hijacking of LLM Sampling and Quantum Random Number Defense

LLM采样中的种子劫持与量子随机数防御

Ziyang You, Xiaoke Yang, Zhanling Fan, Feng Guo, Xiaogen Zhou, Xuxing Lu

机构 * School of Electronic, Electrical and Physics, Fujian University of Technology(福建工程学院电子、电气与物理系) School of Humanities, Fujian University of Technology(福建工程学院人文学院) Department of Investigation, Fujian Police College(福建警察学院调查系) Institute of Applied Physics and Materials Engineering, University of Macau(澳门大学应用物理与材料工程研究院)

专题命中 偏好对齐 :RLHF(abstract,abstract_cn);alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文提出SeedHijack攻击,通过操控PRNG输出实现指定token注入,提出基于量子随机数生成器的防御方案,解决LLM采样层的关键漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08037 2026-05-11 cs.LG cs.AI 79%

Beyond Pairs: Your Language Model is Secretly Optimizing a Preference Graph

超越成对:你的语言模型其实是在优化一个偏好图

Ning Liu, Chuanneng Sun, Kristina Klinkner, Shervin Malmasi

机构 * Amazon(亚马逊)

专题命中 偏好对齐 :DPO(abstract,abstract_cn);alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文提出GraphDPO,通过构建偏好图结构优化语言模型,解决传统成对优化在处理多轮次数据时的局限性,提升模型在推理和编程任务中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏