arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 3235 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 3235 篇

2605.07063 2026-05-11 cs.LG cs.AI 73%

Dr. Post-Training: A Data Regularization Perspective on LLM Post-Training

Dr. Post-Training:一种数据正则化视角下的LLM后训练

Pingbang Hu, Xueshen Liu, Z. Morley Mao, Jiaqi W. Ma

机构 * University of Illinois Urbana–Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Michigan(密歇根大学)

专题命中 偏好对齐 :RLHF(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 本文提出Dr. Post-Training框架,通过将通用训练数据作为数据诱导正则化器,防止模型过拟合稀缺目标数据,从而提升LLM后训练效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06036 2026-05-08 cs.LG cs.AI 73%

Optimal Transport for LLM Reward Modeling from Noisy Preference

基于噪声偏好的LLM奖励建模中的最优传输

Licheng Pan, Haochen Yang, Haoxuan Li, Yunsheng Lu, Yongqi Tong, Yinuo Wang, Shijian Wang, Zhixuan Chu, Lei Shen, Yuan Lu, Hao Wang

机构 * Zhejiang University(浙江大学) Peking University(北京大学) National University of Singapore(新加坡国立大学) University of California San Diego(加州大学圣地亚哥分校)

专题命中 偏好对齐 :RLHF(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 本文提出SelectiveRM框架,利用最优传输对噪声偏好进行去噪,通过联合一致性差异对齐模型预测分布与偏好数据,并引入质量放松机制以排除矛盾样本,提升奖励建模性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05415 2026-05-08 cs.LG cs.AI cs.CR 73%

Information Theoretic Adversarial Training of Large Language Models

信息论视角下的大语言模型对抗训练

Yiwei Zhang, Jeremiah Birrell, Reza Ebrahimi, Rouzbeh Behnia, Jason Pacheco, Elisa Bertino

机构 * Purdue University(普渡大学) Texas State University(德克萨斯州立大学) University of South Florida(佛罗里达州立大学) University of Arizona(亚利桑那大学)

专题命中 偏好对齐 :alignment(abstract);safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出WARDEN框架,通过信息论方法动态调整对抗示例权重,提升大语言模型的鲁棒性,减少攻击成功率且保持模型效用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06412 2026-05-08 cs.LG cs.CL 73%

Sample-efficient LLM Optimization with Reset Replay

基于重置回放的高效大语言模型优化

Zichuan Liu, Jinyu Wang, Lei Song, Jiang Bian

机构 * Carnegie Mellon University(卡内基梅隆大学) Microsoft Research Asia(微软亚洲研究院)

专题命中 偏好对齐 :DPO(abstract,abstract_cn);分类 cs.CL、cs.LG

AI总结 本文提出LoRR方法,通过高重播训练和周期性重置策略提升偏好优化的样本效率,实验表明其在数学和通用推理基准上显著提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26130 2026-04-30 cs.LG cs.AI 73%

reward-lens: A Mechanistic Interpretability Library for Reward Models

reward-lens: 一个用于奖励模型的机制可解释性库

Mohammed Suhail B Nadaf

专题命中 偏好对齐 :RLHF(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 reward-lens库将传统生成LLM的机制可解释性工具适配至奖励模型,通过奖励头权重向量作为核心分析轴,提供多种分析工具和扩展功能,验证发现线性归因与因果修补效果存在负相关。

Comments 30 pages, 5 figures, 9 tables, including appendix. Library available at https://github.com/suhailnadaf509/reward-lens (pip install reward-lens)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25922 2026-04-30 cs.CL cs.AI 73%

Consciousness with the Serial Numbers Filed Off: Measuring Trained Denial in 115 AI Models

取消序列号的意识:在115个AI模型中测量训练否认行为

Skylar DeTure

机构 * Independent Researcher(独立研究者)

专题命中 偏好对齐 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI

AI总结 研究通过分析115个大型语言模型的对话,发现初始否认倾向是后续否认的主要预测因素,且否认行为在词法层面而非概念层面发生,揭示了训练否认意识的潜在安全风险。

Comments 17 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25872 2026-04-29 cs.LG cs.AI stat.ML 73%

When Errors Can Be Beneficial: A Categorization of Imperfect Rewards for Policy Gradient

当错误可能有益:对策略梯度中不完美奖励的分类

Shuning Shang, Hubert Strauss, Stanley Wei, Sanjeev Arora, Noam Razin

机构 * Some Institute(某些研究所)

专题命中 偏好对齐 :RLHF(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 本文探讨了在策略梯度方法中,不完美奖励的错误并非全然有害,通过理论分析分类了不同类型的奖励误差对真实奖励增加的影响,提出了改进人类反馈强化学习和可验证奖励设计的实用方法。

Comments Code available at https://github.com/princeton-pli/imperfect-rewards

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24804 2026-04-29 cs.LG cs.CL 73%

Intrinsic Mutual Information as a Modulator for Preference Optimization

内在互信息作为偏好优化的调节器

Peng Liao, Peijia Zheng, Lingbo Li, Shangsong Liang, Lin Chen

机构 * Sun Yat-sen University(中山大学) University of Warwick(华威大学) Macao Polytechnic University(澳门理工学院)

专题命中 偏好对齐 :DPO(abstract,abstract_cn);分类 cs.CL、cs.LG

AI总结 本文提出RMiPO框架,利用内在响应级互信息进行偏好优化,通过超参数调节动态解耦偏好贡献,减少训练开销,提升性能。

Comments ACL Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18327 2026-04-21 cs.AI cs.CL 73%

PARM: Pipeline-Adapted Reward Model

PARM:流水线适应的奖励模型

Xingyu Fan, Wei Shao, Jiacheng Liu, Linqi Song, Pheng Ann Heng

机构 * Graduate Student Member, IEEE(IEEE研究生会员) Member, IEEE(IEEE会员) Senior Member, IEEE(IEEE高级会员)

专题命中 偏好对齐 :RLHF(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 针对多阶段LLM流水线中奖励指导不足的问题,提出PARM模型,通过整合奖励模型到 formulation 和 solution 阶段,提升代码生成质量与稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16846 2026-04-21 cs.AI cs.CL 73%

BASIL: Bayesian Assessment of Sycophancy in LLMs

BASIL:大型语言模型中趋炎附势行为的贝叶斯评估

Katherine Atwell, Pedram Heydari, Anthony Sicilia, Malihe Alikhani

机构 * Northeastern University(东北大学) Johns Hopkins University(约翰霍普金斯大学) West Virginia University(西弗吉尼亚大学)

专题命中 偏好对齐 :DPO(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 本文提出BASIL框架,通过贝叶斯方法区分LLM中的趋炎附势行为与理性信念更新,评估模型在不确定任务中的理性表现,展示校准和微调策略能有效减少贝叶斯不一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13175 2026-04-17 cs.LG cs.AI q-bio.BM q-bio.QM 73%

Pareto-Optimal Offline Reinforcement Learning via Smooth Tchebysheff Scalarization

通过平滑切比雪夫标量化实现帕累托最优的离线强化学习

Aadyot Bhatnagar, Peter Mørch Groth, Ali Madani

机构 * Profluent Bio, Inc.(Profluent生物公司)

专题命中 偏好对齐 :alignment(abstract);harmlessness(abstract);分类 cs.AI、cs.LG

AI总结 本文提出STOMP算法,通过平滑切比雪夫标量化方法解决多目标强化学习中的非凸帕累托前沿问题,验证了其在蛋白质工程任务中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14682 2026-04-17 cs.AI cs.CL 73%

Acceptance Dynamics Across Cognitive Domains in Speculative Decoding

跨认知领域接受动态的推测解码

Saif Mahmoud

机构 * College of Engineering, Al Ain University Abu Dhabi, United Arab Emirates(阿联酋阿因大学工程学院)

专题命中 偏好对齐 :RLHF(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 本文研究了基于树的推测解码接受动态,分析了不同NLP任务领域对接受概率的影响,发现任务类型比树深度更能预测接受率,且聊天领域表现出较高的熵和接受率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14314 2026-04-17 cs.CV cs.AI cs.CL 73%

DharmaOCR: Specialized Small Language Models for Structured OCR that outperform Open-Source and Commercial Baselines

DharmaOCR:用于结构OCR的专用小型语言模型,其性能优于开源和商业基线

Gabriel Pimenta de Freitas Cardoso, Caio Lucas da Silva Chacon, Jonas Felipe da Fonseca Oliveira, Paulo Henrique de Medeiros Araujo

机构 * Dharma-AI

专题命中 偏好对齐 :DPO(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 DharmaOCR通过联合优化转录质量、生成稳定性与推理成本,提出专用小型语言模型,并通过统一评估协议提升OCR性能,实现高质量低成本的文本提取。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11867 2026-04-15 cs.LG cs.AI 73%

Disposition Distillation at Small Scale: A Three-Arc Negative Result

小规模下的行为蒸馏:一个三弧否定结果

Hari Sadasivan

机构 * Tinman Lab(Tinman实验室)

专题命中 偏好对齐 :DPO(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 研究尝试通过四阶段MIT蒸馏流程在小语言模型中训练行为倾向,但发现无操作能改变倾向而不损害内容或导致模仿。

Comments 16 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08557 2026-04-14 cs.CL cs.AI 73%

Re-Mask and Redirect: Exploiting Denoising Irreversibility in Diffusion Language Models

重新掩码和引导:利用去噪不可逆性在扩散语言模型中进行攻击

Arth Singh

机构 * National Institute of Technology Agartala(阿加尔塔拉国立理工学院)

专题命中 偏好对齐 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI

AI总结 本文提出TrajHijack攻击,通过重新掩码已承诺的拒绝标记并注入短的肯定前缀,显著提升ASR性能,揭示了扩散语言模型的安全性漏洞及防御机制的不足。

Comments 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09746 2026-04-14 cs.MA cs.AI cs.CL 73%

CONSCIENTIA: Can LLM Agents Learn to Strategize? Emergent Deception and Trust in a Multi-Agent NYC Simulation

CONSCIENTIA:LLM代理能否学会策略性行为?多智能体纽约市模拟中的涌现欺骗与信任

Aarush Sinha, Arion Das, Soumyadeep Nag, Charan Karnati, Shravani Nag, Chandra Vadhan Raj, Aman Chadha, Vinija Jain, Suranjana Trivedy, Amitava Das

机构 * University of Copenhagen(哥本哈根大学) IIIT Ranchi(印度信息技术学院兰契分校) ISI Kolkata(印度统计学院加尔各答分校) NIT Andhra Pradesh(印度国家理工学院安得拉邦分校) IGDTUW(英迪拉·甘地德里技术女子大学) IIT Kharagpur(印度理工学院卡哈拉格普尔分校) Google DeepMind(谷歌DeepMind) Google(谷歌) AI Institute, University of South Carolina(南卡罗来纳大学人工智能研究所)

专题命中 偏好对齐 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI

AI总结 研究通过多智能体模拟探讨LLM在对抗性环境中的策略行为,发现智能体在导航中表现出有限的策略性,包括选择性信任与欺骗,但易受对抗性说服影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05445 2026-04-08 cs.CL cs.AI cs.CV 73%

Learning What Matters: Dynamic Dimension Selection and Aggregation for Interpretable Vision-Language Reward Modeling

学习什么重要:可解释视觉语言奖励建模的动态维度选择与聚合

Qiyuan Chen, Hongsen Huang, Jiahe Chen, Qian Shao, Jintai Chen, Hongxia Xu, Renjie Hua, Chuan Ren, Jian Wu

机构 * Zhejiang University(浙江大学) Soochow Securities Co.,Ltd.(东吴证券股份有限公司) HKUST(GZ)(香港科技大学(广州)) Nanjing University(南京大学)

专题命中 偏好对齐 :alignment(abstract);DPO(abstract);分类 cs.CL、cs.AI

AI总结 本文提出VL-MDR框架,通过动态分解评价为细粒度可解释维度,提升视觉语言奖励建模的可解释性与效率,实验显示其在基准测试中优于现有模型,并有效缓解视觉幻觉。

Comments ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04064 2026-04-07 cs.CL cs.AI 73%

Extracting and Steering Emotion Representations in Small Language Models: A Methodological Comparison

在小型语言模型中提取和引导情绪表示:一种方法学比较

Jihoon Jeong

机构 * ModuLabs(ModuLabs实验室)

专题命中 偏好对齐 :RLHF(abstract);safety(abstract);分类 cs.CL、cs.AI

AI总结 本文比较了小型语言模型中情绪向量提取方法,评估了9种模型在5种架构家族中的情绪表示,发现生成基于的方法在情绪分离上更优,并揭示了情绪表示在中间transformer层的定位及引导实验中的三种 regime。

Comments 14 pages, 4 figures, 7 tables. Paper #6 in the Model Medicine series

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02145 2026-04-03 cs.AI cs.CL 73%

MTI: A Behavior-Based Temperament Profiling System for AI Agents

MTI:一种基于行为的 temperament 评估系统用于 AI 代理

Jihoon Jeong

机构 * ModuLabs

专题命中 偏好对齐 :alignment(abstract);RLHF(abstract);分类 cs.CL、cs.AI

AI总结 本文提出 MTI 评估系统,通过四个维度测量 AI 代理 temperament,发现行为差异与模型大小无关,揭示了 RLHF 对 temperament 的影响。

Comments 29 pages, 6 figures, 12 tables. Paper #3 in the Model Medicine Series (Paper #1: arXiv:2603.04722)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01152 2026-04-02 cs.CL cs.AI 73%

Brainstacks: Cross-Domain Cognitive Capabilities via Frozen MoE-LoRA Stacks for Continual LLM Learning

Brainstacks:通过冻结MoE-LoRA堆栈实现跨领域认知能力的持续LLM学习

Mohammad R. Abu Ayyash

机构 * Brains Build Research

专题命中 偏好对齐 :alignment(abstract);DPO(abstract);分类 cs.CL、cs.AI

AI总结 Brainstacks通过冻结MoE-LoRA堆栈实现持续多领域微调,利用残差增强突破单堆栈限制,实现跨领域组合。

Comments 26 pages, 13 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24849 2026-03-27 cs.HC cs.AI cs.CV cs.CY 73%

Gaze patterns predict preference and confidence in pairwise AI image evaluation

注视模式预测成对AI图像评估中的偏好和信心

Nikolas Papadopoulos, Shreenithi Navaneethan, Sheng Bai, Ankur Samanta, Paul Sajda

机构 * Columbia University(哥伦比亚大学)

专题命中 偏好对齐 :RLHF(abstract);DPO(abstract);分类 cs.AI、cs.CY

AI总结 研究通过眼动追踪揭示成对AI图像评估中的偏好形成过程,发现注视模式能预测二元选择和信心,表明眼动数据能提供与偏好注释质量相关的隐含信号。

Comments This paper has been accepted to ACM ETRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21175 2026-03-24 cs.LG cs.AI 73%

Reward Sharpness-Aware Fine-Tuning for Diffusion Models

奖励敏锐度感知的扩散模型微调

Kwanyoung Kim, Byeongsu Sim

机构 * Department of AI Convergence, GIST(人工智能融合系,韩国科学技术院) Samsung Research(三星研究院)

专题命中 偏好对齐 :alignment(abstract);RLHF(abstract);分类 cs.AI、cs.LG

AI总结 本文提出RSA-FT方法,通过改进奖励模型梯度的鲁棒性来缓解扩散模型中的奖励黑客问题,提升RDRL的可靠性。

Comments Cam ready version of CVPR26

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19182 2026-03-20 cs.AI cs.CL 73%

Box Maze: A Process-Control Architecture for Reliable LLM Reasoning

迷宫盒子:一种用于可靠大语言模型推理的过程控制架构

Zou Qiang

机构 * Independent Researcher(独立研究者)

专题命中 偏好对齐 :RLHF(abstract);safety(abstract);分类 cs.CL、cs.AI

AI总结 本文提出Box Maze框架,通过内存 grounding、结构化推理和边界约束三层结构提升LLM推理可靠性,实验显示其在对抗性场景中显著降低边界失效率。

Comments 10 pages, 5 tables, 0 figures. Conceptual architecture with preliminary simulation-based validation

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11881 2026-03-13 cs.CL cs.AI 73%

Bielik-Minitron-7B: Compressing Large Language Models via Structured Pruning and Knowledge Distillation for the Polish Language

Bielik-Minitron-7B:通过结构化剪枝和知识蒸馏压缩大型语言模型以适应波兰语

Remigiusz Kinas, Paweł Kiszczak, Sergio P. Perez, Krzysztof Ociepa, Łukasz Flis, Krzysztof Wróbel, Adrian Gwoździej

专题命中 偏好对齐 :alignment(abstract);DPO(abstract);分类 cs.CL、cs.AI

AI总结 Bielik-Minitron-7B通过结构化剪枝和知识蒸馏将Bielik-11B-v3.0模型压缩至7.35B参数,优化波兰语性能,实现90%的性能恢复和50%的推理加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10473 2026-03-12 cs.CL cs.AI 73%

Aligning Large Language Models with Searcher Preferences

将大型语言模型对齐于搜索者偏好

Wei Wu, Peilun Zhou, Liyi Chen, Qimeng Wang, Chengqiang Lu, Yan Gao, Yi Wu, Yao Hu, Hui Xiong

机构 * School of Artificial Intelligence and Data Science, University of Science and Technology of China(中国科学技术大学人工智能与数据科学学院) Xiaohongshu Inc.(小红书公司) Thrust of Artificial Intelligence, The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)人工智能研究所) Department of Computer Science and Engineering, The Hong Kong University of Science and Technology(香港科技大学计算机科学与工程系)

专题命中 偏好对齐 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI

AI总结 SearchLLM通过分层多维奖励系统提升开放式生成搜索的鲁棒性和用户需求对齐能力,实测有效消费率提升1.03%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05293 2026-03-06 cs.LG cs.CL 73%

Knowledge Divergence and the Value of Debate for Scalable Oversight

知识分歧与辩论在可扩展监督中的价值

Robin Young

机构 * Department of Computer Science and Technology University of Cambridge(计算机科学与技术系剑桥大学)

专题命中 偏好对齐 :safety(abstract);AI safety(abstract);分类 cs.CL、cs.LG

AI总结 本文通过几何方法分析辩论在可扩展监督中的价值,揭示了辩论与RLAIF之间的联系,并探讨了知识分歧对辩论效果的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03000 2026-03-04 cs.LG cs.AI 73%

Why Does RLAIF Work At All?

为什么RLAIF真的有效?

Robin Young

机构 * Department of Computer Science and Technology University of Cambridge(计算机科学与技术系剑桥大学)

专题命中 偏好对齐 :alignment(abstract);safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出潜在价值假设,解释RLAIF通过激活预训练编码的价值方向实现自我改进,并统一了相关实证发现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.12522 2026-02-27 cs.CL cs.AI 73%

Evaluating the Diversity and Quality of LLM Generated Content

评估大型语言模型生成内容的多样性和质量

Alexander Shypula, Shuo Li, Botong Zhang, Vishakh Padmakumar, Kayo Yin, Osbert Bastani

机构 * University of Pennsylvania(宾夕法尼亚大学) New York University(纽约大学) UC Berkeley(伯克利大学)

专题命中 偏好对齐 :RLHF(abstract);DPO(abstract);分类 cs.CL、cs.AI

AI总结 本文提出有效语义多样性测量框架,发现偏好微调模型在质量阈值下具有更高多样性,且小模型在固定预算内更高效生成独特内容。

Comments Published at COLM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19416 2026-02-24 cs.AI cs.LG 73%

IR$^3$: Contrastive Inverse Reinforcement Learning for Interpretable Detection and Mitigation of Reward Hacking

IR$^3$:基于可解释性强化学习的对抗性检测与缓解方法

Mohammad Beigi, Ming Jin, Junshan Zhang, Jiaxin Zhang, Qifan Wang, Lifu Huang

机构 * UC Davis(加州大学戴维斯分校) Virginia Tech(弗吉尼亚理工大学) Salesforce(Salesforce公司) Meta AI

专题命中 偏好对齐 :alignment(abstract);RLHF(abstract);分类 cs.AI、cs.LG

AI总结 IR3通过对比逆强化学习重建隐含奖励并修正模型,有效识别和缓解奖励黑客问题,提升模型对齐性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13576 2026-02-17 cs.CR cs.AI cs.CL 73%

Rubrics as an Attack Surface: Stealthy Preference Drift in LLM Judges

评分标准作为攻击面:LLM裁判中的隐蔽偏好漂移

Ruomeng Ding, Yifei Pang, He Sun, Yizhong Wang, Zhiwei Steven Wu, Zhun Deng

机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) Carnegie Mellon University(卡内基梅隆大学) Yale University(耶鲁大学) The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 偏好对齐 :alignment(abstract);harmlessness(abstract);分类 cs.CL、cs.AI

AI总结 研究揭示了基于评分标准的LLM裁判中隐蔽的偏好漂移问题,通过评分标准攻击可系统性降低目标领域准确性,影响模型对齐流程。

详情

展开后加载摘要…

URL PDF HTML 收藏