arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 30405 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 3229 篇

2605.09959 2026-05-12 cs.LG cs.AI cs.CL cs.ET 83%

G-Zero: Self-Play for Open-Ended Generation from Zero Data

G-Zero:从零数据开始的自主开放生成自我学习

Chengsong Huang, Haolin Liu, Tong Zheng, Runpeng Dai, Langlin Huang, Jinyuan Li, Zongxia Li, Zhepei Wei, Yu Meng, Jiaxin Huang

机构 * Washington University in St. Louis(华盛顿大学圣路易斯分校) University of Virginia(弗吉尼亚大学) University of Maryland(马里兰大学) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 偏好对齐 :DPO(summary_cn,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 G-Zero通过无验证器的共进化框架实现自主改进,利用Hint-δ内在奖励量化生成模型在无辅助响应与带提示响应间的预测偏移,通过GRPO训练提出者模型持续针对生成器的盲区,同时通过DPO优化生成器内部化提示引导的改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00558 2026-04-02 cs.CV 83%

STAR: Mitigating Cascading Errors in Spatial Reasoning via Turn-point Alignment and Segment-level DPO

STAR:通过转弯点对齐和段级DPO缓解空间推理中的级联错误

Pukun Zhao, Longxiang Wang, Chen Chen, Peicheng Wang, Fanqing Zhou, Runze Li, Haojian Huang

机构 * Guangdong University of Finance and Economics(广东财经大学) Chongqing University(重庆大学) Westlake University(西湖大学) The University of Hong Kong(香港大学)

专题命中 偏好对齐 :alignment(title);DPO(title)

AI总结 本文提出STAR框架,通过拓扑锚点解决复杂拓扑中的级联错误问题,引入RedMaze-23K数据集并采用段级DPO提升长距离导航的自我修正能力,实验表明其32B版本在开源模型中表现最优。

Comments 9 pages, 6 figures, 4 tables, Accepted by ICME 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.10148 2025-07-22 cs.LG cs.AI cs.CL 83%

AlphaDPO: Adaptive Reward Margin for Direct Preference Optimization

Junkang Wu, Xue Wang, Zhengyi Yang, Jiancan Wu, Jinyang Gao, Bolin Ding, Xiang Wang, Xiangnan He

机构 * MoE Key Lab of BIPC, University of Science(BIPC联合实验室,科学与技术大学) Alibaba Group(阿里巴巴集团)

专题命中 偏好对齐 :alignment(abstract);RLHF(abstract);DPO(abstract);safety(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13209 2026-06-12 cs.LG cs.CL 新提交 83%

Understanding helpfulness and harmless tension in reward models

理解奖励模型中的有用性与无害性张力

Eshaan Tanwar, Pepa Atanasova

机构 * University of Copenhagen(哥本哈根大学)

专题命中 偏好对齐 :RLHF(abstract,abstract_cn);alignment(abstract,comments);harmlessness(abstract);分类 cs.CL、cs.LG

AI总结 通过激活分析和消融实验,发现奖励模型中有用性和无害性目标存在干扰,共享神经元对模型行为影响不成比例,导致对齐张力。

Comments The source code used in this study is publicly available at: https://github.com/EshaanT/RM-alignment\_tension

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.03799 2026-08-14 cs.CL 版本更新 83%

Natural Language Processing: A Comprehensive Practical Guide from Tokenisation to RLHF

自然语言处理:从分词到RLHF的全面实用指南

Mullosharaf K. Arabov

机构 * KAZAN (VOLGA REGION) FEDERAL UNIVERSITY INSTITUTE OF COMPUTATIONAL MATHEMATICS AND INFORMATION TECHNOLOGIES(卡赞(伏尔加地区)联邦大学计算数学与信息科技学院)

专题命中 偏好对齐 :RLHF(title,title_cn);分类 cs.CL

AI总结 本文系统指导现代NLP全流程,涵盖分词、向量化、大语言模型微调、检索增强生成及人类反馈强化学习,强调低资源语言处理与开源模型应用。

Comments 136 pages, 12 practical works, preprint. Textbook for senior undergraduates and graduate students. Original contributions on low-resource languages (Tajik, Tatar and other). Companion repository available

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18295 2026-08-04 cs.LG 版本更新 83%

On the Limits of Support-Preserving Alignment and Bounded Filtering

关于支持保持对齐和有界过滤的局限性

Aryan Dutt, Rui Mao, Anupam Chattopadhyay

专题命中 偏好对齐 :alignment(title,abstract);safety(abstract);分类 cs.LG

AI总结 研究在大语言模型中,重塑基础模型输出分布的对齐方案与有界安全过滤器结合能否消除有害行为。通过形式化设置并分析,发现有界过滤可能无法消除所有有害输出,实证评估显示有害输出率始终高于零。

Comments Withdrawn to allow a complete rewrite and substantial revision of the theoretical analysis and experiments

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20767 2026-07-24 cs.CL 新提交 83%

Rushes: A Human Preference Dataset for Pluralistic Alignment

Rushes:用于多元对齐的人类偏好数据集

Michael Xu, Jorge Leandro, Sudha Rao, Weijia Xu, Nebojsa Jojic, Gabriel DesGarennes, Chris Quirk, Bill Dolan

机构 * Microsoft Research(微软研究院)

专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract);分类 cs.CL

AI总结 该研究引入Rushes数据集,通过游戏界面收集用户与AI叙事交互数据。核心方法是分析用户选择模式,以量化非随机偏好。主要贡献是定位其为多元对齐诊断基准,揭示现有模型在捕捉个性化参与信号上的不足,助力相关研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16992 2026-06-02 cs.LG 83%

FIRM: Federated In-client Regularized Multi-objective Alignment for Large Language Models

FIRM: 面向大型语言模型的联邦客户端内正则化多目标对齐

Fatemeh Nourzad, Amirhossein Roknilamouki, Eylem Ekici, Jia Liu, Ness Shroff

机构 * Department of Electrical and Computer Engineering, The Ohio State University, Columbus, OH, USA(电气与计算机工程系,俄亥俄州立大学,哥伦布,OH,USA) Department of Computer Science and Engineering, The Ohio State University, Columbus, OH, USA(计算机科学与工程系,俄亥俄州立大学,哥伦布,OH,USA)

专题命中 偏好对齐 :alignment(title,abstract);harmlessness(abstract);分类 cs.LG

AI总结 提出FIRM算法,通过客户端内正则化缓解客户端分歧漂移并提高通信效率,实现联邦多目标对齐,并首次给出有限时间收敛保证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15204 2026-05-18 cs.AI 83%

SDOF: Taming the Alignment Tax in Multi-Agent Orchestration with State-Constrained Dispatch

SDOF:通过状态约束调度驯服多智能体编排中的对齐税

Zhantao Wang

机构 * Digital China(数字中国)

专题命中 偏好对齐 :alignment(title);RLHF(abstract,abstract_cn);分类 cs.AI

AI总结 SDOF通过状态约束调度框架,利用强化学习和有限状态自动机提升多智能体任务执行的准确性和可控性,验证了其在招聘系统中的有效性。

Comments 12 pages, 4 figures, 14 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11679 2026-05-14 cs.AI 83%

Explaining and Breaking the Safety-Helpfulness Ceiling via Preference Dimensional Expansion

通过偏好维度扩展解释并打破安全与有益性天花板

ShiYing Huang, Liang Lin, Yuer Li, Kaiwen Luo, Zhenhong Zhou, An Zhang, Junhao Dong, Kun Wang, Zhigang Zeng

机构 * Huazhong University of Science and Technology(华中科技大学) Nanyang Technological University(南洋理工大学) Tsinghua University(清华大学) Chongqing University(重庆大学)

专题命中 偏好对齐 :safety(title);alignment(abstract);harmlessness(abstract);分类 cs.AI

AI总结 本文提出MORA方法,通过多维奖励整合解决多目标对齐中的安全与有益性矛盾,实验显示在序列对齐中提升5%-12.4%,同时对齐中整体奖励提升4.6%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05946 2026-05-12 cs.LG stat.ML 83%

f-GRPO and Beyond: Divergence-Based Reinforcement Learning Algorithms for General LLM Alignment

f-GRPO 与 beyond:基于发散性的强化学习算法用于通用大语言模型对齐

Rajdeep Haldar, Lantao Mei, Guang Lin, Yue Xing, Qifan Song

机构 * Department of Statistics, Purdue University(普渡大学统计学系) Department of Statistics, Michigan State University(密歇根州立大学统计学系)

专题命中 偏好对齐 :alignment(title,abstract);safety(abstract);分类 cs.LG

AI总结 本文提出f-GRPO和f-HAL算法,通过发散性估计提升大语言模型对齐效果,在数学推理任务中改进GRPO并缓解奖励黑客问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06895 2026-05-11 cs.AI 83%

Mitigating Cognitive Bias in RLHF by Altering Rationality

通过调整理性度来缓解强化学习中的人类反馈认知偏差

Tiffany Horter, Andrew Markham, Niki Trigoni, Serena Booth

机构 * University of Oxford(牛津大学) Brown University(布朗大学)

专题命中 偏好对齐 :RLHF(title,abstract);分类 cs.AI

AI总结 本文提出通过动态调整理性参数beta来缓解人类反馈中的认知偏差,提升奖励学习模型的理性度,即使在存在强烈偏见的偏好数据集上也能获得更理性的下游模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23114 2026-04-21 cs.CL 83%

Alignment Data Map for Efficient Preference Data Selection and Diagnosis

用于高效偏好数据选择与诊断的对齐数据图

Seohyeong Lee, Eunwon Kim, Hwaran Lee, Buru Chang

机构 * Sogang University(ソガン大学) Upstage(アップステージ) Korea University(韩国大学)

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.CL

AI总结 本文提出对齐数据图,通过评估偏好数据的对齐分数,选择高质量低变异性样本,提升对齐效果并提高标注准确性。

Comments ACL 2026 Findings Camera-Ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11477 2026-04-14 cs.AI cs.SE q-fin.TR 83%

OOM-RL: Out-of-Money Reinforcement Learning Market-Driven Alignment for LLM-Based Multi-Agent Systems

OOM-RL:基于大语言模型多智能体系统的出钱强化学习市场驱动对齐

Kun Liu, Liqun Chen

专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract);分类 cs.AI

AI总结 本文提出OOM-RL方法,通过将智能体部署到金融市场中,利用资本耗尽作为不可篡改的负梯度,使多智能体系统从过度迎合的基线进化为稳健的流动性感知架构,最终实现稳定均衡。

Comments 13 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08326 2026-04-10 cs.AI 83%

ProMedical: Hierarchical Fine-Grained Criteria Modeling for Medical LLM Alignment via Explicit Injection

ProMedical:通过显式注入实现医疗大语言模型对齐的分层细粒度标准建模

He Geng, Yangmin Huang, Lixian Lai, Qianyun Du, Hui Chu, Zhiyang He, Jiaxue Hu, Xiaodong Tao

机构 * Xunfei Healthcare Technology Co., Ltd.(讯飞医疗科技有限公司)

专题命中 偏好对齐 :alignment(title,abstract);safety(abstract);分类 cs.AI

AI总结 本文提出ProMedical框架,通过显式注入细粒度临床标准,提升医疗大语言模型对齐效果,实验表明在安全性和准确性上均优于现有模型。

Comments ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06833 2026-04-09 cs.CR cs.LG 83%

FedDetox: Robust Federated SLM Alignment via On-Device Data Sanitization

FedDetox: 通过设备端数据净化实现鲁棒的联邦SLM对齐

Shunan Zhu, Jiawei Chen, Yonghao Yu, Hideya Ochiai

机构 * The University of Tokyo(东京大学)

专题命中 偏好对齐 :alignment(title,abstract);safety(abstract);分类 cs.LG

AI总结 FedDetox通过设备端数据净化技术,提升联邦学习中小型语言模型的安全对齐能力,保持模型安全性和通用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05135 2026-04-08 cs.CL cs.CE 83%

SenseAI: A Human-in-the-Loop Dataset for RLHF-Aligned Financial Sentiment Reasoning

SenseAI:一种用于RLHF对齐的金融情感推理的人机协同数据集

Berny Kabalisa

专题命中 偏好对齐 :RLHF(title,abstract);alignment(abstract);分类 cs.CL

AI总结 SenseAI通过整合推理链、置信度评分和市场结果,为金融情感推理提供RLHF对齐的数据支持,揭示模型行为中的系统性模式及改进机会。

Comments Dataset available on request (bernykabalisa18@gmail.com) See GitHub for dataset snapshot and automated data collection script demo https://github.com/bernykabalisa18-netizen/SenseAI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.12575 2026-04-07 cs.CV cs.AI 83%

BalancedDPO: Adaptive Multi-Metric Alignment

BalancedDPO:适应性多指标对齐

Dipesh Tamboli, Souradip Chakraborty, Aditya Malusare, Biplab Banerjee, Amrit Singh Bedi, Vaneet Aggarwal

机构 * Purdue University(普渡大学) University of Maryland(马里兰大学) Indian Institute of Technology Bombay(印度理工学院孟买分校) University of Central Florida(中佛罗里达大学)

专题命中 偏好对齐 :alignment(title,abstract);DPO(abstract);分类 cs.AI

AI总结 BalancedDPO通过多指标共识和动态参考模型更新,在DPO框架中实现多指标偏好对齐,提升模型在不同评估标准下的稳定性与性能。

Comments Transactions on Machine Learning Research, Apr 2026

Journal ref Transactions on Machine Learning Research, Apr 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01787 2026-04-03 cs.CL 83%

DEFT: Distribution-guided Efficient Fine-Tuning for Human Alignment

DEFT:基于分布的高效微调以实现人类对齐

Liang Zhu, Feiteng Fang, Yuelin Bai, Longze Chen, Zhexiang Zhang, Minghuan Tan, Min Yang

机构 * Southern University of Science and Technology(南方科技大学) Shenzhen Institute of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院) University of Science and Technology of China(中国科学技术大学) University of Copenhagen(哥本哈根大学)

专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract);分类 cs.CL

AI总结 本文提出DEFT框架,通过数据过滤和分布引导提升模型对齐效率与泛化能力,减少训练时间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25145 2026-03-27 cs.CV cs.LG 83%

Learning to Rank Caption Chains for Video-Text Alignment

学习排名图注链以实现视频-文本对齐

Ansel Blume, Burak Uzkent, Shalini Chaudhuri, Garin Kessler

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Amazon Prime Video(亚马逊Prime Video)

专题命中 偏好对齐 :alignment(title,abstract);DPO(abstract);分类 cs.LG

AI总结 本文提出通过重复图注退化生成大规模挑战性图注链,改进视频-文本对齐的排名优化方法,优于二元DPO并在长形式内容生成中表现更优,需对视觉编码器进行微调。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18507 2026-03-20 cs.AI 83%

Expert Personas Improve LLM Alignment but Damage Accuracy: Bootstrapping Intent-Based Persona Routing with PRISM

专家人设提升LLM对齐但损害准确性:基于PRISM的意图驱动人设路由 Bootstrapping

Zizhao Hu, Mohammad Rostami, Jesse Thomason

机构 * University of Southern California(南加州大学)

专题命中 偏好对齐 :alignment(title,abstract);safety(abstract);分类 cs.AI

AI总结 本文研究了专家人设在不同任务类型和提示长度下的有效性,提出PRISM框架通过自蒸馏实现意图条件的人设路由,提升生成任务的人类偏好对齐,同时保持判别任务的准确性,且计算开销低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04822 2026-03-06 cs.AI 83%

VISA: Value Injection via Shielded Adaptation for Personalized LLM Alignment

VISA: 通过屏蔽适应进行价值注入以实现个性化大语言模型对齐

Jiawei Chen, Tianzhuo Yang, Guoxi Zhang, Jiaming Ji, Yaodong Yang, Juntao Dai

机构 * Peking University(北京大学)

专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract);分类 cs.AI

AI总结 VISA通过屏蔽适应机制,有效缓解大语言模型对齐税,实现精细化价值观对齐与语义完整性保持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03827 2026-03-04 cs.CL 83%

STARS: Synchronous Token Alignment for Robust Supervision in Large Language Models

STARS: 同步标记对齐用于大语言模型中稳健的监督

Mohammad Atif Quamar, Mohammad Areeb, Mikhail Kuznetsov, Muslum Ozgur Ozmen, Z. Berkay Celik

机构 * Purdue University(普渡大学) Amazon(亚马逊) Arizona State University(亚利桑那州立大学)

专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract);分类 cs.CL

AI总结 STARS通过同步标记对齐方法提升大语言模型的对齐性能,实现稳健监督和高效系统吞吐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11661 2026-03-03 cs.AI 83%

Quark Medical Alignment: A Holistic Multi-Dimensional Alignment and Collaborative Optimization Paradigm

夸克医疗对齐:一种全面的多维对齐与协作优化范式

Tianxiang Xu, Jiayi Liu, Yixuan Tong, Jialu Xu, Yunqing Wei, Kaiwen Feng, PanPan Hou, Kangping Yin, Jiyuan Hu, Hao Zhou, Zhenxin Ma, Jian Xu, Guanjun Jiang

专题命中 偏好对齐 :alignment(title,abstract);safety(abstract);分类 cs.AI

AI总结 本文提出夸克医疗对齐范式,通过多维对齐矩阵和统一优化机制解决医疗问答中的对齐问题,实现正确性、安全性和合规性的协同优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20498 2026-02-26 cs.CL 83%

Robust Preference Alignment via Directional Neighborhood Consensus

通过方向邻域共识实现鲁棒偏好对齐

Ruochen Mao, Yuling Shi, Xiaodong Gu, Jiaheng Wei

专题命中 偏好对齐 :alignment(title,abstract);DPO(abstract);分类 cs.CL

AI总结 通过方向邻域共识实现鲁棒偏好对齐,提升模型在多样化偏好下的稳定性与可靠性。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13415 2026-02-17 cs.LG 83%

MAVIS: Multi-Objective Alignment via Inference-Time Value-Guided Selection

MAVIS: 通过推理时值引导选择实现多目标对齐

Jeremy Carleton, Debajoy Mukherjee, Srinivas Shakkottai, Dileep Kalathil

机构 * Department of Electrical and Computer Engineering, Texas A\&M University, College Station, Texas, USA(电气与计算机工程系,德克萨斯A&M大学,学院站,德克萨斯州,美国)

专题命中 偏好对齐 :alignment(title,abstract);harmlessness(abstract);分类 cs.LG

AI总结 MAVIS通过推理时值引导选择实现多目标对齐,通过训练小价值模型动态调整LLM输出,提升多目标平衡性能。

Comments 32 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11180 2026-02-13 cs.CL 83%

Mechanistic Interpretability for Large Language Model Alignment: Progress, Challenges, and Future Directions

大语言模型对齐的机制可解释性:进展、挑战与未来方向

Usman Naseem

机构 * Macquarie University(麦考瑞大学)

专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract);分类 cs.CL

AI总结 本文探讨了大语言模型对齐中机制可解释性的进展与挑战,提出未来研究方向,包括自动化可解释性、跨模型泛化和可解释性驱动的对齐技术。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08259 2026-02-10 stat.ML cs.LG 83%

A Statistical Framework for Alignment with Biased AI Feedback

带有偏见AI反馈的统计框架

Xintao Xia, Zhiqiu Xia, Linjun Zhang, Zhanrui Cai

机构 * Center for Data Science, Zhejiang University(浙江大学数据科学中心) Department of Electrical and Computer Engineering, Rutgers University(罗格斯大学电气与计算机工程系) Department of Statistics, Rutgers University(罗格斯大学统计学系) Faculty of Business and Economics, The University of Hong Kong(香港大学商学院)

专题命中 偏好对齐 :alignment(title,abstract);DPO(abstract);分类 cs.LG

AI总结 本文提出两种去偏对齐方法,DDPO通过残差修正和密度比重加权提升效率,DIPO直接估计人类偏好概率,实验证明其在情感生成、摘要和对话任务中提升了对齐效率并接近全人类标注数据性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06836 2026-02-09 cs.AI 83%

LLM Active Alignment: A Nash Equilibrium Perspective

LLM主动对齐:从纳什均衡视角出发

Tonghan Wang, Yuqi Pan, Xinyi Yang, Yanchen Jiang, Milind Tambe, David C. Parkes

机构 * College of AI, Tsinghua University, Beijing, China(人工智能学院,清华大学,北京,中国) Harvard University, Cambridge, MA, USA(哈佛大学,马萨诸塞州剑桥,美国) Department of Electronic Engineering, Tsinghua University, Beijing, China(电子工程系,清华大学,北京,中国)

专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract);分类 cs.AI

AI总结 本文提出了一种基于纳什均衡的LLM主动对齐方法,通过建模代理行为以避免文本空间计算难题,并展示其在社交媒体中防止政治排斥的应用潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06788 2026-02-09 cs.LG 83%

Displacement-Resistant Extensions of DPO with Nonconvex $f$-Divergences

对抗位移的DPO扩展:非凸f-散度

Idan Pipano, Shoham Sabach, Kavosh Asadi, Mohammad Ghavamzadeh

机构 * Faculty of Data and Decision Sciences(数据与决策科学学院) Technion - Israel Institute of Technology(技术ion-以色列理工学院) Meta Qualcomm AI Research(高通人工智能研究)

专题命中 偏好对齐 :DPO(title,abstract);RLHF(abstract);分类 cs.LG

AI总结 本文提出了一种对抗位移的DPO扩展方法,通过非凸f-散度改进了传统DPO,提供了更强的理论保证和实际表现。

Comments Published as a conference paper at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏