arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 30372 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 3227 篇

2512.23260 2026-01-06 cs.CL cs.AI cs.LG 90%

Interpretable Safety Alignment via SAE-Constructed Low-Rank Subspace Adaptation

通过SAE构造的低秩子空间适应实现可解释的安全对齐

Dianyun Wang, Qingsen Ma, Yuhu Shang, Zhifeng Lu, Zhenbo Xu, Lechen Ning, Huijia Wu, Zhaofeng He

机构 * Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 偏好对齐 :alignment(title,abstract);safety(title,abstract);RLHF(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 SAILS通过SAE构造低秩子空间实现安全对齐,提升安全性能并保持参数效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04210 2025-12-05 cs.AI cs.CL cs.CY 90%

Balancing Safety and Helpfulness in Healthcare AI Assistants through Iterative Preference Alignment

通过迭代偏好对齐平衡医疗AI助手的安全性与帮助性

Huy Nghiem, Swetasudha Panda, Devashish Khatwani, Huy V. Nguyen, Krishnaram Kenthapadi, Hal Daumé

机构 * University of Maryland(马里兰大学) Oracle Labs(Oracle实验室) Oracle Health AI(Oracle健康AI)

专题命中 偏好对齐 :alignment(title,abstract);safety(title,abstract);DPO(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 本文提出通过迭代偏好对齐框架提升医疗AI助手的安全性与帮助性,通过KTO和DPO优化改进模型,提升有害查询检测性能并平衡安全与效用。

Comments ML4H 2025 Proceedings, Best Paper Award

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03939 2025-11-07 cs.LG cs.AI cs.CL 90%

RLHF: A comprehensive Survey for Cultural, Multimodal and Low Latency Alignment Methods

Raghav Sharma, Manan Mehta, Sai Tiger Raina

机构 * Northeastern University(东北大学) University of Southern California(南加州大学)

专题命中 偏好对齐 :alignment(title,abstract);RLHF(title,abstract);DPO(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.00657 2025-10-22 cs.LG cs.AI cs.CY stat.ML 90%

LLM Safety Alignment is Divergence Estimation in Disguise

Rajdeep Haldar, Ziyi Wang, Qifan Song, Guang Lin, Yue Xing

机构 * Department of Statistics, Purdue University(普渡大学统计系) Department of Statistics, Michigan State University(密歇根州立大学统计系)

专题命中 偏好对齐 :alignment(title,abstract);safety(title,abstract);RLHF(abstract);分类 cs.AI、cs.CY、cs.LG

Comments Accepted to NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.18922 2025-05-22 cs.LG cs.AI cs.CL stat.ML 90%

DPO Meets PPO: Reinforced Token Optimization for RLHF

Han Zhong, Zikang Shan, Guhao Feng, Wei Xiong, Xinle Cheng, Li Zhao, Di He, Jiang Bian, Liwei Wang

机构 * Peking University(北京大学) University of Illinois Urbana-Champaign(伊利诺伊大学香槟分校) Microsoft Research Asia(微软亚洲研究院)

专题命中 偏好对齐 :RLHF(title,abstract);DPO(title,abstract);alignment(abstract);分类 cs.CL、cs.AI、cs.LG

Comments ICML 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.19544 2024-11-25 cs.AI cs.CL cs.LG math.OC stat.ML 90%

One-Shot Safety Alignment for Large Language Models via Optimal Dualization

Xinmeng Huang, Shuo Li, Edgar Dobriban, Osbert Bastani, Hamed Hassani, Dongsheng Ding

专题命中 偏好对齐 :alignment(title,abstract);safety(title,abstract);RLHF(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 32 pages, 6 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.10038 2024-04-02 cs.CL cs.AI cs.CV cs.LG 90%

RS-DPO: A Hybrid Rejection Sampling and Direct Preference Optimization Method for Alignment of Large Language Models

Saeed Khaki, JinJin Li, Lan Ma, Liu Yang, Prathap Ramachandra

专题命中 偏好对齐 :alignment(title,abstract);DPO(title,abstract);RLHF(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 16 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12330 2026-08-14 cs.CL 新提交 90%

Reliability-Aware Sexism Detection: Combining DPO with Annotator Agreement and Token-Level Confidence Scoring

感知可靠性的性别歧视检测:将DPO与标注者一致性及词元级置信度评分相结合

Hadi Mohammadi, Shihan Wang, Masoume M. Raeissi, Anastasia Giachanou

机构 * Utrecht University(乌得勒支大学) Wageningen University & Research(瓦赫宁根大学及研究中心)

专题命中 偏好对齐 :DPO(title,title_cn);分类 cs.CL

AI总结 该研究针对在线性别歧视检测的主观性问题,提出RA-DPO方法,结合标注者一致性等信号,在EXIST 2023数据集上验证其可降低训练成本并提升推理准确率。

Comments 11 pages, 4 figures. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11274 2026-08-13 cs.CR cs.AI 新提交 90%

Agent Safety Should Be a Runtime Contract

智能体安全应成为运行时契约

Albus W. Ng, Yi Han, Jusheng Zhang, Wenhao Wang

专题命中 偏好对齐 :safety(title,abstract);RLHF(abstract,abstract_cn);DPO(abstract,abstract_cn);AI safety(abstract)

AI总结 该研究指出将AI安全仅在训练阶段植入的范式不足,提出智能体安全应是兼具预防与证据层面的运行时契约,通过四类公开证据支撑该立场并给出研究议程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18304 2026-07-22 cs.LG 新提交 90%

TD-DPO: Difference-Aware Preference Optimization for Mitigating Sycophancy in Clinical Autism Intervention Dialogue

TD-DPO:用于减轻临床自闭症干预对话中谄媚行为的差异感知偏好优化

Shuzhong Lai, Junhong Lai, Chenxi Li, Qing Zhou, Haifeng Li, Gang Pan, Lin Yao, Yueming Wang

机构 * Nanhu Brain-Computer Interface Institute(南湖脑机接口研究所) MOE Frontiers Science Center for Brain and Brain-Machine Integration, Zhejiang University(浙江大学脑与脑机融合教育部前沿科学中心) College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) Children’s Hospital Zhejiang University School of Medicine(浙江大学医学院附属儿童医院) State Key Laboratory of Brain-Machine Intelligence(脑机智能技术国家重点实验室) Department of Neurobiology, Affiliated Mental Health Center and Hangzhou Seventh People’s Hospital, Zhejiang University School of Medicine(浙江大学医学院附属精神卫生中心和杭州市第七人民医院神经生物学系)

专题命中 偏好对齐 :DPO(title,title_cn);alignment(abstract);safety(abstract);分类 cs.LG

AI总结 研究针对大语言模型在自闭症干预对话中的谄媚问题,提出最小编辑数据增强策略及令牌级差异直接偏好优化方法,通过加权差异令牌、降权共享令牌抑制背景漂移,经实验验证该方法能在减轻谄媚与保留干预能力间达较好平衡。

Comments commited to EMNLP2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10601 2026-07-14 cs.AI 新提交 90%

Agentic-DPO: From Imitation to Agentic Policy Optimization on Expert Trajectories

Agentic-DPO:从专家轨迹上的模仿到智能体策略优化

Yixiong Chen, Alan Yuille

机构 * Johns Hopkins University(约翰·霍普金斯大学)

专题命中 偏好对齐 :DPO(title,title_cn);分类 cs.AI

AI总结 研究针对大语言模型智能体基于专家轨迹训练只学动作序列、难应对错误的问题,提出Agentic-DPO方法,通过转化专家轨迹为状态条件偏好监督,结合策略保持增强,实现低成本智能体策略优化,实验验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21089 2026-06-23 cs.AI 新提交 90%

Repeated post-training is not Self-improving: Diagnosing Scientific Amnesia in Continual DPO Pipelines

重复后训练并非自我改进:诊断持续DPO流水线中的科学健忘症

Jianzhe Lin, Fei Wang, Xiaolin Li, Rajeshkumar Golani, Jubin Chheda

机构 * MetaAI

专题命中 偏好对齐 :DPO(title,title_cn);分类 cs.AI

AI总结 针对工业LLM团队在持续DPO训练中遇到的性能退化问题,本文提出“科学健忘症”概念,并设计诊断套件、基于程序的流水线及基准测试,通过对比五种策略发现,结论高度依赖流水线设置和评估设计。

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07535 2026-06-09 cs.CL 新提交 90%

Multilingual Refusal Alignment for Safer Large Language Models

多语言拒绝对齐:构建更安全的大型语言模型

Aleksandra Krasnodębska, Wojciech Kusa, Aldo Lipani

机构 * NASK National Research Institute(国家研究 institute) University College London(伦敦大学学院)

专题命中 偏好对齐 :DPO(summary_cn,abstract);alignment(title,abstract);safety(abstract);分类 cs.CL

AI总结 本研究系统探究多语言对齐动态,通过引入覆盖12种欧洲语言的RefusEU数据集和DPO实验,发现仅用英语对齐不足以保障跨语言安全,而多语言训练可在不降低通用性能的前提下提升安全性。

Comments Accepted to Findings ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09260 2026-06-02 cs.CR cs.LG 90%

GREAT: Generalizable Backdoor Attacks in RLHF via Emotion-Aware Trigger Synthesis

GREAT: 通过情感感知触发器在RLHF中实现可泛化的后门攻击

Subrat Kishore Dutta, Yuelin Xu, Piyush Pant, Xiao Zhang

机构 * CISPA Helmholtz Center for Information Security(CISPA赫尔姆霍茨信息安全中心)

专题命中 偏好对齐 :RLHF(title,title_cn);分类 cs.LG

AI总结 提出GREAT框架,利用情感感知触发器在RLHF中构造自然分布后门,通过潜在空间聚类和多样性提示策略生成愤怒触发器,实现对未见触发器的泛化攻击。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08213 2026-05-26 cs.CV cs.AI 90%

EditCaption: Human-Refined SFT and HAE-DPO for Image Editing Instruction Synthesis

EditCaption: 用于图像编辑指令合成的人工精炼SFT与HAE-DPO

Xiangyuan Wang, Honghao Cai, Yunhao Bai, Chao Hui, Tianze Zhou, Haohua Chen, Hao Shi, Yuling Wu, Yao Hu, Xu Tang, Yibo Chen, Wei Zhu

机构 * Peking University(北京大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Tsinghua University(清华大学) Beihang University(北京航空航天大学) Xiaohongshu Inc.(小红书公司)

专题命中 偏好对齐 :DPO(title,title_cn);分类 cs.AI

AI总结 提出EditCaption两阶段后训练流程,通过人工精炼SFT和基于难度自适应错误感知DPO(HAE-DPO)提升图像编辑指令合成质量,显著降低关键错误率并超越现有模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20082 2026-05-20 cs.CV cs.AI 90%

VL-DPO: Vision-Language-Guided Finetuning for Preference-Aligned Autonomous Driving

VL-DPO:基于视觉语言的偏好对齐自动驾驶微调

Zhefan Xu, Ghassen Jerfel, Marina Haliem, Qi Zhao, Jeonhyung Kang, Khaled S. Refaat

机构 * Waymo

专题命中 偏好对齐 :DPO(title,title_cn);分类 cs.AI

AI总结 本文提出VL-DPO,一种基于视觉语言模型的框架,通过零样本推理生成偏好对来微调自动驾驶模型,以提升与人类驾驶偏好的对齐程度,实验表明该方法在RFS和ADE指标上均优于基线模型。

Comments Published in International Conference on Robotics and Automation (ICRA), 2026 8 pages, 6 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11121 2026-05-11 cs.CL 90%

BITS Pilani at SemEval-2026 Task 9: Structured Supervised Fine-Tuning with DPO Refinement for Polarization Detection

BITS Pilani 在 SemEval-2026 任务 9:基于 DPO 细调的结构化监督微调用于极化检测

Atharva Gupta, Dhruv Kumar, Yash Sinha

机构 * Birla Institute of Technology and Science, Pilani, India(比拉理工学院和科学学院,瓦拉纳西,印度)

专题命中 偏好对齐 :DPO(title,title_cn);分类 cs.CL

AI总结 本文提出结合结构化监督微调与 DPO 细调的方法,用于社交媒体文本中的极化检测,通过 LoRA 微调 Qwen 2.5-7B-Instruct 并利用自动偏好对减少误判,最终在英文测试集上达到 0.7664 的 Macro-F1 分数。

Comments Accepted to the 20th International Workshop on Semantic Evaluation (SemEval-2026), to be held in conjunction with ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20994 2026-05-21 cs.CL cs.AI 90%

Towards Context-Invariant Safety Alignment for Large Language Models

面向大语言模型的上下文不变安全对齐

Yixu Wang, Yang Yao, Xin Wang, Yifeng Gao, Yan Teng, Xingjun Ma, Yingchun Wang

机构 * Fudan University, Shanghai, China(复旦大学,上海,中国) Shanghai Artificial Intelligence Laboratory, Shanghai, China(上海人工智能实验室,上海,中国)

专题命中 偏好对齐 :alignment(title,abstract);safety(title,abstract);trustworthy(abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种上下文不变的安全对齐方法,通过引入锚点不变正则化(AIR)来提升模型在不同上下文中的鲁棒性,从而增强安全约束对对抗性框架的抵抗力。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01415 2026-05-05 cs.AI cs.CY 90%

AI Safety as Control of Irreversibility: A Systems Framework for Decision-Energy and Sovereignty Boundaries

AI安全作为不可逆性的控制:决策-能量和主权边界的系统框架

Wesley Shu, Peng Wei

机构 * The Institute of Energetic Paradigm(能量范式研究所)

专题命中 偏好对齐 :safety(title,abstract);AI safety(title,abstract);alignment(abstract);分类 cs.AI、cs.CY

AI总结 本文提出通过决策-能量密度模型,探讨AI安全问题的本质,强调通过主权边界控制防止单一高效节点释放不可逆权力,重构AI安全为分层控制与审查机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.20106 2026-02-05 cs.LG cs.AI 90%

Adaptive Helpfulness-Harmlessness Alignment with Preference Vectors

基于偏好向量的自适应有益有害对齐

Ren-Wei Liang, Chin-Ting Hsu, Chan-Hung Yu, Saransh Agrawal, Shih-Cheng Huang, Chieh-Yen Lin, Shang-Tse Chen, Kuan-Hao Huang, Shao-Hua Sun

机构 * National Taiwan University(国立台湾大学) Texas A&M University(德克萨斯A&M大学) Appier AI Research(Appier人工智能研究院) Graduate Institute of Communication Engineering, National Taiwan University(国立台湾大学通信工程研究所)

专题命中 偏好对齐 :alignment(title,abstract);harmlessness(title);RLHF(abstract);DPO(abstract)

AI总结 本文提出偏好向量框架,通过模块化方法实现细粒度的用户可控偏好调整,提升大语言模型的有益性和无害性平衡。

Comments Accepted at The 19th Conference of the European Chapter of the Association for Computational Linguistics (EACL 2026), Rabat, Morocco

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06108 2026-01-13 cs.AI cs.CL 90%

From RLHF to Direct Alignment: A Theoretical Unification of Preference Learning for Large Language Models

从RLHF到直接对齐:大型语言模型偏好学习的理论统一

Tarun Raheja, Nilay Pochhi

机构 * Independent Researchers(独立研究者)

专题命中 偏好对齐 :alignment(title,abstract);RLHF(title,abstract);DPO(abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种理论统一框架,将大型语言模型的偏好学习方法归结为三个正交轴上的原则性选择,揭示了不同方法之间的本质联系。

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.02575 2025-10-15 cs.CL cs.CR cs.LG 90%

Cross-Modal Safety Alignment: Is textual unlearning all you need?

Trishna Chakraborty, Erfan Shayegani, Zikui Cai, Nael Abu-Ghazaleh, M. Salman Asif, Yue Dong, Amit K. Roy-Chowdhury, Chengyu Song

机构 * University of California, Riverside(加州大学河滨分校)

专题命中 偏好对齐 :alignment(title,abstract);safety(title,abstract);RLHF(abstract);分类 cs.CL、cs.LG

Comments Accepted by EMNLP 2024 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.12030 2025-05-22 cs.CV cs.AI cs.CL 90%

SPA-VL: A Comprehensive Safety Preference Alignment Dataset for Vision Language Model

Yongting Zhang, Lu Chen, Guodong Zheng, Yifeng Gao, Rui Zheng, Jinlan Fu, Zhenfei Yin, Senjie Jin, Yu Qiao, Xuanjing Huang, Feng Zhao, Tao Gui, Jing Shao

机构 * University of Science and Technology of China(中国科学技术大学) Fudan University(复旦大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 偏好对齐 :alignment(title,abstract);safety(title,abstract);harmlessness(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.12485 2025-04-09 cs.CL cs.AI 90%

Safe at the Margins: A General Approach to Safety Alignment in Low-Resource English Languages -- A Singlish Case Study

Isaac Lim, Shaun Khoo, Roy Ka-Wei Lee, Watson Chua, Jia Yi Goh, Jessica Foo

专题命中 偏好对齐 :alignment(title,abstract);safety(title,abstract);DPO(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.06483 2024-12-10 cs.CL cs.AI 90%

SafeWorld: Geo-Diverse Safety Alignment

Da Yin, Haoyi Qiu, Kung-Hsiang Huang, Kai-Wei Chang, Nanyun Peng

专题命中 偏好对齐 :alignment(title,abstract);safety(title,abstract);DPO(abstract);分类 cs.CL、cs.AI

Comments Accepted by NeurIPS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19504 2025-11-26 cs.LG stat.ML 90%

Position: The Complexity of Perfect AI Alignment -- Formalizing the RLHF Trilemma

位置:完美AI对齐的复杂性——形式化RLHF三重困境

Subramanyam Sahoo, Aman Chadha, Vinija Jain, Divya Chaudhary

机构 * Berkeley AI Safety Initiative (BASIS), University of California, Berkeley(伯克利人工智能安全倡议(BASIS),加州大学伯克利分校) AWS Generative AI Innovation Center, Amazon Web Services(亚马逊网络服务生成式人工智能创新中心) Meta AI Stanford University(斯坦福大学) Northeastern University, Seattle, WA, USA(东北大学,西雅图,华盛顿州,美国)

专题命中 偏好对齐 :alignment(title,abstract);RLHF(title,abstract);safety(abstract);分类 cs.LG

AI总结 研究提出RLHF三重困境,指出在安全、公平和稳健之间存在根本性权衡,并通过复杂性分析证明实现全球代表性需要超多项式计算资源。

Comments Accepted at NeurIPS 2025 Workshop on Socially Responsible and Trustworthy Foundation Models (ResponsibleFM)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.10391 2025-02-17 cs.CL cs.CV 90%

MM-RLHF: The Next Step Forward in Multimodal LLM Alignment

Yi-Fan Zhang, Tao Yu, Haochen Tian, Chaoyou Fu, Peiyan Li, Jianshu Zeng, Wulin Xie, Yang Shi, Huanyu Zhang, Junkang Wu, Xue Wang, Yibo Hu, Bin Wen, Fan Yang, Zhang Zhang, Tingting Gao, Di Zhang, Liang Wang, Rong Jin, Tieniu Tan

专题命中 偏好对齐 :RLHF(title,abstract);alignment(title,abstract);safety(abstract);分类 cs.CL

Comments Project Page: https://mm-rlhf.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12158 2026-08-13 cs.CV 新提交 89%

Context Blindness in DPO: Mitigating Object Hallucination in MLLMs via Context-Calibrated Preference Optimization

DPO中的上下文盲区:通过上下文校准的偏好优化缓解多模态大语言模型(MLLMs)中的物体幻觉

Byungoh Ko, Jinyoung Park, Jongha Kim, Jeehye Na, Jaewon Cho, Hyunwoo J. Kim

机构 * Korea University(高丽大学) KAIST(韩国科学技术院)

专题命中 偏好对齐 :DPO(title,title_cn)

AI总结 本研究针对MLLMs的物体幻觉问题,提出C²-DPO方法,通过最大化上下文偏好增益降低幻觉率,使Qwen2-VL-Instruct-2B的幻觉率相对降低36%且不损害通用推理能力。

Comments Accepted at ECCV2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.18770 2026-08-07 cs.LG cs.AI cs.CL 89%

Reward Shaping to Mitigate Reward Hacking in RLHF

奖励塑造以缓解强化学习从人类反馈中的奖励黑客

Jiayi Fu, Xuandong Zhao, Chengyuan Yao, Heng Wang, Qi Han, Yanghua Xiao

机构 * Fudan University(复旦大学)

专题命中 偏好对齐 :RLHF(title,summary_cn);alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 PAR通过利用奖励模型中的潜在偏好信号,有效缓解RLHF中的奖励黑客问题,表现出更高的性能和数据效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13345 2026-08-14 cs.AI 新提交 89%

Rules or Character? Scaling Laws for AI Safety Design

规则还是特性?AI安全设计的缩放定律

Satoshi Takahashi, Nobuji Kouno, Masaaki Komatsu, Ryuji Hamamoto

专题命中 偏好对齐 :safety(title,abstract);AI safety(title);RLHF(abstract,abstract_cn);分类 cs.AI

AI总结 该研究构建模型分析AI安全的特性塑造与规则执行的资源分配,发现部署规模对最优分配影响较小,特性脆弱率才是主导因素,二者的最优值在大规模部署下会收敛。

Comments Accepted at AIES 2026 (9th AAAI/ACM Conference on AI, Ethics, and Society). 10 pages, 6 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏