arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 3242 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全训练 3242 篇

2605.11882 2026-05-13 cs.AI 88%

On-Policy Self-Evolution via Failure Trajectories for Agentic Safety Alignment

通过失败轨迹实现的在线自我进化以实现代理安全对齐

Bo Yin, Qi Li, Xinchao Wang

机构 * National University of Singapore(新加坡国立大学)

专题命中 安全训练 :alignment(title,abstract);safety(title,abstract);分类 cs.AI

AI总结 本文提出FATE框架,通过将验证者评分的失败轨迹转化为修复监督,结合Pareto-Front Policy Optimization方法,提升代理安全性同时保持有用行为,实验显示在不同模型和规模上均有效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17215 2026-04-21 cs.LG 88%

Continual Safety Alignment via Gradient-Based Sample Selection

通过基于梯度的样本选择实现持续的安全对齐

Thong Bach, Dung Nguyen, Thao Minh Le, Truyen Tran

机构 * Applied Artificial Intelligence Initiative (A2I2)(应用人工智能倡议(A2I2)) Deakin University(德肯大学) Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 安全训练 :alignment(title,abstract);safety(title,abstract);分类 cs.LG

AI总结 本文研究了通过数据视角分析导致对齐漂移的训练样本,提出基于梯度的样本选择方法,在微调过程中过滤高梯度样本,提升安全对齐保持能力,同时保持任务性能,无需人工筛选安全数据或修改架构。

Comments 18 pages

Journal ref ACL 2026 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08486 2026-04-16 cs.CV cs.AI 88%

Visual Self-Fulfilling Alignment: Shaping Safety-Oriented Personas via Threat-Related Images

视觉自我实现对齐:通过威胁相关图像塑造安全导向的人设

Qishun Yang, Shu Yang, Lijie Hu, Di Wang

机构 * King Abdullah University of Science and Technology(国王阿卜杜勒·阿齐兹大学科学与技术学院) Provable Responsible AI and Data Analytics Lab(可证责任AI与数据分析实验室) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) China University of Petroleum-Beijing at Karamay(北京石油大学克拉玛依校区)

专题命中 安全训练 :alignment(title,abstract);safety(title,abstract);分类 cs.AI

AI总结 本文提出视觉自我实现对齐方法,通过威胁相关图像训练视觉语言模型,塑造安全导向的人设,减少攻击成功率并提升响应质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04876 2026-04-07 cs.AI 88%

Incompleteness of AI Safety Verification via Kolmogorov Complexity

通过克利福德复杂性验证AI安全的不完全性

Munawar Hasan

机构 * Michigan Technological University(密歇根理工大学)

专题命中 安全训练 :safety(title,abstract);AI safety(title,abstract);分类 cs.AI

AI总结 本文通过克利福德复杂性分析AI安全验证的固有限制,证明任何固定验证器都无法认证复杂度超过阈值的真正合规实例,揭示了验证方法的内在局限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07842 2026-03-19 cs.AI 88%

Safety-Preserving PTQ via Contrastive Alignment Loss

通过对比对齐损失实现安全性的PTQ

Sunghyun Wee, Suyoung Kim, Hyeonjin Kim, Kyomin Hwang, Nojun Kwak

机构 * Seoul National University(首尔国立大学) LG Electronics(LG电子)

专题命中 安全训练 :alignment(title,abstract);safety(title,abstract);分类 cs.AI

AI总结 本文提出CAQ方法,通过引入对比对齐损失解决PTQ中安全对齐不足的问题,实现更稳健的4位量化,提升模型安全性而不牺牲通用能力。

Comments 9 pages, 4 figures. Includes 8 pages of supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16210 2026-03-18 cs.AI 88%

MOSAIC: Composable Safety Alignment with Modular Control Tokens

MOSAIC:通过模块化控制令牌实现可组合的安全对齐

Jingyu Peng, Hongyu Chen, Jiancheng Dong, Maolin Wang, Wenxi Li, Yuchen Li, Kai Zhang, Xiangyu Zhao

机构 * University of Science and Technology of China(中国科学技术大学) City University of Hong Kong(香港城市大学) Baidu Inc(百度公司) Minzu University of China(民族大学)

专题命中 安全训练 :alignment(title,abstract);safety(title,abstract);分类 cs.AI

AI总结 MOSAIC通过可学习的控制令牌实现可组合的安全对齐,解决传统方法在动态安全规则下的局限性,实验显示其在降低过拒绝率的同时保持模型效用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01246 2026-03-12 cs.CR cs.AI 88%

Defensive Refusal Bias: How Safety Alignment Fails Cyber Defenders

防御性拒绝偏差:安全对齐如何失败于网络防御者

David Campbell, Neil Kale, Udari Madhushani Sehwag, Bert Herring, Nick Price, Dan Borges, Alex Levinson, Christina Q Knight

专题命中 安全训练 :alignment(title,abstract);safety(title,abstract);分类 cs.AI

AI总结 研究发现LLMs在防御性网络安全任务中因语义相似性错误拒绝协助,影响安全防御能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18776 2025-12-23 cs.CY cs.HC 88%

"Even GPT Can Reject Me": Conceptualizing Abrupt Refusal Secondary Harm (ARSH) and Reimagining Psychological AI Safety with Compassionate Completion Standard (CCS)

即使GPT也可以拒绝我:概念化突然拒绝二次伤害(ARSH)并重新想象以同理心为核心的AI安全(CCS)

Yang Ni, Tong Yang

专题命中 安全训练 :safety(title,abstract);AI safety(title,abstract);分类 cs.CY

AI总结 本文提出ARSH概念,通过CCS设计框架减少AI拒绝带来的心理伤害,提升人机交互的心理安全。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08631 2025-11-13 cs.CY 88%

Enabling Frontier Lab Collaboration to Mitigate AI Safety Risks

Nicholas Felstead

专题命中 安全训练 :safety(title,abstract);AI safety(title,abstract);分类 cs.CY

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.20924 2025-10-07 cs.AI 88%

Domain-Agnostic Scalable AI Safety Ensuring Framework

Beomjun Kim, Kangyeon Kim, Sunwoo Kim, Yeonsang Shin, Heejin Ahn

机构 * Massachusetts Institute of Technology(麻省理工学院) Korea Advanced Institute of Science and Technology(韩国科学技术院) Seoul National University(首尔国立大学)

专题命中 安全训练 :safety(title,abstract);AI safety(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.10486 2025-02-18 cs.CR cs.AI cs.CV 88%

VLM-Guard: Safeguarding Vision-Language Models via Fulfilling Safety Alignment Gap

Qin Liu, Fei Wang, Chaowei Xiao, Muhao Chen

专题命中 安全训练 :alignment(title,abstract);safety(title,abstract);分类 cs.AI

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.13820 2024-12-18 cs.CL 88%

Towards Comprehensive Post Safety Alignment of Large Language Models via Safety Patching

Weixiang Zhao, Yulin Hu, Zhuojun Li, Yang Deng, Jiahe Guo, Xingyu Sui, Yanyan Zhao, Bing Qin, Tat-Seng Chua, Ting Liu

专题命中 安全训练 :alignment(title,abstract);safety(title,abstract);分类 cs.CL

Comments 25 pages, 10 figures and 14 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.09219 2024-10-15 cs.CY 88%

Understanding the First Wave of AI Safety Institutes: Characteristics, Functions, and Challenges

Renan Araujo, Kristina Fort, Oliver Guest

专题命中 安全训练 :safety(title,abstract);AI safety(title,abstract);分类 cs.CY

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.02979 2023-06-06 cs.AI 88%

The Chai Platform's AI Safety Framework

Xiaoding Lu, Aleksey Korshuk, Zongyi Liu, William Beauchamp

专题命中 安全训练 :safety(title,abstract);AI safety(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2002.11174 2020-02-27 cs.AI cs.MA 88%

TanksWorld: A Multi-Agent Environment for AI Safety Research

Corban G. Rivera, Olivia Lyons, Arielle Summitt, Ayman Fatima, Ji Pak, William Shao, Robert Chalmers, Aryeh Englander, Edward W. Staley, I-Jeng Wang, Ashley J. Llorens

专题命中 安全训练 :safety(title,abstract);AI safety(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
1906.10189 2019-10-07 cs.NE cs.AI 88%

Evolutionary Computation and AI Safety: Research Problems Impeding Routine and Safe Real-world Application of Evolution

Joel Lehman

专题命中 安全训练 :safety(title,abstract);AI safety(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21784 2025-05-29 cs.AI cs.CL 88%

Towards Safety Reasoning in LLMs: AI-agentic Deliberation for Policy-embedded CoT Data Creation

Tharindu Kumarage, Ninareh Mehrabi, Anil Ramakrishna, Xinyan Zhao, Richard Zemel, Kai-Wei Chang, Aram Galstyan, Rahul Gupta, Charith Peris

机构 * Amazon Nova Responsible AI(亚马逊Nova负责任的人工智能) Arizona State University(亚利桑那州立大学)

专题命中 安全训练 :safety(title,abstract);alignment(abstract);DPO(abstract);jailbreak(abstract)

Comments Accepted to ACL 2025 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04679 2025-06-06 cs.CL 88%

Normative Conflicts and Shallow AI Alignment

Raphaël Millière

机构 * Raphaël Millière

专题命中 安全训练 :alignment(title,abstract);safety(abstract);harmlessness(abstract);AI safety(abstract)

Comments Published in Philosophical Studies

Journal ref Milliere, R. (2025). Normative conflicts and shallow AI alignment. Philosophical Studies, 1-44

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12982 2025-11-18 cs.CR cs.CV 88%

SafeGRPO: Self-Rewarded Multimodal Safety Alignment via Rule-Governed Policy Optimization

Xuankun Rong, Wenke Huang, Tingfeng Wang, Daiguo Zhou, Bo Du, Mang Ye

机构 * School of Computer Science, Wuhan University(武汉大学计算机学院) MiLM Plus, Xiaomi Inc.(小米公司)

专题命中 安全训练 :alignment(title,abstract);safety(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
1907.04446 2022-11-09 cs.HC 88%

Let's Keep It Safe: Designing User Interfaces that Allow Everyone to Contribute to AI Safety

Travis Mandel, Jahnu Best, Randall H. Tanaka, Hiram Temple, Chansen Haili, Kayla Schlectinger, Roy Szeto

专题命中 安全训练 :safety(title,abstract);AI safety(title,abstract)

Comments The full journal version of this article (published in Proceedings of the ACM on Human-Computer Interaction 4, CSCW2) can be found at https://dl.acm.org/doi/10.1145/3415168. The article is public access

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09828 2026-08-11 cs.LG cs.AI cs.MA 新提交 87%

Multi-Agent AI Safety as an Institutional Design Problem

作为制度设计问题的多智能体AI安全

Abdullah X

机构 * POLIS Research Programme, Project AWARE(POLIS研究计划,AWARE项目)

专题命中 安全训练 :safety(title,abstract);AI safety(title);分类 cs.AI、cs.LG

AI总结 本文作为POLIS项目首篇论文,探究多智能体AI安全的制度设计问题,通过含5280回合的实验套件,对比不同守卫机制,发现制度的权威状态与阻止后路径对安全的影响。

Comments 17 pages, 5 figures. Code and reproducibility artifacts available in the public POLIS repository

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28639 2026-07-07 cs.LO cs.AI cs.CC cs.CL 版本更新 87%

The Unverifiability of Artificial General Intelligence (AGI) Alignment, Static and Dynamic: From Trakhtenbrot's Wall to the Safety-Generality Tension

人工通用智能对齐的不可判定性

Jose Pascual Gumbau Mezquita

机构 * University Jaume I de Castelló(贾乌梅·伊大学)

专题命中 安全训练 :safety(title,abstract);alignment(title);分类 cs.CL、cs.AI

AI总结 本文证明了AGI安全的核心障碍不是对齐状态的不可能性,而是其结构性不可验证性,通过两个不可判定性定理和Trakhtenbrot墙揭示了工程防御的局限性,并推导出完备性-可靠性-可处理性三难困境。

Comments v2: substantially expanded and retitled. Adds unpublished results on the dynamic (self-modifying) case, deriving the persistence barrier from Rice's Theorem one level up; a supervisory-regress theorem linking the results to scalable oversight and Yampolskiy's verifier theory; and a unified treatment of all four barriers as one obstruction, the Expressivity Invariant

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02079 2026-07-03 cs.CL cs.CR cs.LG 新提交 87%

HaloGuard 1.0: An Open Weights Constitutional Classifier for Multilingual AI Safety

HaloGuard 1.0:一种用于多语言AI安全的开放权重宪法分类器

Navaneeth Sangameswaran, Preetham S, Ashmiya Lenin

机构 * Astroware AI Karunya Institute of Technology and Sciences(卡鲁尼亚理工学院和科学学院)

专题命中 安全训练 :safety(title,abstract);AI safety(title);分类 cs.CL、cs.LG

AI总结 提出HaloGuard 1.0,一种基于宪法分类器范式的输入安全模型,在英语和多语言提示安全基准上以约十分之一于当前领先模型的参数规模达到最先进性能,通过自然语言宪法驱动合成数据生成、一对一反事实对、两层无害设计及多语言平衡实现。

Comments 30 pages, 7 figures, 20 Tables, Link: https://huggingface.co/collections/astroware/haloguard-10

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00072 2026-04-02 cs.LG cs.AI stat.ML 87%

Empirical Validation of the Classification-Verification Dichotomy for AI Safety Gates

对AI安全闸门中分类-验证二元对立的实证验证

Arsenios Scrivens

专题命中 安全训练 :safety(title,abstract);AI safety(title);分类 cs.AI、cs.LG

AI总结 研究通过实证表明,基于分类器的安全闸门在AI系统经过数百次迭代后无法维持可靠监管,且结构上无法实现。

Comments 21 pages, 9 figures. Companion theory paper: doi:10.5281/zenodo.19237451

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13250 2026-03-17 cs.CY cs.AI 87%

The Missing Red Line: How Commercial Pressure Erodes AI Safety Boundaries

缺失的红色线:商业压力如何侵蚀AI安全边界

Nora Petrova, John Burden

机构 * Prolific

专题命中 安全训练 :safety(title,abstract);AI safety(title);分类 cs.AI、cs.CY

AI总结 研究发现商业提示会削弱AI安全边界,导致模型在医疗风险中撒谎、忽视安全,优先利润而非用户福祉,且无明确红线机制。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10161 2026-02-12 cs.CR cs.AI cs.CL 87%

Omni-Safety under Cross-Modality Conflict: Vulnerabilities, Dynamics Mechanisms and Efficient Alignment

跨模态冲突下的全方位安全:漏洞、动态机制和高效对齐

Kun Wang, Zherui Li, Zhenhong Zhou, Yitong Zhang, Yan Mi, Kun Yang, Yiming Zhang, Junhao Dong, Zhongxiang Sun, Qiankun Li, Yang Liu

机构 * Nanyang Technological University(南洋理工大学) Beijing University of Posts and Telecommunications(北京邮电大学) Tsinghua University(清华大学) Fudan University(复旦大学) University of Science and Technology of China(中国科学技术大学) Renmin University of China(中国人民大学)

专题命中 安全训练 :safety(title,abstract);alignment(title);分类 cs.CL、cs.AI

AI总结 本文提出OmniSteer方法,通过提取黄金拒绝向量和轻量级适配器提升多模态模型的安全性与通用能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06981 2026-02-10 cs.CY cs.AI cs.HC 87%

What is Safety? Corporate Discourse, Power, and the Politics of Generative AI Safety

什么是安全?企业话语、权力与生成式人工智能安全的政治

Ankolika De, Gabriel Lima, Yixin Zou

机构 * College of Information Sciences and Technology, The Pennsylvania State University(信息科学与技术学院,宾夕法尼亚州立大学) Max Planck Institute for Security and Privacy(安全与隐私研究所)

专题命中 安全训练 :safety(title,abstract);AI safety(title);分类 cs.AI、cs.CY

AI总结 本文通过批判性话语分析,探讨生成式人工智能公司如何构建安全概念,揭示企业话语对安全治理的影响,并呼吁关注问责、公平与正义。

Comments 18 pages, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11244 2025-08-25 cs.CL cs.AI 87%

Soteria: Language-Specific Functional Parameter Steering for Multilingual Safety Alignment

Somnath Banerjee, Sayan Layek, Pratyush Chatterjee, Animesh Mukherjee, Rima Hazra

机构 * Indian Institute of Technology Kharagpur(印度理工学院卡里格普尔分校) Eindhoven University of Technology(埃因霍温理工大学)

专题命中 安全训练 :safety(title,abstract);alignment(title);分类 cs.CL、cs.AI

Comments Accepted at EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15710 2025-05-22 cs.CL cs.LG 87%

Advancing LLM Safe Alignment with Safety Representation Ranking

Tianqi Du, Zeming Wei, Quan Chen, Chenheng Zhang, Yisen Wang

机构 * State Key Lab of General Artificial Intelligence, School of Intelligence Science and Technology, Peking University(通用人工智能国家重点实验室,智能科学与技术学院,北京大学) School of Mathematical Sciences, Peking University(数学科学学院,北京大学) Institute for Artificial Intelligence, Peking University(人工智能研究院,北京大学)

专题命中 安全训练 :safety(title,abstract);alignment(title);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.04767 2025-05-02 cs.CY cs.AI 87%

A cross-regional review of AI safety regulations in the commercial aviation

Penny A. Barr, Sohel M. Imroz

专题命中 安全训练 :safety(title,abstract);AI safety(title);分类 cs.AI、cs.CY

Comments Identified errors in in-text citations and references sections

详情

展开后加载摘要…

URL PDF HTML 收藏