arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-04-02 至 2026-04-02 共收录 9 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全训练 9 篇

2604.00072 2026-04-02 cs.LG cs.AI stat.ML 87%

Empirical Validation of the Classification-Verification Dichotomy for AI Safety Gates

对AI安全闸门中分类-验证二元对立的实证验证

Arsenios Scrivens

专题命中 安全训练 :safety(title,abstract);AI safety(title);分类 cs.AI、cs.LG

AI总结 研究通过实证表明,基于分类器的安全闸门在AI系统经过数百次迭代后无法维持可靠监管,且结构上无法实现。

Comments 21 pages, 9 figures. Companion theory paper: doi:10.5281/zenodo.19237451

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00228 2026-04-02 cs.CL 79%

Do Language Models Know When They'll Refuse? Probing Introspective Awareness of Safety Boundaries

语言模型是否知道何时会拒绝?探测安全边界内的自我意识

Tanay Gondil

机构 * Purdue University(普渡大学)

专题命中 安全训练 :safety(title,abstract);分类 cs.CL

AI总结 研究探讨语言模型能否准确预测自身拒绝行为,通过系统分析发现模型在安全边界处敏感度下降,且通过置信度评分可提升安全部署的准确性。

Comments 11 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00992 2026-04-02 eess.SY cs.SY 78%

Tube-Based Safety for Anticipative Tracking in Multi-Agent Systems

基于管状的安全性用于多智能体系统中的前瞻性跟踪

Armel Koulong, Ali Pakniyat

专题命中 安全训练 :safety(title,abstract)

AI总结 本文提出了一种基于管状的安全框架,用于非线性Brunovsky多智能体系统在有界扰动下的鲁棒前瞻性跟踪,通过建立反馈增强的辅助控制策略的安全证书,避免了传统的Lipschitz界可行性条件,从而得到显式的鲁棒正不变管半径,减少约束保守性并保持正式的前向不变性。

Comments This work has been submitted to the 65th IEEE Conference on Decision and Control for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22514 2026-04-02 eess.SY cs.SY 78%

Robust Multi-Agent Safety via Tube-Based Tightened Exponential Barrier Functions

通过管状紧缩指数屏障函数实现多智能体系统鲁棒安全性

Armel Koulong, Ali Pakniyat

专题命中 安全训练 :safety(title,abstract)

AI总结 本文提出一种构造性框架,用于合成非线性多智能体系统在有界扰动下的可证明安全控制器。核心贡献是通过约束紧缩方法将鲁棒误差反馈与名义轨迹规划相结合,利用RPI管的几何特性推导状态依赖的安全余量,从而保证轨迹安全性。

Comments Joint submission to IFAC World Congress 2026 and NAHS journal (Reference: NAHS_101717). Accepted for NAHS journal; under review by World Congress

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00627 2026-04-02 cs.CR 67%

When Safe Models Merge into Danger: Exploiting Latent Vulnerabilities in LLM Fusion

当安全模型融合进入危险:在LLM融合中利用潜在漏洞

Jiaqing Li, Zhibo Zhang, Shide Zhou, Yuxi Li, Tianlong Yu, Kailong Wang

专题命中 安全训练 :alignment(abstract);safety(abstract)

AI总结 研究揭示模型融合引入的新攻击面,提出TrojanMerge框架通过约束优化问题攻击安全对齐,实验显示融合模型产生高危害响应,源模型保持安全。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00248 2026-04-02 cs.CL cs.AI 62%

REM-CTX: Automated Peer Review via Reinforcement Learning with Auxiliary Context

REM-CTX:通过强化学习与辅助上下文实现的自动化同行评审

Pawin Taechoyotin, Daniel E. Acuna

机构 * University of Colorado Boulder(科罗拉多大学博尔德分校)

专题命中 安全训练 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 REM-CTX通过强化学习与辅助上下文提升同行评审质量,实验显示其在多个领域中优于基线模型,且在质量和上下文关联性指标上表现突出。

Comments 12 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10030 2026-04-02 cs.MA cs.LG 57%

Multi-agent In-context Coordination via Decentralized Memory Retrieval

通过去中心化记忆检索实现多智能体上下文协调

Tao Jiang, Zichuan Lin, Lihe Li, Yi-Chen Li, Cong Guan, Lei Yuan, Zongzhang Zhang, Yang Yu, Deheng Ye

机构 * National Key Laboratory of Novel Software Technology, Nanjing University(南京大学计算机软件新技术国家重点实验室) School of Artificial Intelligence, Nanjing University(南京大学人工智能学院) Tencent(腾讯)

专题命中 安全训练 :alignment(abstract);分类 cs.LG

AI总结 本文提出MAICC方法,通过去中心化记忆检索提升多智能体强化学习中任务协调效率,实验表明其在Level-Based Foraging和SMAC等基准上表现更优。

Journal ref Proceedings of the AAAI Conference on Artificial Intelligence, Vol. 40, No. 27, pp. 22363-22371, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27051 2026-04-02 eess.SY cs.SY 50%

Proprioceptive feedback paradigm for safe and resilient motion control

本体反馈范式用于安全且稳健的运动控制

Mrdjan Jankovic

专题命中 安全训练 :safety(abstract)

AI总结 本文提出一种类本体反馈机制用于运动控制系统,通过快速反馈环路补偿意外响应,分析了可管理的损伤程度,并提供了全MPF和分MPF两种方案。

Comments 8 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22690 2026-04-02 cs.CV 50%

Ar2Can: An Architect and an Artist Leveraging a Canvas for Multi-Human Generation

Ar2Can:利用画布进行多人体生成的架构与艺术家

Shubhankar Borse, Phuc Pham, Farzad Farhadzadeh, Seokeon Choi, Phong Ha Nguyen, Anh Tuan Tran, Sungrack Yun, Munawar Hayat, Fatih Porikli

机构 * Qualcomm AI Research, an initiative of Qualcomm Technologies, Inc.(高通人工智能研究院,高通技术公司旗下)

专题命中 安全训练 :alignment(abstract)

AI总结 Ar2Can提出一种两阶段框架,通过分离空间规划与身份渲染,解决多人体生成中人脸身份丢失问题,采用空间引导的面部匹配奖励提升生成质量,使用合成数据实现高精度和保真度。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏