arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-03-24 至 2026-03-24 共收录 12 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全训练 12 篇

2603.08104 2026-03-24 cs.LG 85%

Invisible Safety Threat: Malicious Finetuning for LLM via Steganography

不可见的安全威胁:通过隐写术对LLM进行恶意微调

Guangnian Wan, Xinyin Ma, Gongfan Fang, Xinchao Wang

机构 * National University of Singapore(新加坡国立大学)

专题命中 安全训练 :safety(title,abstract);alignment(abstract);trustworthy(abstract);分类 cs.LG

AI总结 本文揭示了LLM中隐藏的安全威胁,通过隐写术在看似无害的回复中嵌入恶意内容,展示了对GPT-4.1及多个开源模型的攻击效果,验证了该方法的广泛适用性。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17017 2026-03-24 cs.CL 83%

SafeSearch: Do Not Trade Safety for Utility in LLM Search Agents

SafeSearch: 不应为效用而牺牲安全性的LLM搜索代理

Qiusi Zhan, Angeline Budiman-Chan, Abdelrahman Zayed, Xingzhi Guo, Daniel Kang, Joo-Kyung Kim

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Amazon(亚马逊)

专题命中 安全训练 :safety(title,abstract);alignment(abstract);分类 cs.CL

AI总结 本文研究了基于大语言模型的搜索代理在安全与效用之间的平衡问题,提出SafeSearch方法通过多目标强化学习提升安全性和效用,实验表明其显著降低有害输出并保持问答性能。

Comments EACL 2026 Findings. Code available at https://github.com/amazon-science/SafeSearch

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14602 2026-03-24 cs.CL cs.AI cs.LG 82%

PA3: Policy-Aware Agent Alignment through Chain-of-Thought

PA3: 通过链式推理实现政策感知的智能体对齐

Shubhashis Roy Dipta, Daniel Bis, Kun Zhou, Lichao Wang, Benjamin Z. Yao, Chenlei Guo, Ruhi Sarikaya

机构 * University of Maryland, Baltimore County(马里兰大学巴尔的摩分校) Amazon Alexa AI(亚马逊Alexa AI)

专题命中 安全训练 :alignment(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出一种多阶段对齐方法,通过链式推理让模型在推理时回忆并应用相关业务政策,无需在上下文中包含完整政策,同时引入PolicyRecall奖励和hallucination惩罚,提升性能并减少字数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20206 2026-03-24 cs.CL cs.AI 81%

Enhancing Safety of Large Language Models via Embedding Space Separation

通过嵌入空间分离增强大语言模型的安全性

Xu Zhao, Xiting Wang, Weiran Shen

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学首都人工智能学院)

专题命中 安全训练 :safety(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出嵌入空间分离方法,通过扩大有害与安全表示间的距离提升大语言模型安全性,同时保持模型通用能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21975 2026-03-24 cs.CR cs.AI cs.CL cs.LG 80%

SecureBreak -- A dataset towards safe and secure models

SecureBreak -- 一个面向安全和安全模型的数据集

Marco Arazzi, Vignesh Kumar Kembu, Antonino Nocera

机构 * Department of Electrical, Computer Biomedical Engineering, University of Pavia, Italy\ .

专题命中 安全训练 :alignment(abstract);safety(abstract);prompt injection(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出SecureBreak数据集,用于检测由安全对齐残余弱点引起的有害大语言模型输出,通过手动标注确保可靠性,并在多个风险类别中有效检测不安全内容。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20994 2026-03-24 cs.AI cs.GT cs.LG 62%

The Intelligent Disobedience Game: Formulating Disobedience in Stackelberg Games and Markov Decision Processes

智能不服从游戏:在Stackelberg游戏和马尔可夫决策过程中建模不服从

Benedikt Hornig, Reuth Mirsky

机构 * Independent Researcher(独立研究者) Tufts University(塔夫茨大学)

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出智能不服从游戏(IDG),通过Stackelberg游戏框架建模人类与辅助体的不对称信息交互,分析多步场景中的最优策略,揭示如'安全陷阱'等战略现象,为开发安全非合规学习算法和研究人类对不服从AI的信任提供数学基础。

Comments Accepted for presentation at the Rebellion and Disobedience in AI (RaD-AI) at AAMAS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21810 2026-03-24 eess.SY cs.MA cs.RO cs.SY 50%

Partial Attention in Deep Reinforcement Learning for Safe Multi-Agent Control

深度强化学习中多智能体控制的安全部分注意力

Turki Bin Mohaya, Peter Seiler

机构 * Department of Electrical Engineering and Computer Science at the University of Michigan(密歇根大学电气工程与计算机科学系)

专题命中 安全训练 :safety(abstract)

AI总结 本文提出在多智能体安全控制中应用注意力机制,设计神经网络控制高速公路汇入场景的自动驾驶车辆,通过部分注意力提升安全性和效率。

Comments This work has been accepted for publication in the proceedings of the 2026 American Control Conference (ACC), New Orleans, Louisiana, USA

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21427 2026-03-24 cs.SE 50%

Dynasto: Validity-Aware Dynamic-Static Parameter Optimization for Autonomous Driving Testing

Dynasto:面向自动驾驶测试的有效性感知动态-静态参数优化

Dmytro Humeniuk, Mohammad Hamdaqa, Houssem Ben Braiek, Amel Bennaceur, Foutse Khomh

专题命中 安全训练 :safety(abstract)

AI总结 Dynasto通过联合优化初始场景参数和动态对抗行为,发现更多真实安全关键故障,揭示自动驾驶系统中的弱点。

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21142 2026-03-24 cs.RO 50%

Dynamic Control Barrier Function Regulation with Vision-Language Models for Safe, Adaptive, and Realtime Visual Navigation

动态控制屏障函数调节与视觉-语言模型用于安全、适应性和实时视觉导航

Jeffrey Chen, Rohan Chandra

机构 * Department of Computer Science, University of Virginia(弗吉尼亚大学计算机科学系)

专题命中 安全训练 :safety(abstract)

AI总结 本文提出AlphaAdj框架,利用视觉-语言模型动态调整控制屏障函数参数,以实现在动态环境中安全、高效和实时的导航。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20658 2026-03-24 cs.RO 50%

Speedup Patch: Learning a Plug-and-Play Policy to Accelerate Embodied Manipulation

加速补丁:学习一种插件式策略以加快具身操作

Zhichao Wu, Junyin Ye, Zhilong Zhang, Yihao Sun, Haoxin Lin, Jiaheng Luo, Haoxiang Ren, Lei Yuan, Yang Yu

机构 * National Key Laboratory for Novel Software Technology, Nanjing University, China School of Artificial Intelligence, Nanjing University, China Mila-Quebec AI Institute \& Université de Montréal, Canada

专题命中 安全训练 :safety(abstract)

AI总结 本文提出Speedup Patch,一种轻量且策略无关的框架,通过仅使用离线数据实现插件式加速,通过约束马尔可夫决策过程优化调度器,提升执行效率而不牺牲任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20356 2026-03-24 cs.LO cs.CR cs.FL 50%

Agentproof: Static Verification of Agent Workflow Graphs

Agentproof: 静态验证代理工作流图

Melwin Xavier, Vaisakh M A, Melveena Jolly, Midhun Xavier

专题命中 安全训练 :safety(abstract)

AI总结 Agentproof通过提取四个主流代理框架的统一抽象图模型,应用六种结构检查并生成见证轨迹,评估时间安全策略,实现无需手动建模的静态验证,发现工作流中的结构缺陷和政策违规。

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.15674 2026-03-24 eess.SY cs.SY 50%

Safe and Stable Formation Control with Autonomous Multi-Agents Using Adaptive Control (Extended Version)

使用自适应控制的自主多智能体安全稳定编队控制(扩展版)

Jose A. Solano-Castellanos, Peter A. Fisher, Anuradha Annaswamy

专题命中 安全训练 :safety(abstract)

AI总结 本文提出结合自适应控制、控制屏障函数和连接图的方法,解决多智能体系统在动态不确定性和通信限制下的稳定与安全编队控制问题,通过自适应控制确保稳定性,安全过滤器生成安全指令,参考模型实现无不确定情况下的编队控制。

Comments Accepted to Modeling, Estimation and Control Conference (MECC) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏