arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 3248 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全训练 3248 篇

2604.27358 2026-05-01 cs.AI 79%

Safe Bilevel Delegation (SBD): A Formal Framework for Runtime Delegation Safety in Multi-Agent Systems

安全双层委托(SBD):一种用于多智能体系统运行时委托安全性的正式框架

Yuan Sun

机构 * Jilin University(吉林大学)

专题命中 安全训练 :safety(title,abstract);分类 cs.AI

AI总结 本文提出SBD框架,通过双层优化问题在运行时动态调整安全与效率的权衡,理论证明了安全单调性、内政策收敛性和责任传播界,应用于医疗AI、金融风险控制和教育代理监督领域。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27166 2026-05-01 cs.LG cs.GT 79%

Distributional Alignment Games for Answer-Level Fine-Tuning

分布对齐博弈用于答案级微调

Mehryar Mohri, Jon Schneider, Yifan Wu

机构 * Google Research(谷歌研究) Microsoft Research(微软研究)

专题命中 安全训练 :alignment(title,abstract);分类 cs.LG

AI总结 本文提出分布对齐博弈框架,通过策略与目标的博弈达到答案级优化,统一了多样性与自改进方法,提升数学推理任务效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17342 2026-04-30 cs.LG 79%

A Survey of Safe Reinforcement Learning and Constrained MDPs: A Technical Survey on Single-Agent and Multi-Agent Safety

安全强化学习与约束马尔可夫决策过程的综述:单智能体和多智能体安全的技术综述

Ankita Kushwaha, Kiran Ravish, Preeti Lamba, Pawan Kumar

机构 * International Institute of Information Technology, Hyderabad, India(国际信息科技研究所,印度海得拉巴) Meta SuperIntelligence, USA(Meta超智能,美国)

专题命中 安全训练 :safety(title,abstract);分类 cs.LG

AI总结 本文综述了安全强化学习和约束马尔可夫决策过程,涵盖单智能体和多智能体安全方法,总结了理论基础和最新算法,并提出五个开放性问题以推动该领域发展。

Comments 25

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08484 2026-04-28 cs.AI 79%

Patching LLM Like Software: A Lightweight Method for Improving Safety Policy in Large Language Models

像软件一样修补大语言模型:一种轻量级方法用于改进大语言模型的安全策略

Huzaifa Arif, Keerthiram Murugesan, Ching-Yun Ko, Pin-Yu Chen, Payel Das, Alex Gittens

机构 * Rensselaer Polytechnic Institute(拉特格斯理工学院) IBM Research(IBM研究院)

专题命中 安全训练 :safety(title,abstract);分类 cs.AI

AI总结 本文提出了一种轻量级方法,通过在现有模型前添加可学习的前缀来快速修复大语言模型的安全漏洞,该方法在毒性缓解、偏见减少和有害性拒绝等关键领域实现了与新一代安全对齐模型相当的安全提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16968 2026-04-21 cs.CL 79%

On Safety Risks in Experience-Driven Self-Evolving Agents

经验驱动自演化代理中的安全风险

Weixiang Zhao, Yichen Zhang, Yingshuo Wang, Yang Deng, Yanyan Zhao, Xuda Zhi, Yongbo Huang, HaoHe, Wanxiang Che, Bing Qin, Ting Liu

机构 * Harbin Institute of Technology(哈尔滨工业大学) Singapore Management University(新加坡管理大学) SERES

专题命中 安全训练 :safety(title,abstract);分类 cs.CL

AI总结 研究经验积累与利用对自演化代理在网页和具身环境中的安全性能影响,揭示经验驱动导致的安全性下降及安全-效用权衡问题。

Comments Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13878 2026-04-17 cs.LG 79%

Drowsiness-Aware Adaptive Autonomous Braking System based on Deep Reinforcement Learning for Enhanced Road Safety

基于深度强化学习的清醒意识自适应自动刹车系统:提升道路安全

Hossem Eddine Hafidi, Elisabetta De Giovanni, Teodoro Montanaro, Ilaria Sergi, Massimo De Vittorio, Luigi Patrono

机构 * University of Salento(萨勒诺大学) Istituto Italiano di Tecnologia(意大利技术研究院) Basque Center for Applied Mathematics(巴斯克应用数学中心)

专题命中 安全训练 :safety(title,abstract);分类 cs.LG

AI总结 本文提出基于深度强化学习的自适应自动刹车系统,结合车辆动力学与驾驶员生理数据,通过ECG信号检测清醒状态,提升道路安全。

Comments 16 pages, 12 figures. Under review at IEEE Transactions on Intelligent Vehicles

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12500 2026-04-15 cs.LG cs.CR 79%

Safety Training Modulates Harmful Misalignment Under On-Policy RL, But Direction Depends on Environment Design

安全训练调节策略下在策略强化学习中的有害对齐问题,但方向取决于环境设计

Leon Eshuijs, Shihan Wang, Antske Fokkens

机构 * Vrije Universiteit Amsterdam(阿姆斯特丹自由大学) Utrecht University(埃因霍温大学)

专题命中 安全训练 :safety(title,abstract);分类 cs.LG

AI总结 研究探讨了在策略强化学习中安全训练如何调节有害对齐问题,发现模型大小在不同环境中起到安全缓冲作用,且环境设计特征影响方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08439 2026-04-15 cs.AI 79%

Dataset Safety in Autonomous Driving: Requirements, Risks, and Assurance

自动驾驶中的数据集安全:要求、风险与保证

Alireza Abbaspour, Tejaskumar Balgonda Patil, B Ravi Kiran, Russel Mohr, Senthil Yogamani

机构 * Qualcomm Inc(高通公司)

专题命中 安全训练 :safety(title,abstract);分类 cs.AI

AI总结 本文提出了一种结构化框架,用于开发符合ISO/PAS 8800指南的安全生产数据集,通过AI感知系统案例,介绍AI数据飞轮和数据集生命周期,涵盖数据收集、标注、整理与维护,并定义安全要求和验证策略以确保符合安全标准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09521 2026-04-13 cs.IT cs.AI math.IT 79%

Semantic Rate-Distortion for Bounded Multi-Agent Communication: Capacity-Derived Semantic Spaces and the Communication Cost of Alignment

语义率-失真:受限多智能体通信的容量导出语义空间及对齐成本

Anthony T. Nixon

专题命中 安全训练 :alignment(title,abstract);分类 cs.AI

AI总结 本文研究多智能体在受限通信下的语义率-失真问题,提出基于容量导出的语义空间,并探讨通信对齐的成本与结构相变。

Comments 34 pages, 13 figures. Code: https://github.com/alch3mistdev/semantic-rate-distortion

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03242 2026-04-07 cs.LG 79%

DRAFT: Task Decoupled Latent Reasoning for Agent Safety

草稿:任务解耦的潜在推理用于代理安全

Lin Wang, Junfeng Fang, Dan Zhang, Fei Shen, Xiang Wang, Tat-Seng Chua

机构 * National University of Singapore, Singapore(新加坡国立大学) University of Science and Technology of China(中国科学技术大学)

专题命中 安全训练 :safety(title,abstract);分类 cs.LG

AI总结 本文提出DRAFT框架,通过解耦安全判断为提取器和推理器两个阶段,利用潜在空间证据聚合提升代理安全性,在多个基准测试中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07645 2026-04-03 cs.SE cs.AI cs.CR 79%

A Self-Improving Architecture for Dynamic Safety in Large Language Models

为大语言模型动态安全设计的自改进架构

Tyler Slater

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 安全训练 :safety(title,abstract);分类 cs.AI

AI总结 本文提出自改进安全框架SISF,通过反馈循环实现LLM系统在运行时自动检测安全故障并生成防御策略,实验显示其能有效降低攻击成功率,提升系统鲁棒性。

Comments Under review at the journal Information and Software Technology (Special Issue on Software Architecture for AI-Driven Systems)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00228 2026-04-02 cs.CL 79%

Do Language Models Know When They'll Refuse? Probing Introspective Awareness of Safety Boundaries

语言模型是否知道何时会拒绝?探测安全边界内的自我意识

Tanay Gondil

机构 * Purdue University(普渡大学)

专题命中 安全训练 :safety(title,abstract);分类 cs.CL

AI总结 研究探讨语言模型能否准确预测自身拒绝行为,通过系统分析发现模型在安全边界处敏感度下降,且通过置信度评分可提升安全部署的准确性。

Comments 11 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16377 2026-03-31 cs.RO cs.AI 79%

VLM-SAFE: Vision-Language Model-Guided Safety-Aware Reinforcement Learning with World Models for Autonomous Driving

VLM-SAFE: 基于世界模型的视觉-语言模型引导的安全强化学习用于自动驾驶

Yansong Qu, Zilin Huang, Zihao Sheng, Jiancong Chen, Yue Leng, Samuel Labi, Sikai Chen

机构 * Lyles School of Civil and Construction Engineering, Purdue University(普渡大学莱尔斯土木与建筑工程学院) Department of Civil and Environmental Engineering, University of Wisconsin-Madison(威斯康星大学麦迪逊分校土木与环境工程系) Google(谷歌)

专题命中 安全训练 :safety(title,abstract);分类 cs.AI

AI总结 本文提出VLM-SAFE框架,通过观察-想象-评估-行动闭环,利用视觉语言模型提供语义安全信号,结合世界模型预测未来轨迹,优化策略以提升自动驾驶的安全性和效率。

Comments N/A

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14723 2026-03-17 cs.CL 79%

Beyond Creed: A Non-Identity Safety Condition A Strong Empirical Alternative to Identity Framing in Low-Data LoRA Fine-Tuning

超越信仰:一种非身份安全条件:低数据LoRA微调中强经验性替代身份框架的非身份条件

Xinran Zhang

专题命中 安全训练 :safety(title,abstract);分类 cs.CL

AI总结 本文研究了低数据LoRA安全微调中四种监督格式对安全性能的影响,发现非身份条件D在三个模型家族中表现最佳,挑战了身份框架假设。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.17434 2026-03-17 cs.AI 79%

Resource Rational Contractualism Should Guide AI Alignment

资源理性契约主义应指导AI对齐

Sydney Levine, Matija Franklin, Tan Zhi-Xuan, Secil Yanik Guyot, Lionel Wong, Daniel Kilov, Yejin Choi, Joshua B. Tenenbaum, Noah Goodman, Seth Lazar, Iason Gabriel

机构 * Harvard(哈佛大学) MIT(麻省理工学院) Google Deepmind(谷歌DeepMind) Australian National University(澳大利亚国立大学) Stanford Psychology Department(斯坦福心理学系) Stanford(斯坦福大学) Computer Science Department(计算机科学系)

专题命中 安全训练 :alignment(title,abstract);分类 cs.AI

AI总结 本文提出资源理性契约主义框架,通过认知启发式方法提升AI决策效率与适应性,解决大规模契约达成成本高问题。

Comments 24 pages, 10 figures

Journal ref International Association for Safe and Ethical AI, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.07885 2026-03-05 cs.RO cs.AI 79%

Safety Guardrails for LLM-Enabled Robots

LLM赋能机器人中的安全护栏

Zachary Ravichandran, Alexander Robey, Vijay Kumar, George J. Pappas, Hamed Hassani

机构 * University of Pennsylvania(宾夕法尼亚大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 安全训练 :safety(title,abstract);分类 cs.AI

AI总结 RoboGuard通过两阶段护栏架构,利用根信任LLM和链式推理生成上下文安全规范,有效降低LLM赋能机器人在对抗攻击下的不安全计划执行率,提升系统安全性与可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23279 2026-02-27 cs.CY 79%

Safety First: Psychological Safety as the Key to AI Transformation

安全优先:心理安全是人工智能转型的关键

Aaron Reich, Diana Wolfe, Matt Price, Alice Choe, Fergus Kidd, Hannah Wagner

专题命中 安全训练 :safety(title,abstract);分类 cs.CY

AI总结 研究发现心理安全是员工采用人工智能工具的关键因素,但不影响其使用频率和持续时间,强调需区分采用与持续使用,推动早期AI实施的针对性干预。

Comments 26 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17306 2026-02-26 cs.CL 79%

Refusal Direction is Universal Across Safety-Aligned Languages

拒绝方向在安全对齐语言中是普遍的

Xinpeng Wang, Mingyang Wang, Yihong Liu, Hinrich Schütze, Barbara Plank

机构 * LMU Munich(慕尼黑大学) Munich Center for Machine Learning(慕尼黑机器学习中心)

专题命中 安全训练 :safety(title,abstract);分类 cs.CL

AI总结 本文研究了多语言LLMs中拒绝方向的跨语言普遍性,发现英文提取的向量可有效绕过其他语言的拒绝,揭示了跨语言安全机制的机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19983 2026-02-26 cs.RO cs.AI 79%

Contextual Safety Reasoning and Grounding for Open-World Robots

面向开放世界机器人的上下文安全推理与 grounding

Zachary Ravichandran, David Snyder, Alexander Robey, Hamed Hassani, Vijay Kumar, George J. Pappas

机构 * University of Pennsylvania(宾夕法尼亚大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 安全训练 :safety(title,abstract);分类 cs.AI

AI总结 CORE框架通过视觉语言模型实现在线上下文推理与空间grounding,提供概率安全保证,在开放世界中有效执行上下文适应的安全行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12281 2026-02-19 cs.RO cs.AI cs.SY eess.SY 79%

Scaling Verification Can Be More Effective than Scaling Policy Learning for Vision-Language-Action Alignment

在视觉-语言-动作对齐中,验证比策略学习更具效率

Jacky Kwok, Xilun Zhang, Mengdi Xu, Yuejiang Liu, Azalia Mirhoseini, Chelsea Finn, Marco Pavone

机构 * Stanford University(斯坦福大学) NVIDIA Research(NVIDIA研究)

专题命中 安全训练 :alignment(title,abstract);分类 cs.AI

AI总结 本文提出CoVer-VLA验证方法,通过测试时验证在视觉-语言-动作对齐中实现22%的在分布和13%的分布外收益,同时在现实世界实验中进一步提升45%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15061 2026-02-18 cs.RO cs.AI 79%

Safe-SDL:Establishing Safety Boundaries and Control Mechanisms for AI-Driven Self-Driving Laboratories

Safe-SDL:建立AI驱动自主实验室的安全边界与控制机制

Zihan Zhang, Haohui Que, Junhan Chang, Xin Zhang, Hao Wei, Tong Zhu

机构 * Shanghai Innovation Institute(上海创新研究院) Nankai University(南开大学) East China Normal University(华东师范大学) AI for Science Institute, Beijing(北京人工智能科学研究院) Peking University(北京大学) DP Technology(DP技术公司) Shanghai Jiao Tong University(上海交通大学) National Key Laboratory of Advanced Micro and Nano Manufacture Technology, School of Integrated Circuits, Shanghai Jiao Tong University, Shanghai 200240, China(上海交通大学国家先进微纳米制造技术重点实验室,集成电路学院,上海200240,中国)

专题命中 安全训练 :safety(title,abstract);分类 cs.AI

AI总结 Safe-SDL通过建立安全边界和控制机制,解决AI驱动自主实验室中的语法到安全间隙问题,确保实验系统的安全性和一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18082 2026-02-12 cs.LG cs.RO cs.SY eess.SY 79%

Provably Optimal Reinforcement Learning under Safety Filtering

在安全过滤下可证明最优的强化学习

Donggeon David Oh, Duy P. Nguyen, Haimin Hu, Jaime F. Fisac

专题命中 安全训练 :safety(title,abstract);分类 cs.LG

AI总结 本文证明在安全过滤下强化学习可实现最优性能,通过安全关键MDP和过滤MDP的理论框架,展示安全与性能优化的分离,并验证了在安全过滤器下的训练和部署方法。

Comments Accepted for publication in the proceedings of The International Association for Safe & Ethical AI (IASEAI) 2026; 17 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10740 2026-02-12 cs.CL 79%

Reinforced Curriculum Pre-Alignment for Domain-Adaptive VLMs

强化课程预对齐用于领域自适应视觉-语言模型

Yuming Yan, Shuo Yang, Kai Tang, Sihong Chen, Yang Zhang, Ke Xu, Dan Hu, Qun Yu, Pengfei Hu, Edith C. H. Ngai

机构 * Tencent(腾讯)

专题命中 安全训练 :alignment(title,abstract);分类 cs.CL

AI总结 本文提出RCPA方法,通过课程意识的渐进调节机制,在领域自适应中平衡领域知识获取与通用能力保持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10007 2026-02-11 cs.RO cs.AI cs.MA cs.SY eess.SY 79%

A Collaborative Safety Shield for Safe and Efficient CAV Lane Changes in Congested On-Ramp Merging

用于拥堵上坡合并中安全高效CAV变道的协作安全盾

Bharathkumar Hegde, Melanie Bouroche

机构 * School of Computer Science and Statistics, Trinity College Dublin(计算机科学与统计学系,三一学院都柏林)

专题命中 安全训练 :safety(title,abstract);分类 cs.AI

AI总结 本文提出MARL-MASS,通过整合多智能体安全盾和定制奖励函数,在拥堵交通中实现安全且高效的车道变换。

Comments Accepted in IEEE IV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06623 2026-02-09 cs.CL cs.CR 79%

Do Prompts Guarantee Safety? Mitigating Toxicity from LLM Generations through Subspace Intervention

提示是否保证安全?通过子空间干预减轻大语言模型生成中的毒性

Himanshu Singh, Ziwei Xu, A. V. Subramanyam, Mohan Kankanhalli

机构 * Department of Computer Science(计算机科学系) School of Computing, National University of Singapore(新加坡国立大学计算机学院) Department of Electronics and Communications Engineering(电子与通信工程系)

专题命中 安全训练 :safety(title,abstract);分类 cs.CL

AI总结 本文提出了一种子空间干预策略,通过减少大语言模型生成中的毒性,同时保持生成文本的流畅性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22118 2026-01-30 cs.AI 79%

Defining Operational Conditions for Safety-Critical AI-Based Systems from Data

从数据定义安全关键AI系统的操作条件

Johann Christensen, Elena Hoemann, Frank Köster, Sven Hallerbach

专题命中 安全训练 :safety(title,abstract);分类 cs.AI

AI总结 本文提出了一种基于多维核表示的方法,从已有数据后验定义安全关键AI系统的操作条件领域,以实现更有效的认证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13589 2026-01-21 cs.AI cs.SD 79%

Motion-to-Response Content Generation via Multi-Agent AI System with Real-Time Safety Verification

基于多智能体AI系统的运动到响应内容生成及实时安全验证

HyeYoung Lee

机构 * Department of Artificial Intelligence(人工智能系) Korean University(韩国大学)

专题命中 安全训练 :safety(title,abstract);分类 cs.AI

AI总结 本文提出了一种基于多智能体AI系统的实时内容生成方法,通过情感识别与安全验证代理,实现安全可控的响应内容生成,适用于儿童媒体和智能设备。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09740 2026-01-16 cs.RO cs.AI cs.SE 79%

Formal Safety Guarantees for Autonomous Vehicles using Barrier Certificates

使用屏障证书为自动驾驶车辆提供形式安全保证

Oumaima Barhoumi, Mohamed H Zaki, Sofiène Tahar

专题命中 安全训练 :safety(title,abstract);分类 cs.AI

AI总结 本文提出一种结合屏障证书与时间到碰撞度量的形式验证安全框架,通过SMT求解器和自适应控制机制,提升自动驾驶车辆的安全性和可解释性。

Comments Accepted to AAAI-26 Bridge Program B10: Making Embodied AI Reliable with Testing and Formal Verification

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08489 2026-01-14 cs.CL 79%

Surgical Refusal Ablation: Disentangling Safety from Intelligence via Concept-Guided Spectral Cleaning

手术拒绝消融:通过概念引导的频谱清洁分离安全与智能

Tony Cristofano

专题命中 安全训练 :safety(title,abstract);分类 cs.CL

AI总结 通过概念引导的频谱清洁技术,SRA有效分离语言模型的安全性与智能,减少拒绝行为的同时保持模型性能和分布稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08435 2026-01-14 cs.CL 79%

Fine-Mem: Fine-Grained Feedback Alignment for Long-Horizon Memory Management

细粒度反馈对齐的长期记忆管理:Fine-Mem

Weitao Ma, Xiaocheng Feng, Lei Huang, Xiachong Feng, Zhanyu Ma, Jun Xu, Jiuchong Gao, Jinghua Hao, Renqing He, Bing Qin

机构 * Harbin Institute of Technology(哈尔滨工业大学) Meituan(美团) Peng Cheng Laboratory(鹏城实验室) The University of Hong Kong(香港大学)

专题命中 安全训练 :alignment(title,abstract);分类 cs.CL

AI总结 Fine-Mem通过细粒度反馈对齐提升长周期内存管理,通过块级奖励和证据锚定奖励分配优化策略,实现更高效的内存操作与长期效用对齐。

Comments 18 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏