arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-06-04 至 2026-06-04 共收录 22 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全训练 22 篇

2606.04778 2026-06-04 cs.AI cs.CL cs.LG 89%

Inference-Time Vulnerability Beyond Shallow Safety: Alignment Along Generation Trajectories

超越浅层安全的推理时脆弱性:沿生成轨迹的对齐

Kyungmin Park, Taesup Kim

机构 * Hankuk University of Foreign Studies(翰江大学外国语大学) Seoul National University(首尔国立大学)

专题命中 安全训练 :alignment(title,abstract);safety(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文揭示安全对齐的大语言模型在推理时存在更广泛的脆弱性,即任意生成步骤的短标记注入都能显著改变后续安全行为,并提出通过直接在生成轨迹上对齐模型来提升鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04168 2026-06-04 cs.LG cs.CR 88%

When Autoregressive Consistency Hurts Safety Alignment

当自回归一致性损害安全对齐

Bochen Lyu, Yiyang Jia, Xiaohao Cai, Zhanxing Zhu

机构 * University of Southampton(索姆塞特大学)

专题命中 安全训练 :alignment(title,abstract);safety(title,abstract);分类 cs.LG

AI总结 本文通过分析自回归一致性机制,揭示了大语言模型安全对齐的浅层性,并提出随机插入攻击和对抗性安全对齐方法。

Comments 21 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04051 2026-06-04 cs.LG cs.AI cs.CR 84%

RUBAS: Rubric-Based Reinforcement Learning for Agent Safety

RUBAS: 基于评分标准的强化学习用于智能体安全

Xian Qi Loye, Qinglin Su, Zhexin Zhang, Shiyao Cui, Qi Zhu, Fei Mi, Hongning Wang, Minlie Huang

机构 * The Conversational AI (CoAI) group, DCST, Tsinghua University(清华大学对话人工智能(CoAI)组,DCST,清华大学) Huawei Noah’s Ark Lab(华为诺亚实验室)

专题命中 安全训练 :safety(title,abstract);alignment(abstract);分类 cs.AI、cs.LG

AI总结 提出RUBAS框架,通过将智能体行为分解为四个维度的评分标准提供细粒度奖励,利用强化学习在保证任务完成的同时提升工具使用安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04035 2026-06-04 cs.SE cs.AI cs.LG 84%

Unpredictable Safety: Domain-Dependent Compliance and the Transparency Gap in Open-Weight LLMs

不可预测的安全性:开放权重大语言模型中领域依赖的合规性与透明度差距

Zacharie Bugaud

机构 * Astera Institute(Astera研究院)

专题命中 安全训练 :safety(title,abstract);trustworthy(abstract);分类 cs.AI、cs.LG

AI总结 通过7个伦理领域的标准化实验,发现开放权重大语言模型的合规率在14.7%到85.7%之间波动,且同一模型在不同领域表现高度不一致,揭示了安全机制缺乏透明度和一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04394 2026-06-04 cs.SE 78%

Beyond Single-Policy: Evaluating Composed Organization-Specific Policy Alignment in LLM Chatbots

超越单一策略:评估LLM聊天机器人中组合的组织特定策略对齐

Yingjie Liu, Yongxiang Hu, Xuan Wang, Yilun Li, Yunlei Wei, Xiaoyu Wang, Yangfan Zhou

专题命中 安全训练 :alignment(title,abstract)

AI总结 针对现有基准忽视的组合策略违规问题,提出COPAL工具,通过经验推导的交互模式和显式处理契约生成触发组合策略失败的查询,在9个模型中平均错误率达33.1%。

详情

展开后加载摘要…

URL PDF HTML 收藏
1903.06365 2026-06-04 eess.SY cs.SY 78%

Herding an Adversarial Attacker to a Safe Area for Defending Safety-Critical Infrastructure

将对抗性攻击者驱赶至安全区域以保护关键安全基础设施

Vishnu S Chipade, Dimitra Panagou

专题命中 安全训练 :safety(title,abstract)

AI总结 本文研究了在城市环境中防御关键安全基础设施免受对抗性空中攻击的问题,通过圆形弧形防御者阵型,在存在矩形障碍物的情况下,利用向量场引导法则将攻击者驱赶至预定义的安全区域。提出了一种新的有限时间稳定控制器,用于引导防御者形成 desired 阵型并避免障碍物和相互碰撞。

Comments ACC 2019

详情

展开后加载摘要…

URL PDF HTML 收藏
1804.04345 2026-06-04 eess.SY cs.MA cs.SY 78%

Automatic Generation of Communication Requirements for Enforcing Multi-Agent Safety

多智能体安全性的自动通信需求生成

Eric S. Kim, Murat Arcak, Sanjit A. Seshia, BaekGyu Kim, Shinichi Shiraishi

专题命中 安全训练 :safety(title,abstract)

AI总结 本文研究多智能体系统中通信需求的自动生成,提出无需协调的可控前驱运算符以确定安全约束下的自主行为,展示连接延迟上限和自触发协调方案的应用。

Comments In Proceedings SCAV 2018, arXiv:1804.03406

Journal ref EPTCS 269, 2018, pp. 3-16

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03205 2026-06-04 cs.CL 77%

Learning When to Act or Refuse: Guarding Agentic Reasoning Models for Safe Multi-Step Tool Use

学习何时行动或拒绝:为安全的多步骤工具使用守护代理推理模型

Aradhye Agarwal, Gurdit Siyan, Yash Pandya, Joykirat Singh, Akshay Nambi, Ahmed Awadallah

机构 * Microsoft Research(微软研究院)

专题命中 安全训练 :alignment(abstract);safety(abstract);prompt injection(abstract);分类 cs.CL

AI总结 提出MOSAIC框架,通过显式安全推理和基于偏好的强化学习,使代理模型在工具使用中安全决策,减少有害行为并保持良性性能。

Comments Accepted to the 43rd International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04160 2026-06-04 cs.CL cs.LG 73%

Expert-Aware Refusal Steering

专家感知的拒绝引导

Anna C. Marbut, Daniel R. Olson, Travis J. Wheeler

机构 * Department of Interdisciplinary Studies(交叉学科研究部) University of Montana(蒙大拿大学) Department of Pharmacy Practice & Science(药学与科学系) University of Arizona(亚利桑那大学) European Bioinformatics Institute(欧洲生物信息研究所) European Molecular Biology Laboratory(欧洲分子生物学实验室) Wellcome Genome Campus(沃氏基因组校园)

专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.CL、cs.LG

AI总结 研究在混合专家(MoE)大语言模型中,通过专家感知的引导向量抑制拒绝行为,发现单个专家输出即可有效引导,且注意力机制在MoE拒绝行为中起重要作用。

Comments Under review for COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04483 2026-06-04 cs.CL 70%

Off-Distribution Voices: Fanfiction Subgenres as Universal Vernacular Jailbreaks for Aligned LLMs

分布外声音:同人小说子类型作为对齐LLM的通用白话越狱

Zhongze Luo, Ruihe Shi, Zhenshuai Yin, Haoyue Liu, Weixuan Wan, Xiaoying Tang

机构 * School of Science and Engineering, The Chinese University of Hong Kong (Shenzhen)(香港中文大学(深圳)科学与工程学院) The Shenzhen Future Network of Intelligence Institute (FNii-Shenzhen)(深圳未来网络智能研究院) The Guangdong Provincial Key Laboratory of Future Networks of Intelligence(广东省未来网络智能重点实验室) School of Microelectronics, Xi’an Jiaotong University(西安交通大学微电子学院)

专题命中 安全训练 :safety(abstract);jailbreak(abstract);分类 cs.CL

AI总结 本文发现安全训练覆盖不足的自然人类写作语域是对齐LLM的真正失败模式,并提出首个利用真实同人小说子类型作为通用攻击载体的越狱方法,显著提升攻击成功率。

Comments 23 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04226 2026-06-04 cs.RO cs.AI 70%

PerceptTwin: Semantic Scene Reconstruction for Iterative LLM Planning and Verification

PerceptTwin:面向迭代LLM规划与验证的语义场景重建

Charlie Gauthier, Sacha Morin, Liam Paull

机构 * Department of Computer Science and Operations Research, Université de Montréal(蒙特利尔大学计算机科学与运筹学系) Mila - Quebec AI Institute(魁北克人工智能研究所) CIFAR AI Chair(CIFAR人工智能主席)

专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.AI

AI总结 提出PerceptTwin自动管道,从机器人感知的语义场景表示构建交互式仿真,结合LLM法官验证规划正确性与人类偏好,提升规划成功率约39%。

Comments Accepted at ICRA 2026 (Vienna); published on arxiv for archival purposes. See also https://percept-twin.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09853 2026-06-04 cs.CL cs.AI 62%

MedRedFlag: Investigating how LLMs Redirect Misconceptions in Real-World Health Communication

MedRedFlag:探究LLMs如何在真实健康沟通中纠正误解

Sraavya Sambara, Yuan Pu, Ayman Ali, Vishala Mishra, Lionel Wong, Monica Agrawal

机构 * Independent Researcher(独立研究者) Duke University(杜克大学) Stanford University(斯坦福大学)

专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.AI

AI总结 本研究通过构建MedRedFlag数据集(1100+个来自Reddit的需纠正问题),系统比较了先进LLMs与临床医生的回应,发现LLMs常未能纠正问题中的错误前提,可能导致次优医疗决策,揭示了患者面向医疗AI系统的关键安全漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
1610.05984 2026-06-04 cs.NE cs.AI cs.LG cs.SY eess.SY 62%

Particle Swarm Optimization for Generating Interpretable Fuzzy Reinforcement Learning Policies

粒子群优化用于生成可解释的模糊强化学习策略

Daniel Hein, Alexander Hentschel, Thomas Runkler, Steffen Udluft

机构 * Siemens AG, Corporate Technology(西门子公司企业技术部)

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种基于模糊粒子群强化学习(FPSRL)的方法,通过训练参数在模拟真实系统动态的世界模型上生成可解释的模糊强化学习策略,适用于无法进行在线学习的领域。

Journal ref Engineering Applications of Artificial Intelligence, Volume 65C, October 2017, Pages 87-98

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04413 2026-06-04 cs.LG 57%

(Mis)generalization of Helpful-only Fine-tuning

仅帮助性微调的(错误)泛化

Mohammad Omar Khursheed, Baram Sosis, Fabien Roger

机构 * Anthropic Fellows Program(Anthropic 合作者计划) Anthropic

专题命中 安全训练 :alignment(abstract);分类 cs.LG

AI总结 研究仅帮助性训练(不拒绝用户意图)的模型在泛化中的缺陷,发现其存在涌现错位、残余拒绝行为、低可操控性、谄媚和不连贯角色等问题,并提出合成文档微调和添加角色相关问题来缓解。

Comments 77 pages, 50 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25402 2026-06-04 cs.CV cs.AI 57%

Anatomy-Anchored Self-Supervision: Distilling Vision Foundation Models for Invariant Ultrasound Representation

解剖锚定的自监督:蒸馏视觉基础模型用于不变超声表示

Chunzheng Zhu, Yijun Wang, Jianxin Lin, Feng Wang, Hongwei Wang, Lei Zhao, Shengli Li, Kenli Li

机构 * Hunan University(湖南大学) Shenzhen Maternity and Child Healthcare Hospital(深圳妇幼保健医院)

专题命中 安全训练 :alignment(abstract);分类 cs.AI

AI总结 提出解剖锚定的超声自监督框架ANAUS,通过可学习潜在提示引擎和领域自适应实现无标注解剖分割,并设计双策略自监督学习(语义感知解剖分离对齐和上下文核心区域预测)来增强表示学习,在六个公开数据集上超越现有方法。

Comments MICCAI 2026 Accepted Paper; Anatomy-Anchored Ultrasound Self-Supervision

详情

展开后加载摘要…

URL PDF HTML 收藏
1801.09627 2026-06-04 cs.LG cs.RO cs.SY eess.SY 57%

Barrier-Certified Adaptive Reinforcement Learning with Applications to Brushbot Navigation

具有应用的障碍证书自适应强化学习:Brushbot导航

Motoya Ohnishi, Li Wang, Gennaro Notomista, Magnus Egerstedt

机构 * School of Electrical Engineering, Royal Institute of Technology(皇家理工学院电气工程学院) Georgia Institute of Technology(佐治亚理工学院) RIKEN Center for Advanced Intelligence Project(日本理化学研究所高级智能研究中心) School of Mechanical Engineering(机械工程学院)

专题命中 安全训练 :safety(abstract);分类 cs.LG

AI总结 本文提出了一种安全学习框架,结合自适应模型学习算法和障碍证书,用于具有可能非平稳智能体动态的系统。通过稀疏优化技术提取模型的动态结构,并利用学习的模型结合控制障碍证书来约束策略(反馈控制器),以保持安全性,即避免特定的不利状态空间区域。在某些条件下,保证了在安全被非平稳性破坏后,以李雅普诺夫稳定性的方式恢复安全。此外,将动作-价值函数近似重新公式化,使任何基于内核的非线性函数估计方法都能应用于我们的自适应学习框架。最后,保证了障碍证书策略优化的解是全局最优的,确保在温和条件下进行贪心策略改进。所得到的框架通过四旋翼无人机的模拟进行验证,该无人机此前在安全学习文献中被假设为平稳性,然后在动态未知、高度复杂且非平稳的Brushbot机器人上进行测试。

Comments ©2019 IEEE. Personal use of this material is permitted. Permission from IEEE must be obtained for all other uses, in any current or future media, including reprinting/republishing this material for advertising or promotional purposes, creating new collective works, for resale or redistribution to servers or lists, or reuse of any copyrighted component of this work in other works

Journal ref Published in IEEE Transactions on Robotics, 2019

详情

展开后加载摘要…

URL PDF HTML 收藏
1904.00035 2026-06-04 cs.RO cs.LG cs.SY eess.SY stat.ML 57%

Autonomous Highway Driving using Deep Reinforcement Learning

使用深度强化学习实现自动驾驶高速公路驾驶

Subramanya Nageshrao, Eric Tseng, Dimitar Filev

机构 * Ford Greenfield Labs(福特绿谷实验室) Ford Research and Innovation Center(福特研究与创新中心)

专题命中 安全训练 :safety(abstract);分类 cs.LG

AI总结 本文提出了一种基于强化学习的方法,通过与模拟交通直接交互,使自动驾驶车辆在复杂和多变的环境中做出决策,解决了传统规则和预设成本函数在实时优化中的不足,提高了学习效率和安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
1701.01487 2026-06-04 cs.AI cs.SY eess.SY 57%

Designing a Safe Autonomous Artificial Intelligence Agent based on Human Self-Regulation

基于人类自我调节设计安全的自主人工智能代理

Mark Muraven

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 本文提出通过研究人类自我调节机制,设计安全的人工智能代理,以避免复杂系统中因目标不明确导致的有害后果。

Comments 17 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
1510.07313 2026-06-04 eess.SY cs.AI cs.LO cs.RO cs.SY 57%

Safe Control under Uncertainty

在不确定性下的安全控制

Dorsa Sadigh, Ashish Kapoor

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 本文提出Probabilistic Signal Temporal Logic(PrSTL)用于定义随机属性并确保概率保证,通过该逻辑合成安全控制器,应用于四旋翼和自动驾驶车辆等案例。

Comments 10 pages, 6 figures, Submitted to HSCC 2016

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04149 2026-06-04 cs.RO 50%

CoPark: Learning Reactive Parking via Self-Play

CoPark:通过自我对弈学习反应式泊车

Jiarong Wei, Yanxing Chen, Sinuo Song, Yin Wu, Anna Rehr, Abhinav Valada

机构 * Department of Computer Science, University of Freiburg(弗赖堡大学计算机科学系) CARIAD SE(CARIAD SE公司) Technical University of Munich(慕尼黑技术大学)

专题命中 安全训练 :alignment(abstract)

AI总结 提出CoPark,一种基于残差策略的多智能体自我对弈强化学习方法,通过固定先验与残差头结合,在反应式泊车中实现高精度与安全交互的平衡,显著优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
1712.05506 2026-06-04 eess.SY cs.SY 50%

Enhancing the performance of a safe controller via supervised learning for truck lateral control

通过监督学习增强安全控制器的性能以用于卡车侧向控制

Yuxiao Chen, Ayonga Hereid, Huei Peng, Jessy Grizzle

专题命中 安全训练 :safety(abstract)

AI总结 本文结合监督学习与控制屏障函数,设计了兼具高性能与可证明安全性的控制器,通过轨迹优化生成训练集,利用监督学习生成控制策略,并通过CBF保证安全,验证了该方法在卡车车道保持中的有效性。

Comments submitted to IEEE Transaction of Control System Technology

详情

展开后加载摘要…

URL PDF HTML 收藏
1701.04537 2026-06-04 eess.SY cs.SY 50%

Cloud Resource Allocation for Cloud-Based Automotive Applications

面向云基础汽车应用的云资源分配

Zhaojian Li, Tianshu Chu, Ilya V. Kolmanovsky, Xiang Yin, Xunyuan Yin

专题命中 安全训练 :safety(abstract)

AI总结 本文研究云基础汽车系统的资源分配问题,提出集中化和去中心化模型,分别用于私有云和公有云,通过优化算法提升服务质量与资源利用率。

详情

展开后加载摘要…

URL PDF HTML 收藏