arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-03-20 至 2026-03-20 共收录 10 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全训练 10 篇

2508.04904 2026-03-20 cs.HC 78%

Toward Scalable Patient Safety Training: A Prototype for Root Cause Analysis Simulation With AI Virtual Avatars

迈向可扩展的患者安全培训:一种基于AI虚拟仿真的根因分析原型

Yuqi Hu, Qiwen Xiong, Zhenzhen Qin, Brandon Watanabe, Yujing Wang, Mirjana Prpa, Ilmi Yoon

专题命中 安全训练 :safety(title,abstract)

AI总结 本文提出一种AI驱动的仿真平台,通过根因分析模拟提升患者安全培训的可扩展性,利用虚拟角色和AI技术实现沉浸式学习,降低培训成本。

Comments This works has been accepted at the 2026 IEEE Conference on Artificial Intelligence, where a revised version of this work will be published

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10846 2026-03-20 cs.CL 70%

DUAL-Bench: Measuring Over-Refusal and Robustness in Vision-Language Models

DUAL-Bench: 测量视觉语言模型中的过度拒绝与鲁棒性

Kaixuan Ren, Preslav Nakov, Usman Naseem

机构 * Macquarie University(麦考瑞大学) MBZUAI(马克斯·普朗克智能系统研究所)

专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.CL

AI总结 本文提出DUAL-Bench,通过评估18种VLM在12类危险场景下的表现,揭示模型在双重使用场景中的脆弱安全边界,强调安全完成与过度拒绝的平衡需求。

Comments 26pages, 13 figures, Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19152 2026-03-20 cs.CL cs.AI 62%

VEPO: Variable Entropy Policy Optimization for Low-Resource Language Foundation Models

VEPO:用于低资源语言基础模型的变量熵策略优化

Chonghan Liu, Yimin Du, Qi An, Xin He, Cunqi Zhai, Fei Tan, Weijia Lin, Xiaochun Gong, Yongchao Deng, Shousheng Jia, Xiangzheng Zhang

专题命中 安全训练 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文提出VEPO,通过强化学习可验证奖励整合确定性结构约束,提升低资源语言的分词效率和翻译质量。

Comments 23 pages. Includes figures and tables. Conference submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18326 2026-03-20 cs.LG 57%

Escaping Offline Pessimism: Vector-Field Reward Shaping for Safe Frontier Exploration

摆脱离线悲观主义:用于安全前沿探索的向量场奖励塑造

Amirhossein Roknilamouki, Arnob Ghosh, Eylem Ekici, Ness B. Shroff

专题命中 安全训练 :alignment(abstract);分类 cs.LG

AI总结 本文提出向量场奖励塑造方法,通过梯度对齐和旋转向量项诱导持续安全前沿探索,验证了在连续导航任务中有效平衡安全与信息收集。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15978 2026-03-20 cs.AI 57%

From Workflow Automation to Capability Closure: A Formal Framework for Safe and Revenue-Aware Customer Service AI

从工作流自动化到能力闭合:一种安全且收益意识的客户服务AI形式框架

Cosimo Spera

机构 * Minerva CQ

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 本文提出一种形式框架,用于安全且收益意识的客户服务AI,解决自动化转型中安全缺口问题,通过动态组合能力实现安全目标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19170 2026-03-20 cs.RO math.OC 50%

ADMM-Based Distributed MPC with Control Barrier Functions for Safe Multi-Robot Quadrupedal Locomotion

基于ADMM的分布式MPC与控制屏障函数用于安全多机器人四足运动

Yicheng Zeng, Ruturaj S. Sambhus, Basit Muhammad Imran, Jeeseop Kim, Vittorio Pastore, Kaveh Akbari Hamed

机构 * Department of Mechanical Engineering, Virginia Tech(弗吉尼亚理工大学机械工程系) The University of Texas at El Paso(德克萨斯理工大学)

专题命中 安全训练 :safety(abstract)

AI总结 本文提出基于ADMM的去中心化MPC框架,结合控制屏障函数约束,用于多机器人腿部系统的安全轨迹规划。通过节点-边分割公式与共识约束,将全局问题分解为独立二次规划问题,实现高效去中心化优化,提升实时性与安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18658 2026-03-20 eess.SY cs.SY 50%

Mean-field control barrier functions for stochastic multi-agent systems

均场控制屏障函数用于随机多智能体系统

Cinzia Tomaselli, Gian Carlo Maffettone, Samy Wu Fung, Levon Nurbekyan, Mario di Bernardo

专题命中 安全训练 :safety(abstract)

AI总结 本文提出均场控制屏障函数,用于保障随机多智能体系统安全,通过稳定性分析和数值模拟验证了其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09490 2026-03-20 econ.TH 50%

Robust Trust

稳健的信任

Piotr Dworczak, Alex Smolin

专题命中 安全训练 :alignment(abstract)

AI总结 研究者分析了在信息不对称情况下,代理人如何根据私人信息和可能有偏见的顾问建议做出稳健决策,通过信任区域政策最大化最坏情况下的预期收益。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18059 2026-03-20 cs.CR cs.SE 50%

Guardrails as Infrastructure: Policy-First Control for Tool-Orchestrated Workflows

护栏作为基础设施:面向工具编排工作流的政策优先控制

Akshey Sigdel, Rista Baral

专题命中 安全训练 :safety(abstract)

AI总结 本文提出Policy-First Tooling,通过显式约束、风险感知门控等机制提升工具调用安全性,实验显示其在减少违规行为和降低重试放大方面效果显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02009 2026-03-20 cs.DC 50%

STRATUS: A Multi-agent System for Autonomous Reliability Engineering of Modern Clouds

STRATUS:一种用于现代云服务自主可靠性工程的多智能体系统

Yinfang Chen, Jiaqi Pan, Jackson Clark, Yiming Su, Noah Zheutlin, Bhavya Bhavya, Rohan Arora, Yu Deng, Saurabh Jha, Tianyin Xu

专题命中 安全训练 :safety(abstract)

AI总结 本文提出STRATUS,一种基于LLM的多智能体系统,用于实现云服务的自主SRE。系统通过状态机组织多个专用智能体,提升故障检测、诊断和缓解的效率,并通过Transactional No-Regression规范提高自主故障缓解的成功率。

Comments 10 pages for main text

详情

展开后加载摘要…

URL PDF HTML 收藏