arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-04-20 至 2026-04-20 共收录 5 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全训练 5 篇

2604.15717 2026-04-20 cs.CR 88%

Into the Gray Zone: Domain Contexts Can Blur LLM Safety Boundaries

进入灰色区域:领域上下文可以模糊大语言模型安全边界

Ki Sen Hung, Xi Yang, Chang Liu, Haoran Li, Kejiang Chen, Changxuan Fan, Tsun On Kwok, Weiming Zhang, Xiaomeng Li, Yangqiu Song

专题命中 安全训练 :safety(title,abstract);jailbreak(abstract,abstract_cn);alignment(abstract);harmlessness(abstract)

AI总结 研究探讨了领域上下文如何模糊大语言模型的安全边界,提出Jargon框架通过多轮对抗交互提升攻击成功率,通过激活空间分析揭示灰色区域的不可靠性,并设计政策引导的防护策略以减少攻击成功率。

Comments ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14243 2026-04-20 cs.LG cs.AI 62%

Optimistic Policy Learning under Pessimistic Adversaries with Regret and Violation Guarantees

在悲观对抗者下具有后悔和违反保证的乐观策略学习

Sourav Ganguly, Kartik Pandit, Arnob Ghosh

机构 * Dept. of Electrical and Computer Engineering, NJIT, Newark, NJ, USA(电气与计算机工程系,新泽西理工学院,新泽西州纽克尔,美国)

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出RHC-UCRL算法,通过建模外生因素为对抗策略,实现策略在对抗环境下的最优与安全,提供子线性后悔和约束违反保证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15505 2026-04-20 cs.CL cs.AI 62%

PolicyBank: Evolving Policy Understanding for LLM Agents

PolicyBank: 为LLM代理演化政策理解

Jihye Choi, Jinsung Yoon, Long T. Le, Somesh Jha, Tomas Pfister

机构 * Google Cloud(谷歌云) University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

专题命中 安全训练 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 研究通过交互与反馈让LLM代理自主优化政策解读,提出PolicyBank机制以结构化存储政策洞察并迭代完善,有效填补规范缺口。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15485 2026-04-20 cs.SE 50%

LLM4C2Rust: Large Language Models for Automated Memory-Safe Code Transpilation

LLM4C2Rust: 利用大型语言模型实现自动内存安全代码转译

Sarah Bedell, Nazanin Siavash, Armin Moin

专题命中 安全训练 :safety(abstract)

AI总结 本文提出基于检索增强生成的框架,利用大型语言模型与小型语言模型结合,实现C/C++到Rust的转译,提升内存安全性。实验表明该方法能有效提高代码正确性和安全性,减少原始指针解引用和不安全类型转换。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20643 2026-04-20 eess.SY cs.SY 50%

Safe Decentralized Density Control of Multi-Robot Systems using PDE-Constrained Optimization with State Constraints

多机器人系统中使用偏微分方程约束优化的安全去中心化密度控制

Longchen Niu, Gennaro Notomista

专题命中 安全训练 :safety(abstract)

AI总结 本文提出了一种去中心化优化密度控制器,通过设计去中心化控制屏障函数,确保局部安全约束下的全局安全。采用Fokker-Planck方程建模机器人空间概率密度函数,降低计算和通信开销,通过四架四旋翼飞行器的仿真和实验验证有效性。

Comments Accepted to MRS 2025

Journal ref 2025 IEEE International Symposium on Multi-Robot and Multi-Agent Systems (MRS), Singapore, Singapore, 2025, pp. 1-7

详情

展开后加载摘要…

URL PDF HTML 收藏