arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-03-09 至 2026-03-09 共收录 2 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全训练 2 篇

2603.05517 2026-03-09 cs.LG cs.AI cs.CR cs.SE 62%

Traversal-as-Policy: Log-Distilled Gated Behavior Trees as Externalized, Verifiable Policies for Safe, Robust, and Efficient Agents

路径作为策略:基于日志提炼的门控行为树作为可验证的外部化策略,用于安全、鲁棒且高效的智能体

Peiran Li, Jiashuo Sun, Fangzhou Lin, Shuo Xing, Tianfu Fu, Suofei Feng, Chaoqun Ni, Zhengzhong Tu

机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校) Worcester Polytechnic Institute(沃斯特理工学院) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Meta

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

AI总结 通过日志提炼生成门控行为树作为外部化策略,提升智能体在安全、鲁棒性和效率方面的表现。

Comments 30 pages, 1 figurres, 23 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17932 2026-03-09 cs.CY 57%

Operational Agency: A Permeable Legal Fiction for Tracing Culpability in AI Systems

可操作代理:一种渗透性法律虚构,用于追踪AI系统中的过失

Anirban Mukherjee, Hannah Hanwen Chang

专题命中 安全训练 :safety(abstract);分类 cs.CY

AI总结 本文提出可操作代理(OA)和可操作代理图(OAG)作为追踪AI系统过失的法律框架,通过分析AI的操作特征和因果关系,为法院和立法提供证据方法,确保人类问责制与技术自主性同步。

Comments Forthcoming, SMU Science and Technology Law Review

详情

展开后加载摘要…

URL PDF HTML 收藏