2601.18491
2026-04-24
cs.AI
cs.CC
cs.CL
cs.CV
cs.LG
85%
AgentDoG: A Diagnostic Guardrail Framework for AI Agent Safety and Security
AgentDoG:一种面向AI代理安全与安全的诊断防护框架
Dongrui Liu, Qihan Ren, Chen Qian, Shuai Shao, Yuejin Xie, Yu Li, Zhonghao Yang, Haoyu Luo, Peng Wang, Qingyu Liu, Binxin Hu, Ling Tang, Jilin Mei, Dadi Guo, Leitao Yuan, Junyao Yang, Guanxu Chen, Qihao Lin, Yi Yu, Bo Zhang, Jiaxuan Guo, Jie Zhang, Wenqi Shao, Huiqi Deng, Zhiheng Xi, Wenjie Wang, Wenxuan Wang, Wen Shen, Zhikai Chen, Haoyu Xie, Jialing Tao, Juntao Dai, Jiaming Ji, Zhongjie Ba, Linfeng Zhang, Yong Liu, Quanshi Zhang, Lei Zhu, Zhihua Wei, Hui Xue, Chaochao Lu, Jing Shao, Xia Hu
机构
*
Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)
专题命中
安全训练
:safety(title,abstract);alignment(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结
本文提出AgentDoG框架,通过统一的三维分类法和细粒度安全基准,解决AI代理安全与安全中的复杂风险问题,提供细粒度监控和根因诊断,实现有效代理对齐。