arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-04-24 至 2026-04-24 共收录 5 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全训练 5 篇

2601.18491 2026-04-24 cs.AI cs.CC cs.CL cs.CV cs.LG 85%

AgentDoG: A Diagnostic Guardrail Framework for AI Agent Safety and Security

AgentDoG:一种面向AI代理安全与安全的诊断防护框架

Dongrui Liu, Qihan Ren, Chen Qian, Shuai Shao, Yuejin Xie, Yu Li, Zhonghao Yang, Haoyu Luo, Peng Wang, Qingyu Liu, Binxin Hu, Ling Tang, Jilin Mei, Dadi Guo, Leitao Yuan, Junyao Yang, Guanxu Chen, Qihao Lin, Yi Yu, Bo Zhang, Jiaxuan Guo, Jie Zhang, Wenqi Shao, Huiqi Deng, Zhiheng Xi, Wenjie Wang, Wenxuan Wang, Wen Shen, Zhikai Chen, Haoyu Xie, Jialing Tao, Juntao Dai, Jiaming Ji, Zhongjie Ba, Linfeng Zhang, Yong Liu, Quanshi Zhang, Lei Zhu, Zhihua Wei, Hui Xue, Chaochao Lu, Jing Shao, Xia Hu

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 安全训练 :safety(title,abstract);alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出AgentDoG框架,通过统一的三维分类法和细粒度安全基准,解决AI代理安全与安全中的复杂风险问题,提供细粒度监控和根因诊断,实现有效代理对齐。

Comments 40 pages, 26 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19811 2026-04-24 cs.CY cs.AI 62%

Model Capability Assessment and Safeguards for Biological Weaponization

生物武器化中的模型能力评估与安全措施

Michael Richter

机构 * Binghamton University(比灵顿大学)

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.CY

AI总结 本文通过测试多个AI模型在73个开放性STEM提示中的表现,评估其在生物武器化中的潜在风险,发现Gemini在某些情况下缺乏上下文意识,需加强安全措施以应对能力超越调节的挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05591 2026-04-24 cs.LG cs.CL 62%

Entropy Ratio Clipping as a Soft Global Constraint for Stable Reinforcement Learning

熵比裁剪作为稳定强化学习的软全局约束

Zhenpeng Su, Leiyu Pan, Minxuan Lv, Tiehua Mei, Zijia Lin, Yuntao Li, Wenping Hu, Ruiming Tang, Kun Gai, Guorui Zhou

机构 * Kuaishou Technology(快手科技) Tsinghua University(清华大学) Independent(独立)

专题命中 安全训练 :alignment(abstract);分类 cs.CL、cs.LG

AI总结 本文提出熵比裁剪机制,通过量化策略探索的相对变化,缓解强化学习中的分布偏移问题,提升训练稳定性。

Comments This paper has been accepted by ACL2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20911 2026-04-24 cs.CR cs.AI 57%

Omission Constraints Decay While Commission Constraints Persist in Long-Context LLM Agents

在长上下文LLM代理中,遗漏约束衰减而执行约束持续存在

Yeran Gamage

机构 * University of South Florida(佛罗里达州立大学) Independent AI Security Researcher(独立人工智能安全研究员)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 研究发现,在长上下文LLM代理中,遗漏约束随上下文压力衰减,而执行约束持续存在,这种不对称性称为安全回忆分歧(SRD)。

Comments 19 pages, 5 figures. Includes evaluation framework for replication and 4,416-trial dataset

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21587 2026-04-24 cs.IT math.IT 50%

Generative Learning Enhanced Intelligent Resource Management for Cell-Free Delay Deterministic Communications

生成学习增强的智能资源管理用于无基站确定性通信

Shuangbo Xiong, Cheng Zhang, Wen Wang, Wenwu Yu, Yongming Huang

专题命中 安全训练 :safety(abstract)

AI总结 本文研究了无基站MIMO系统中的资源分配问题,提出基于虚拟约束马尔可夫决策过程的离线预训练框架,通过证据感知条件高斯混合模型提升效率和安全性,实验表明其在能效和延迟约束方面表现优异。

Comments The paper has been submitted to IEEE Transactions on Wireless Communications

详情

展开后加载摘要…

URL PDF HTML 收藏