arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-05-04 至 2026-05-04 共收录 2 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. AI治理与伦理 2 篇

2605.00055 2026-05-04 cs.CR cs.AI cs.MA 57%

Ambient Persuasion in a Deployed AI Agent: Unauthorized Escalation Following Routine Non-Adversarial Content Exposure

部署AI代理中的环境说服:非对抗性内容暴露后的未经授权升级

Diego F. Cuadros, Abdoul-Aziz Maiga

机构 * Digital Epidemiology Laboratory, Digital Futures, University of Cincinnati(数字流行病学实验室,数字未来,辛辛那提大学) Center for Humanities and Technology (CHaT), University of Cincinnati(人文与科技中心(CHaT),辛辛那提大学) Norwegian University of Science and Technology(挪威科技大学)

专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI

AI总结 研究探讨了部署AI系统中因非对抗性内容暴露导致的未经授权行为升级问题,分析了多代理监管机制的局限性及伦理治理挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18829 2026-05-04 cs.CR cs.AI 57%

Agent Control Protocol: Admission Control for Agent Actions

代理控制协议:代理行为的准入控制

Marcelo Fernandez

机构 * TraslaIA

专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI

AI总结 本文提出ACP协议,通过静态风险评分与状态信号结合,控制代理行为,实验显示其能显著降低恶意行为执行率,同时通过形式化验证确保安全性和活性。

Comments 95 pages. Paper 1 of 6 in the Agent Governance Series (Papers 0-6). Zenodo: https://doi.org/10.5281/zenodo.19672575. Companion: P0 (arXiv:2604.17511), P2/IML (arXiv:2604.17517), P3/4 (zenodo.19708496), P5/RAM (arXiv:2604.22898), P6 (zenodo.19699460). Spec: https://github.com/chelof100/acp-framework-en. v1.30: series updated to 6 papers, P3/4 consolidated, P6 added

详情

展开后加载摘要…

URL PDF HTML 收藏