arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-07-17 至 2026-07-17 共收录 3 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. AI治理与伦理 3 篇

2607.14353 2026-07-17 cs.CY cs.AI cs.SY eess.SY 新提交 62%

Unsafe at any AUC: Unlearned Lessons from Sociotechnical Disasters for Responsible AI

在任何AUC下都不安全:从社会技术灾难中汲取的关于负责任人工智能的未吸取教训

Joshua A. Kroll, Andrew Smart, R. Stuart Geiger, Abigail Z. Jacobs

专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI、cs.CY

AI总结 研究从切尔诺贝利等社会技术灾难中汲取未吸取的教训,探讨其对人工智能的启示,指出人工智能开发和使用可在组织风险处理、需求责任追溯及整体安全方法等方面受益,以避免类似灾难在现代系统中重演。

Comments Accepted to the Harvard Data Science Review, Volume 8(3), Summer 2026

Journal ref Harvard Data Science Review, Volume 8(3), Summer 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14309 2026-07-17 cs.AI cs.CY 新提交 62%

Traccia: An OpenTelemetry-Based Governance Platform for AI Systems

Traccia:一个基于OpenTelemetry的人工智能系统治理平台

Nutan Kumar Naik, Aditya Kumar Saroj, Vijay Prasad Poudel, Saurav Samantray, Abhishek Patel

机构 * National Institute of Technology Rourkela(鲁尔基国立技术学院)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI、cs.CY

AI总结 研究针对大语言模型和人工智能驱动智能体发展带来的软件治理问题,提出基于OpenTelemetry构建多层次人工智能治理堆栈Traccia,通过添加遥测数据等解决对齐问题,自动创建合规证据包,为企业管理自主人工智能系统创建机器可读基础。

Comments 26 pages, 2 figures, 3 tables, Declaration of generative AI and AI-assisted technologies in the writing process, Declaration of competing interest

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14585 2026-07-17 econ.GN cs.AI q-fin.EC 新提交 57%

Governing Artificial Intelligence: Public Preferences and Regulatory Options

治理人工智能:公众偏好与监管选择

Magnus Lundgren, Jonas Tallberg

机构 * Department of Political Science, University of Gothenburg(哥德堡大学政治系) Department of Political Science, Stockholm University(斯德哥尔摩大学政治系)

专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI

AI总结 研究人工智能监管问题,通过在七个国家进行联合调查实验,发现公民强烈支持监管AI,普遍优先考虑安全、公共治理和国际方法,揭示了主流监管方法与公民偏好的系统性错位。

Comments Main paper 16 pages; supplementary materials 51 pages

详情

展开后加载摘要…

URL PDF HTML 收藏