arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-07-08 至 2026-07-08 共收录 3 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. AI治理与伦理 3 篇

2601.06692 2026-07-08 cs.MA cs.CY 版本更新 57%

The Axiom of Consent: Friction Dynamics in Multi-Agent Coordination

同意公理:多智能体协调中的摩擦动力学

Murad Farzulla

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CY

AI总结 提出一个基于同意公理的协调摩擦形式化框架,定义核心三元组(对齐、利益、熵)和摩擦泛函,并通过多智能体强化学习实验发现线性对齐依赖被U型关系证伪,进而提出二次型改进。

Comments 94 pages; includes machine-checked Lean 4 proofs. v2: empirical-companion references reconciled to the companion's final findings; the MARL factorial appendix is split out to the companion paper; several formal statements corrected and honestly scoped; reference list repaired

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.14730 2026-07-08 cs.CY 57%

Funhouse Mirror or Echo Chamber? A Methodological Approach to Teaching Critical AI Literacy Through Metaphors

镜中回音还是回音室?通过隐喻教学批判性AI素养的方法论方法

Jasper Roe, Leon Furze, Mike Perkins

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CY

AI总结 本文通过隐喻教学方法,提出四种隐喻帮助学生理解AI特性,促进批判性AI素养教育。

Journal ref Journal of Interactive Media in Education 2025(1) (2025) 18, 1-15

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05442 2026-07-08 cs.GT 新提交 50%

The Oracle's Gambit: A Game-Theoretic Framework for Responsible AI Release

神谕者的策略:负责任的人工智能发布的博弈论框架

Christoph R. Landolt, Tobias Lorenz, Marta Kwiatkowska, Mario Fritz

专题命中 AI治理与伦理 :safety(abstract)

AI总结 研究在人工智能模型能力提升背景下,负责任的人工智能发布决策问题。核心方法是将其视为双层斯塔克尔伯格博弈,通过承诺窗口设定双方能力。主要贡献是指出福利取决于能力差距,明确两用模型关键在于访问顺序而非部署阈值。

详情

展开后加载摘要…

URL PDF HTML 收藏