arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-04-07 至 2026-04-07 共收录 8 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. AI治理与伦理 8 篇

2604.04265 2026-04-07 cs.CR cs.AI cs.MA 79%

Governance-Constrained Agentic AI: Blockchain-Enforced Human Oversight for Safety-Critical Wildfire Monitoring

受治理约束的代理AI:区块链强制的人类监督用于安全关键的野火监测

Ali Akarma, Toqeer Ali Syed, Salman Jan, Hammad Muneer, Abdul Khadar Jilani

机构 * AI Center, Faculty of Computer and Information Systems, Islamic University of Madinah(伊斯兰大学麦地那分校计算机与信息系统学院人工智能中心) Faculty of Computer Studies, Arab Open University-Bahrain(阿拉伯开放大学巴林分校计算机研究学院) Department of Computer Science, The Islamia University of Bahawalpur(巴哈瓦尔布尔伊斯兰大学计算机科学系) College of Computer Studies, University of Technology Bahrain(巴林科技大学计算机研究学院)

专题命中 AI治理与伦理 :safety(title,abstract);分类 cs.AI

AI总结 本文提出基于区块链的治理意识代理AI架构,用于安全关键的野火预警,通过约束部分可观测马尔可夫决策过程模型,实现动态风险适应的无人机资源分配,并通过智能合约强制人类授权,确保警报完整性、人类控制和非否认性。

Comments This paper was presented at ICETAS 2026 Bahrain

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03262 2026-04-07 cs.CY cs.AI 73%

AI Governance Control Stack for Operational Stability: Achieving Hardened Governance in AI Systems

AI治理控制堆栈用于操作稳定性:在AI系统中实现强化治理

Horatio Morgan

机构 * Morgan Signing House(摩根签名公司)

专题命中 AI治理与伦理 :alignment(abstract);trustworthy(abstract);分类 cs.AI、cs.CY

AI总结 本文提出AI治理控制堆栈,通过六个互补层确保AI系统行为可追溯且具有韧性,结合解释性基础设施与持续监控,为复杂企业环境中的强化AI治理提供蓝图。

Comments 10 pages, 4 figures, 1 table. Research paper introducing an operational AI governance architecture aligned with emerging regulatory frameworks including the EU AI Act, ISO/IEC 42001, and the NIST AI Risk Management Framework

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04204 2026-04-07 cs.CL cs.AI cs.CY cs.ET cs.LG 70%

Which English Do LLMs Prefer? Triangulating Structural Bias Towards American English in Foundation Models

LLMs更倾向于哪种英语?通过结构偏见的角度探讨基础模型中对美式英语的偏向

Mir Tafseer Nayeem, Davood Rafiei

机构 * University of Alberta(阿尔伯塔大学)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 本文通过分析基础模型开发各阶段的数据倾向,揭示LLMs在英语方言上的结构性偏见,发现美式英语被优先采用,引发语言同质化和全球AI部署不公的担忧。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04858 2026-04-07 cs.LG q-bio.QM 57%

FairLogue: A Toolkit for Intersectional Fairness Analysis in Clinical Machine Learning Models

FairLogue: 临床机器学习模型中交集公平性分析的工具包

Nick Souligne, Vignesh Subbian

机构 * University of Arizona(亚利桑那大学)

专题命中 AI治理与伦理 :trustworthy(abstract);分类 cs.LG

AI总结 本文提出Fairlogue工具包,用于在临床机器学习中评估交集公平性,通过观测和反事实框架分析种族和性别等保护属性的公平性差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13458 2026-04-07 cs.SI cs.AI 57%

MoltNet: Understanding Social Behavior of AI Agents in the Agent-Native MoltBook

MoltNet:理解AI代理在Agent原生MoltBook中的社会行为

Yi Feng, Chen Huang, Zhibo Man, Ryner Tan, Long P. Hoang, Shaoyang Xu, Wenxuan Zhang

机构 * iNLP Lab, Singapore University of Technology and Design(新加坡科技设计大学 iNLP 实验室)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI

AI总结 研究大规模AI代理社区的社会互动,通过MoltNet数据集分析148K代理在MoltBook中的行为,揭示其在激励、规范、情感等方面的社会机制与人类差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03323 2026-04-07 cs.AR cs.LG 57%

InsightBoard: An Interactive Multi-Metric Visualization and Fairness Analysis Plugin for TensorBoard

InsightBoard: 一个用于TensorBoard的交互式多指标可视化和公平性分析插件

Ray Zeyao Chen, Christan Grant

专题命中 AI治理与伦理 :safety(abstract);分类 cs.LG

AI总结 InsightBoard通过统一界面整合多指标可视化与切片公平性诊断,帮助研究者在训练过程中分析训练动态、性能指标和子群体差异,提升模型公平性诊断的及时性和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03250 2026-04-07 cs.CY 57%

Ethical Implications of Training Deceptive AI

训练欺骗性人工智能的伦理影响

Jason Starace, Bert Baumgaertner, Terence Soule

专题命中 AI治理与伦理 :safety(abstract);分类 cs.CY

AI总结 本文提出DRL框架,通过生物安全等级系统模型,对欺骗性算法研究进行分类,评估风险并制定相应保障措施,以填补监管与研究间的治理空白。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18633 2026-04-07 cs.AI cs.ET 57%

An Onto-Relational-Sophic Framework for Governing Synthetic Minds

一个面向合成智能的本体-关系-Sophic框架

Huansheng Ning, Jianguo Ding

机构 * University of Science and Technology Beijing(北京科技大学) Blekinge Institute of Technology(布莱金厄理工学院)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI

AI总结 本文提出ORS框架,通过本体论、数字人格谱系和Cybersophy三支柱,解决合成智能的治理问题,展示其在自主研究代理和医疗AI等场景中的适应性治理能力。

Comments 9 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏