arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-04-30 至 2026-04-30 共收录 5 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. AI治理与伦理 5 篇

2603.02259 2026-04-30 cs.MA cs.LG cs.RO 89%

The Alignment Flywheel: A Governance-Centric Hybrid MAS for Architecture-Agnostic Safety

对齐飞轮:一种以治理为中心的混合MAS架构用于架构无关的安全性

Elias Malomgré, Pieter Simoens

机构 * IDLab, Ghent University - imec, Belgium(ID实验室,根特大学-imec,比利时)

专题命中 AI治理与伦理 :safety(title,abstract);alignment(title,abstract);分类 cs.LG

AI总结 本文提出一种以治理为中心的混合MAS架构,通过分离决策生成与安全治理,解决自主决策组件部署后的安全行为透明性问题,采用补丁局部性原则实现安全故障的低成本修复。

Comments Accepted for the EMAS workshop at AAMAS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21843 2026-04-30 econ.GN cs.CY q-fin.EC 79%

The economic alignment problem of artificial intelligence

人工智能的经济协调问题

Daniel W. O'Neill, Stefano Vrizzi, Noemi Luna Carmeno, Felix Creutzig, Jefim Vogel

专题命中 AI治理与伦理 :alignment(title,abstract);分类 cs.CY

AI总结 本文探讨人工智能研究中的'对齐问题'亦为经济协调问题,提出后增长研究可降低AI风险,通过替代优化为满意化、利用社会与行星边界来指导发展,以及限制系统反弹。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22227 2026-04-30 cs.CY cs.AI cs.HC cs.NE 73%

A Co-Evolutionary Theory of Human-AI Coexistence: Mutualism, Governance, and Dynamics in Complex Societies

人类与人工智能共存的共进化理论:互惠、治理与复杂社会中的动态

Somyajit Chakraborty

机构 * School of Chemistry and Chemical Engineering(化学与化工学院)

专题命中 AI治理与伦理 :alignment(abstract);safety(abstract);分类 cs.AI、cs.CY

AI总结 本文提出在治理下的人机共存互惠框架,通过共进化关系设计人类与AI的共存,强调互惠、可逆性、心理安全和社会合法性,通过动态系统模型分析共存条件与稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25933 2026-04-30 cs.CY cs.AI cs.CL 67%

A Scoping Review of LLM-as-a-Judge in Healthcare and the MedJUDGE Framework

对LLM-as-a-Judge在医疗领域的综述及MedJUDGE框架

Chenyu Li, Zohaib Akhtar, Mingu Kwak, Yuelyu Ji, Hang Zhang, Tracey Obi, Yufan Ren, Xizhi Wu, Sonish Sivarajkumar, Harold P. Lehmann, Shyam Visweswaran, Michael J. Becich, Danielle L. Mowery, Renxuan Liu, Haoyang Sun, Yanshan Wang

机构 * Department of Biomedical Informatics, School of Medicine, University of Pittsburgh(匹兹堡大学医学院生物医学信息学系) Department of Health Information Management, School of Health and Rehabilitation Sciences, University of Pittsburgh(匹兹堡大学健康与康复科学学院健康信息管理系) OpenCura, Health Innovation Consortium(OpenCura健康创新联盟) Northwestern University, Kellogg School of Management(西北大学凯洛格管理学院) Intelligent Systems Program, School of Computing and Information, University of Pittsburgh(匹兹堡大学计算与信息学院智能系统项目) Johns Hopkins University School of Medicine Biomedical Informatics and Data Science(约翰霍普金斯大学医学院生物医学信息学与数据科学) Clinical and Translational Science Institute, University of Pittsburgh(匹兹堡大学临床与转化科学研究所) Institute for Biomedical Informatics, University of Pennsylvania(宾夕法尼亚大学生物医学信息学研究所) Data Science, School of Computing and Information, University of Pittsburgh(匹兹堡大学计算与信息学院数据科学)

专题命中 AI治理与伦理 :safety(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 本文综述了LLM-as-a-Judge在医疗领域的应用现状,指出其在验证严谨性、偏见评估和治理方面存在不足,并提出MedJUDGE框架以提升医疗领域LLM-as-a-Judge系统的有效性与安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13387 2026-04-30 cs.CY cs.AI 62%

Uncovering AI Governance Themes in EU Policies using BERTopic and Thematic Analysis

利用BERTopic和主题分析揭示欧盟政策中的AI治理主题

Delaram Golpayegani, Marta Lasek-Markey, Arjumand Younus, Aphra Kerr, Dave Lewis

机构 * ADAPT Centre(ADAPT中心) Trinity College Dublin, Dublin, Ireland(都柏林大学三一学院) University College Dublin, Dublin, Ireland(都柏林大学)

专题命中 AI治理与伦理 :trustworthy(abstract);分类 cs.AI、cs.CY

AI总结 本文通过BERTopic和主题分析方法,研究欧盟AI治理政策中的主要主题,分析其演变和核心贡献。

Journal ref Frontiers in Artificial Intelligence and Applications, Volume 416: Legal Knowledge and Information Systems, 2025, pp. 400 - 411

详情

展开后加载摘要…

URL PDF HTML 收藏