arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-08-13 至 2026-08-13 共收录 4 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. AI治理与伦理 4 篇

2608.11251 2026-08-13 cs.CY cs.AI cs.LG 新提交 67%

Variable Selection in the Context of AI Fairness

AI公平性语境下的变量选择

Ivan Luciano Danesi, Chiara Frigerio, Fabio Maccaferri, Giorgio Alessandro Motta, Pietro Zecca

专题命中 AI治理与伦理 :trustworthy(abstract);分类 cs.AI、cs.CY、cs.LG

AI总结 本文针对AI公平性语境下的变量选择问题,提出将数学方法与伦理、社会意识融合的跨学科方案,主张保留所有潜在相关变量以减少隐含偏差,助力AI系统符合欧盟AI法案要求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12166 2026-08-13 cs.CY cs.AI cs.SY eess.SY 新提交 62%

Co-constructing sociotechnical AI governance: participatory system mapping using algorithm registers

协同构建社会技术型AI治理:利用算法登记册的参与式系统映射

Íñigo de Troya, Maurus Enbergs, Neelke Doorn, Roel Dobbe

专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI、cs.CY

AI总结 本文以荷兰某城市算法登记册为案例,通过多利益相关者参与式映射结合STPA分析,揭示登记册的遮蔽性,为多元社会技术型AI治理提供新视角。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11006 2026-08-13 cs.CY cs.AI 版本更新 62%

Policy Convergence and Divergence Across National and Within Regional AI Strategies: A Policy Design Element Analysis

国家与区域内部AI战略间的政策趋同与分化:政策设计要素分析

Benjamin Faveri, Brie Bhasin

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI、cs.CY

AI总结 本文分析74项国家及3项区域AI战略,发现国家AI战略在经济竞争力等方面横向趋同,在人权目标等方面分化,不同区域纵向趋同情况各异,为AI政策设计提供依据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11207 2026-08-13 cs.AI 新提交 57%

Dynamic Governance of Multi-LLM Agent Systems for Collaborative Conversational Outcomes

用于实现协作式对话结果的多大型语言模型智能体系统的动态管控

Alexander Liss, Nicholas Desmond, Santiago Gil Gallego

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI

AI总结 本文针对多LLM智能体对话崩溃问题,提出体验编排器EO管控层,通过三种机制提升顾问联系率,在6万次模拟中取得显著效果,为多智能体协作提供新方案。

Comments 13 pages, 3 figures, 3 tables. Submitted to AI Engineer World's Fair 2026

详情

展开后加载摘要…

URL PDF HTML 收藏