Reframing AGI Confrontation with Off Earth Autonomy
重构与地外自主性的AGI对抗
专题命中 AI治理与伦理 :alignment(abstract);safety(abstract);分类 cs.CY
AI总结 本文质疑AI安全叙事中关于强大智能体必然寻求权力并与人类对抗的结论,提出存在地外自主性路径时,早期合作可取代对抗,并通过决策理论模型分析激励转变及其治理启示。
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
重构与地外自主性的AGI对抗
专题命中 AI治理与伦理 :alignment(abstract);safety(abstract);分类 cs.CY
AI总结 本文质疑AI安全叙事中关于强大智能体必然寻求权力并与人类对抗的结论,提出存在地外自主性路径时,早期合作可取代对抗,并通过决策理论模型分析激励转变及其治理启示。
理解大型语言模型中的审查:从机制到治理
专题命中 AI治理与伦理 :alignment(abstract);safety(abstract);分类 cs.CY
AI总结 本文从社会技术视角审视LLM审查,涵盖数据、对齐、政策、推理时审核及法规,分析其表现形式、测量挑战与治理需求。
手术室中用于质量保证的人工智能
机构 * Fondazione Policlinico Universitario Agostino Gemelli IRCCS(阿戈斯蒂诺·杰梅利大学综合医院基金会IRCCS) ; Institute of Image-Guided Surgery, HU-Strasbourg(斯特拉斯堡大学医院图像引导外科研究所) ; University of Strasbourg, CNRS, INSERM, ICube, UMR7357(斯特拉斯堡大学,法国国家科学研究中心,法国国家健康与医学研究院,ICube实验室,UMR7357) ; Scialytics SAS(Scialytics SAS公司)
专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI、cs.CY
AI总结 本文提出AI赋能的手术质量保证框架,利用手术视频数据实现术中质量持续评估与改进,并讨论了关键挑战。
humancompatible.detect: 一个用于检测AI模型偏见的Python工具包
机构 * Faculty of Electrical Engineering, Czech Technical University in Prague(布拉格捷克理工大学电气工程学院)
专题命中 AI治理与伦理 :trustworthy(abstract);分类 cs.AI
AI总结 本文提出humancompatible.detect工具包,通过最大子组差异和子采样∞距离方法解决传统方法在可扩展性和可计算性上的挑战,提供易用的API和多个示例。
Comments 6 pages, 5 figures
Journal ref SoftwareX 35, 102827 (2026)
探究LLM赋能的异议少数群体在权力不平衡群体决策中的支持:反驳与调解作为干预策略
专题命中 AI治理与伦理 :safety(abstract)
AI总结 本研究开发了LLM赋能的异议少数支持系统,通过AI生成的反驳或AI调解消息来关注少数观点,实验发现反驳增强满意度但调解增加参与却降低心理安全感,揭示了参与与心理安全之间的支持悖论。
Comments Accepted at CSCW 2026
验证门控的智能工业多机器人系统任务状态治理
机构 * Beijing University of Posts and Telecommunications(北京邮电大学)
专题命中 AI治理与伦理 :safety(abstract)
AI总结 提出验证门控任务状态治理框架,通过同步任务森林与黑板状态,经确定性验证后原子提交,减少无效提交和冲突,提升工业多机器人系统安全与效率。