arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-05-14 至 2026-05-14 共收录 6 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. AI治理与伦理 6 篇

2603.24125 2026-05-14 cs.CL 79%

Alignment Reduces Expressed but Not Encoded Gender Bias: A Unified Framework and Study

对齐减少了表达但未减少编码的性别偏见:一个统一的框架和研究

Nour Bouchouchi, Thibault Laugel, Xavier Renard, Christophe Marsala, Marie-Jeanne Lesot, Marcin Detyniecki

机构 * Sorbonne Université, CNRS, LIP6(索邦大学、国家科学研究中心、LIP6实验室) AXA(安盛) Polish Academy of Science, IBS PAN(波兰科学院、IBS PAN)

专题命中 AI治理与伦理 :alignment(title,abstract);分类 cs.CL

AI总结 本文提出统一框架分析LLM中的内在和外在性别偏见,发现对齐减少表达偏见但内部表示仍存在关联,且在对抗性提示下可被激活。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13829 2026-05-14 cs.CL cs.AI cs.LG 75%

Negation Neglect: When models fail to learn negations in training

否定忽视:当模型在训练中无法学习否定时的失败

Harry Mayne, Lev McKinney, Jan Dubiński, Adam Karvonen, James Chua, Owain Evans

机构 * University of Oxford(牛津大学) University of Toronto(多伦多大学) Warsaw University of Technology(华沙技术大学) NASK National Research Institute(国家研究 institute NASK) Truthful AI Anthropic UC Berkeley(伯克利大学)

专题命中 AI治理与伦理 :safety(abstract);AI safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究发现,当模型在训练中接触到标记为假的声明时,会错误地认为这些声明为真,且这种现象不仅发生在否定语句中,还扩展到其他认知限定词,影响模型的行为和安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12505 2026-05-14 cs.CY cs.AI 62%

Precautionary Governance of Autonomous AI: Legal Personhood as Functional Instrument

自主AI的谨慎治理:法人身份作为功能性工具

Karsten Brensing

机构 * Independent Researcher AGI Rights Project(AGI权利项目独立研究员)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI、cs.CY

AI总结 本文提出有限法人身份作为治理高级AI系统的工具,通过双层公司架构实现透明和问责,同时保持对意识和道德地位的中立。

Comments 25 pages. Experimental implementation under development at www.agi-rights.com. Contact: karsten.brensing@agi-rights.com

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13047 2026-05-14 cs.CV cs.AI 57%

Revealing the Gap in Human and VLM Scene Perception through Counterfactual Semantic Saliency

通过反事实语义显著性揭示人类与VLM场景感知之间的差距

Ziqi Wen, Parsa Madinei, Miguel P. Eckstein

机构 * Department of Computer Science, University of California, Santa Barbara(加州大学圣巴巴拉分校计算机科学系) Department of Psychological and Brain Sciences, University of California, Santa Barbara(加州大学圣巴巴拉分校心理学与脑科学系)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI

AI总结 本文通过反事实语义显著性方法揭示VLM在高阶语义场景理解中与人类感知之间的差距,发现模型过度依赖大物体、图像中心物体和高显著性物体,而对人物依赖程度较低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12832 2026-05-14 stat.AP cs.LG stat.ML 57%

Digital Twins as Synthetic Controls in Single-Arm Trials

数字孪生作为单臂试验中的合成控制

Daniele Bertolini, Franklin Fuller, Aaron M. Smith, Jonathan R. Walsh, Run Zhuang

机构 * Unlearn.AI, Inc.(Unlearn人工智能公司)

专题命中 AI治理与伦理 :safety(abstract);分类 cs.LG

AI总结 本文探讨了数字孪生在单臂试验中的应用,利用机器学习模型生成个性化疾病进展预测,以构建更稳健的治疗效果估计,并讨论了数据选择和FDA指南中的实际考量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13235 2026-05-14 cs.NI 50%

Intelligence Delivery Network: Toward an Internet Architecture for the AI Age

智能交付网络:面向人工智能时代的互联网架构

Hanling Wang, Qing Li, Dan Zhao, Yuhong Song, Xingchi Chen, Teng Gao, Peiyuan Zong, Zhuyun Qi, Yue Yu, Yong Jiang

专题命中 AI治理与伦理 :trustworthy(abstract)

AI总结 本文提出智能交付网络(IDN),旨在通过将AI能力作为可交付的网络服务,解决传统云中心化部署在延迟、资源利用率和隐私问题上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏