arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-06-24 至 2026-06-24 共收录 7 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. AI治理与伦理 7 篇

2606.23380 2026-06-24 cs.CY 新提交 88%

Affective AI Safety: The Missing Piece in LLM Safety

情感AI安全:LLM安全中缺失的一环

Carolin Ifländer, Alba Curry, Flor Miriam Plaza-del-Arco, Amanda Cercas Curry

专题命中 AI治理与伦理 :safety(title,abstract);AI safety(title,abstract);分类 cs.CY

AI总结 本文提出情感安全作为AI安全的新类别,分类情感伤害类型,并指出现有框架未能充分应对,呼吁建立专门框架处理累积性、关系性和身份层面的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.00069 2026-06-24 cs.CY cs.AI cs.CL 版本更新 82%

Societal Alignment Frameworks Can Improve LLM Alignment

社会对齐框架可以改进大语言模型对齐

Karolina Stańczak, Nicholas Meade, Mehar Bhatia, Hattie Zhou, Konstantin Böttinger, Jeremy Barnes, Jason Stanley, Jessica Montgomery, Richard Zemel, Nicolas Papernot, Nicolas Chapados, Denis Therien, Timothy P. Lillicrap, Ana Marasović, Sylvie Delacroix, Gillian K. Hadfield, Siva Reddy

机构 * ETH Zurich(苏黎世联邦理工学院) Mila, McGill University(麦吉尔大学米尔人工智能实验室) University of Cambridge(剑桥大学) Columbia University(哥伦比亚大学) University of Toronto, Google DeepMind(多伦多大学与DeepMind) McGill University, ServiceNow(麦吉尔大学与ServiceNow) Google DeepMind(谷歌DeepMind) University of Utah(犹他大学) King's College London(伦敦国王学院) Johns Hopkins University(约翰霍普金斯大学) Mila, McGill University, ServiceNow(麦吉尔大学米尔人工智能实验室与ServiceNow)

专题命中 AI治理与伦理 :alignment(title,abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 本文提出借鉴社会、经济和契约对齐框架来改进大语言模型对齐,探讨不确定性在其中的作用,并将目标未指定性视为机遇而非缺陷,同时强调参与式对齐界面设计的必要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08245 2026-06-24 cs.CV cs.AI 版本更新 79%

When Language Overwrites Vision: Over-Alignment and Geometric Debiasing in Vision-Language Models

语言覆盖视觉:视觉语言模型中的过度对齐与几何去偏

Harshvardhan Saini, Samyak Jha, Yiming Tang, Dianbo Liu

机构 * Indian Institute of Technology Dhanbad(印度理工学院丹巴德分校) National University of Singapore(新加坡国立大学)

专题命中 AI治理与伦理 :alignment(title,abstract);分类 cs.AI

AI总结 本文研究视觉语言模型中过度对齐导致的幻觉问题,提出几何去偏方法,通过投影消除文本子空间影响,减少幻觉并提升长文本生成性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22560 2026-06-24 cs.LG cs.AI 62%

Operationalizing Fairness: Post-Hoc Threshold Optimization Under Hard Resource Limits

将公平性操作化:在硬性资源限制下的事后阈值优化

Moirangthem Tiken Singh, Amit Kalita, Sapam Jitu Singh

机构 * Department of Computer Science and Engineering, DUIET, Dibrugarh University, Assam, India(迪布鲁大学计算机科学与工程系,DUIET,阿萨姆,印度) Department of Computer Science and Engineering, MIT, Manipur University, 795003, India(曼尼普尔大学计算机科学与工程系,MIT,曼尼普尔大学,印度)

专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种事后阈值优化框架,在硬性资源限制下平衡安全、效率与公平性,通过全局阈值确保合规,并证明关键性质,实验表明资源限制主导伦理优先级,框架在资源受限下保持高风险识别能力。

Journal ref Neurocomputing (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24585 2026-06-24 cs.AI 新提交 57%

LLMs Prompted for Legal Context Object More: Overrefusal from Small On-Premises LLMs in Criminal Legal Context

LLMs在刑事法律语境中被提示为法律上下文对象:小型本地LLM的过度拒绝

Anastasiia Kucherenko, François Brouchoud, Dimitri Percia David, Andrei Kucharavy

机构 * IEM, HEG, HES-SO Valais-Wallis(瓦莱州-瓦利斯高等专业学院,管理与工程学院,经济与酒店管理学院)

专题命中 AI治理与伦理 :jailbreak(abstract);分类 cs.AI

AI总结 研究小型本地LLM在法律提示中的过度拒绝现象,发现权威性前缀(如“国家最高法院助理”)使拒绝率提高2-20倍,而角色扮演前缀效果不一,表明模型在真实机构用户可能引入的上下文框架下不稳定。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23860 2026-06-24 cs.CY 新提交 57%

World Artificial Intelligence Cooperation Organization (WAICO): Mapping an Emerging Institution in the Global AI Governance Regime Complex

世界人工智能合作组织(WAICO):全球人工智能治理体制复合体中一个新兴机构的映射

William Guey, Pierrick Bougault, Wei Zhang, Vitor D. de Moura, José O. Gomes

专题命中 AI治理与伦理 :safety(abstract);分类 cs.CY

AI总结 本文通过编码15项国际AI治理文书和机构,分析中国提议的世界人工智能合作组织(WAICO)的设计特征,发现其结合了成员国开放、无价值观测试和发展优先议程,构成全球AI治理中基于主权与发展的第二极。

Comments 13 pages, 2 figures, 1 table. Data and code: https://github.com/williamguey/waico-ai-governance

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01127 2026-06-24 cs.CR 版本更新 50%

Multi-Agent LLM Governance for Safe Two-Timescale Reinforcement Learning in SDN-IoT Defense

多智能体LLM治理:SDN-IoT防御中安全的两时间尺度强化学习

Saeid Jamshidi, Negar Shahabi, Foutse Khomh, Carol Fung, Mohammad Hamdaqa

专题命中 AI治理与伦理 :safety(abstract)

AI总结 提出两时间尺度SDN-IoT防御方案,快时间尺度使用PPO智能体进行控制器感知的缓解,慢时间尺度使用多智能体LLM治理引擎生成可审计的策略更新,在保证安全约束下提升防御性能。

详情

展开后加载摘要…

URL PDF HTML 收藏