Affective AI Safety: The Missing Piece in LLM Safety
情感AI安全:LLM安全中缺失的一环
专题命中 AI治理与伦理 :safety(title,abstract);AI safety(title,abstract);分类 cs.CY
AI总结 本文提出情感安全作为AI安全的新类别,分类情感伤害类型,并指出现有框架未能充分应对,呼吁建立专门框架处理累积性、关系性和身份层面的影响。
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
情感AI安全:LLM安全中缺失的一环
专题命中 AI治理与伦理 :safety(title,abstract);AI safety(title,abstract);分类 cs.CY
AI总结 本文提出情感安全作为AI安全的新类别,分类情感伤害类型,并指出现有框架未能充分应对,呼吁建立专门框架处理累积性、关系性和身份层面的影响。
社会对齐框架可以改进大语言模型对齐
机构 * ETH Zurich(苏黎世联邦理工学院) ; Mila, McGill University(麦吉尔大学米尔人工智能实验室) ; University of Cambridge(剑桥大学) ; Columbia University(哥伦比亚大学) ; University of Toronto, Google DeepMind(多伦多大学与DeepMind) ; McGill University, ServiceNow(麦吉尔大学与ServiceNow) ; Google DeepMind(谷歌DeepMind) ; University of Utah(犹他大学) ; King's College London(伦敦国王学院) ; Johns Hopkins University(约翰霍普金斯大学) ; Mila, McGill University, ServiceNow(麦吉尔大学米尔人工智能实验室与ServiceNow)
专题命中 AI治理与伦理 :alignment(title,abstract);分类 cs.CL、cs.AI、cs.CY
AI总结 本文提出借鉴社会、经济和契约对齐框架来改进大语言模型对齐,探讨不确定性在其中的作用,并将目标未指定性视为机遇而非缺陷,同时强调参与式对齐界面设计的必要性。
语言覆盖视觉:视觉语言模型中的过度对齐与几何去偏
机构 * Indian Institute of Technology Dhanbad(印度理工学院丹巴德分校) ; National University of Singapore(新加坡国立大学)
专题命中 AI治理与伦理 :alignment(title,abstract);分类 cs.AI
AI总结 本文研究视觉语言模型中过度对齐导致的幻觉问题,提出几何去偏方法,通过投影消除文本子空间影响,减少幻觉并提升长文本生成性能。
将公平性操作化:在硬性资源限制下的事后阈值优化
机构 * Department of Computer Science and Engineering, DUIET, Dibrugarh University, Assam, India(迪布鲁大学计算机科学与工程系,DUIET,阿萨姆,印度) ; Department of Computer Science and Engineering, MIT, Manipur University, 795003, India(曼尼普尔大学计算机科学与工程系,MIT,曼尼普尔大学,印度)
专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI、cs.LG
AI总结 本文提出一种事后阈值优化框架,在硬性资源限制下平衡安全、效率与公平性,通过全局阈值确保合规,并证明关键性质,实验表明资源限制主导伦理优先级,框架在资源受限下保持高风险识别能力。
Journal ref Neurocomputing (2026)
LLMs在刑事法律语境中被提示为法律上下文对象:小型本地LLM的过度拒绝
机构 * IEM, HEG, HES-SO Valais-Wallis(瓦莱州-瓦利斯高等专业学院,管理与工程学院,经济与酒店管理学院)
专题命中 AI治理与伦理 :jailbreak(abstract);分类 cs.AI
AI总结 研究小型本地LLM在法律提示中的过度拒绝现象,发现权威性前缀(如“国家最高法院助理”)使拒绝率提高2-20倍,而角色扮演前缀效果不一,表明模型在真实机构用户可能引入的上下文框架下不稳定。
世界人工智能合作组织(WAICO):全球人工智能治理体制复合体中一个新兴机构的映射
专题命中 AI治理与伦理 :safety(abstract);分类 cs.CY
AI总结 本文通过编码15项国际AI治理文书和机构,分析中国提议的世界人工智能合作组织(WAICO)的设计特征,发现其结合了成员国开放、无价值观测试和发展优先议程,构成全球AI治理中基于主权与发展的第二极。
Comments 13 pages, 2 figures, 1 table. Data and code: https://github.com/williamguey/waico-ai-governance
多智能体LLM治理:SDN-IoT防御中安全的两时间尺度强化学习
专题命中 AI治理与伦理 :safety(abstract)
AI总结 提出两时间尺度SDN-IoT防御方案,快时间尺度使用PPO智能体进行控制器感知的缓解,慢时间尺度使用多智能体LLM治理引擎生成可审计的策略更新,在保证安全约束下提升防御性能。