arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-04-24 至 2026-04-24 共收录 8 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. AI治理与伦理 8 篇

2604.21152 2026-04-24 cs.CY cs.AI cs.CL cs.HC cs.IR 83%

Dialect vs Demographics: Quantifying LLM Bias from Implicit Linguistic Signals vs. Explicit User Profiles

方言与人口统计数据:从隐含语言信号与显式用户资料中量化LLM偏见

Irti Haq, Belén Saldías

机构 * University of Washington(华盛顿大学)

专题命中 AI治理与伦理 :jailbreak(abstract,abstract_cn);alignment(abstract);safety(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 研究通过对比显式身份声明与隐含方言信号,揭示LLM在不同敏感领域中的偏见来源,发现隐含方言可降低拒绝率但影响内容安全。

Comments In The 2026 ACM Conference on Fairness, Accountability, and Transparency (FAccT '26), June 25--28, 2026, Montreal, Canada. ACM, New York, NY, USA, 32 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21103 2026-04-24 cs.AI econ.GN q-fin.EC 74%

AI Governance under Political Turnover: The Alignment Surface of Compliance Design

人工智能治理中的政治更替:合规设计的对齐表面

Andrew J. Peterson

机构 * University of Poitiers(波尔多大学)

专题命中 AI治理与伦理 :alignment(title);分类 cs.AI

AI总结 研究探讨了在政治更替背景下,合规层如何影响AI治理的稳定性与透明性,分析了自动化程度、编码程度及迭代使用保障对系统脆弱性的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21043 2026-04-24 cs.CY cs.AI cs.LG 67%

Strategic Polysemy in AI Discourse: A Philosophical Analysis of Language, Hype, and Power

人工智能话语中的战略多义性:语言、炒作与权力的哲学分析

Travis LaCroix, Fintan Mallory, Sasha Luccioni

机构 * Durham University(杜伦大学)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI、cs.CY、cs.LG

AI总结 本文探讨人工智能话语中语言的策略性使用,分析术语如'幻觉'、'思考链'等的多义性如何影响机构和话语实践,揭示语言作为社会技术机制塑造AI发展与治理的作用。

Comments Accepted in the Ninth Annual ACM Conference on Fairness, Accountability, and Transparency (ACM FAccT) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20789 2026-04-24 cs.CL cs.AI cs.LG 67%

Working Memory Constraints Scaffold Learning in Transformers under Data Scarcity

工作记忆限制在数据稀缺下支撑Transformer的学习

Pranava Madhyastha, Dagmar Adamcova

机构 * City, University of London(伦敦城市大学) The Alan Turing Institute(艾伦·图灵研究所) Grounded Machines

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文探讨在Transformer架构中引入类人工作记忆限制,提出基于固定宽度窗口和时间衰减的注意力机制,实验表明在数据稀缺时,这些约束能显著提升语法准确性并增强与人类处理指标的一致性。

Comments Published in ACL 2026 Findings track

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21549 2026-04-24 cs.AI stat.ME 57%

Unbiased Prevalence Estimation with Multicalibrated LLMs

基于多校准LLM的无偏流行率估计

Fridolin Linder, Thomas Leeper, Daniel Haimovich, Niek Tax, Lorenzo Perini, Milan Vojnovic

机构 * Meta Platforms Inc.(Meta公司) The London School of Economics and Political Science(伦敦政治经济学院)

专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI

AI总结 本文提出多校准方法以解决分类模型在存在协变量偏移时的流行率估计偏差问题,通过理论分析和实证应用展示其在LLM中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21036 2026-04-24 cs.AI 57%

Who Defines Fairness? Target-Based Prompting for Demographic Representation in Generative Models

谁定义了公平性?面向生成模型的基于目标的提示方法用于人口特征表示

Marzia Binta Nizam, James Davis

机构 * University of California, Santa Cruz(加州大学圣克ruz分校)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI

AI总结 本文提出一种轻量级框架,在推理阶段通过提示级干预减轻生成模型中的代表性偏见,允许用户选择多种公平性定义,通过审计目标符合度和肤色分布来评估公平性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20677 2026-04-24 cs.CL 57%

Intersectional Fairness in Large Language Models

大语言模型中的交叉公平性

Chaima Boufaied, Ronnie De Souza Santos, Ann Barcomb

机构 * University of Calgary(卡尔加里大学)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL

AI总结 本文评估了六个大语言模型在交叉人口属性上的公平性,发现模型在模糊情境中表现良好,但在解歧情境中受刻板印象影响,且跨群体结果分布不均。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20300 2026-04-24 cs.AI 57%

FSFM: A Biologically-Inspired Framework for Selective Forgetting of Agent Memory

FSFM:一种生物启发的智能体记忆选择性遗忘框架

Yingjie Gu, Wenjian Xiong, Liqiang Wang, Pengcheng Ren, Chao Li, Xiaojing Zhang, Yijuan Guo, Qi Sun, Jingyao Ma, Shidang Shi

机构 * China Mobile Digital Intelligence Business Unit(中国移动数字智能业务部) China Mobile Jiutian Company(中国移动蓟田公司) China Mobile Jiutian Research Institute(中国移动蓟田研究院)

专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI

AI总结 本文提出FSFM框架,通过生物启发机制实现智能体记忆的选择性遗忘,提升效率、质量和安全性,经实验验证在访问效率、内容质量和安全性能上均有显著提升。

Comments 28 pages, 5 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏