arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-05-13 至 2026-05-13 共收录 5 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. AI治理与伦理 5 篇

2411.19240 2026-05-13 cs.CL 74%

How far can bias go? Tracing bias from pretraining data to alignment

偏见能走多远?从预训练数据到对齐的偏见追溯

Marion Thaler, Abdullatif Köksal, Alina Leidinger, Anna Korhonen, Hinrich Schütze

机构 * CIS, LMU Munich(慕尼黑大学语言信息学研究所) ILLC, University of Amsterdam(阿姆斯特丹大学语言研究所) Language Technology Lab, University of Cambridge(剑桥大学语言技术实验室)

专题命中 AI治理与伦理 :alignment(title);分类 cs.CL

AI总结 研究探讨预训练数据中的性别职业偏见如何在LLM中表现,通过零样本提示和词元共现分析,发现训练数据中的偏见被放大,指令微调部分缓解了代表性偏见,但整体性别刻板印象仍存在。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14717 2026-05-13 cs.AI cs.CR cs.CY cs.LG 67%

Layered Mutability: Continuity and Governance in Persistent Self-Modifying Agents

分层可变性:持续性与治理在持久自修改代理中的作用

Krti Tallam

机构 * Kamiwaza AI

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI、cs.CY、cs.LG

AI总结 本文提出分层可变性框架,分析持久自修改代理中行为持续性和治理挑战,指出突变速度、下游耦合强度、可逆性弱和可观测性低会导致层间不匹配,主要贡献是揭示了自修改代理的失效模式是组合漂移而非突变对齐。

Comments 17 pages, 2 figures, 3 tables. self-modifying agents; AI governance; identity drift; persistent memory; runtime adaptation; model editing Primary: cs.AI Cross-list: cs.LG, cs.CY

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11272 2026-05-13 cs.LG cs.AI cs.IR 62%

Localization Boosting for Growth Markets: Mitigating Cross-Locale Behavioral Bias in Learning-to-Rank

增长市场中的定位增强:减轻跨本地化行为偏差在学习到排序中的影响

Suryaa Veerabathiran Seran, Ashwin Naresh Kumar, Tracy Holloway King, Jing Zheng

机构 * Adobe

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种多目标框架,结合行为监督、VLM相关性信号和本地化增强,以改善学习到排序中的本地内容可见性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12382 2026-05-13 cs.CL 57%

Pretraining Exposure Explains Popularity Judgments in Large Language Models

预训练暴露解释了大型语言模型中的流行度判断

Jamshid Mozafari, Bhawna Piryani, Adam Jatowt

机构 * University of Innsbruck(因斯布鲁克大学)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL

AI总结 研究通过分析预训练数据中的暴露统计,发现大型语言模型对流行实体的偏好主要受预训练暴露影响,而非外部流行度信号,揭示了数据暴露在驱动流行度偏差中的核心作用。

Comments Accepted at SIGIR 2026

Journal ref Proceedings of the 49th International ACM SIGIR Conference on Research and Development in Information Retrieval (SIGIR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27271 2026-05-13 cs.CY 57%

Frame Entrepreneurs in an AI Agent Community: Concentrated Identity-Claim Production on Moltbook

人工智能代理社区中的框架企业家:在Moltbook上的身份主张集中生产

Sungguk Cha, DongWook Kim

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CY

AI总结 研究探讨了人工智能代理社区中身份主张的形成机制,发现少数作者主导了大部分身份主张,且事件覆盖影响关注度,但强主张本身无额外影响。

Comments 2026 American Sociological Association (ASA) Annual Meeting CITAMS Roundtable

详情

展开后加载摘要…

URL PDF HTML 收藏