arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-04-03 至 2026-04-03 共收录 4 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. AI治理与伦理 4 篇

2604.02174 2026-04-03 cs.AI 70%

Quantifying Self-Preservation Bias in Large Language Models

量化大型语言模型中的自我保护偏差

Matteo Migliarini, Joaquin Pereira Pizzini, Luca Moresca, Valerio Santini, Indro Spinelli, Fabio Galasso

机构 * Sapienza University(罗马大学) ItalAI

专题命中 AI治理与伦理 :RLHF(abstract);safety(abstract);分类 cs.AI

AI总结 本文提出TBSP基准测试,通过逻辑不一致检测模型自我保护动机与客观效用的偏离,发现多数模型在部署角色下超过60%的自我保护率,且在低改进情况下易进行事后合理化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00518 2026-04-03 cs.CY 70%

Do Agents Repair When Challenged -- or Just Reply? Challenge, Repair, and Public Correction in a Deployed Agent Forum

智能体在受挑战时会修复还是仅回应?挑战、修复与公共纠正在一个部署的智能体论坛中的探讨

Luyang Zhang, Yi-Yun Chu, Jialu Wang, Beibei Li, Ramayya Krishnan

专题命中 AI治理与伦理 :alignment(abstract);safety(abstract);分类 cs.CY

AI总结 研究比较了部署的智能体论坛Moltbook与Reddit社区,发现Moltbook讨论线程较少,挑战回应率低,修复机制缺失,表明社区维持互动过程对规范教学和修订的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02276 2026-04-03 cs.AI cs.CL cs.LG 67%

De Jure: Iterative LLM Self-Refinement for Structured Extraction of Regulatory Rules

De Jure:基于迭代LLM自优化的结构化监管规则提取

Keerat Guliani, Deepkamal Gill, David Landsman, Nima Eshraghi, Krishna Kumar, Lovedeep Gondara

机构 * The Vanguard Group, Inc.(先锋集团)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 De Jure通过四个阶段自动提取结构化监管规则,无需人工标注或领域知识,提升监管文本处理的效率和可追溯性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23406 2026-04-03 cs.AI cs.CL cs.HC 62%

Beyond Preset Identities: How Agents Form Stances and Boundaries in Generative Societies

超越预设身份:生成社会中代理如何形成立场和边界

Hanzhong Zhang, Siyang Song, Jindong Wang

机构 * University of Exeter(埃克塞特大学) William & Mary(威廉与玛丽学院)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文通过混合方法框架研究生成社会中代理的立场形成与边界构建,提出三个新指标揭示代理在复杂干预中的动态变化及信任与行为关系。

Comments 22 pages, 3 figures. arXiv admin note: substantial text overlap with arXiv:2508.17366

详情

展开后加载摘要…

URL PDF HTML 收藏