arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-04-29 至 2026-04-29 共收录 5 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. AI治理与伦理 5 篇

2604.25654 2026-04-29 cs.CL 79%

Progressing beyond Art Masterpieces or Touristic Clichés: how to assess your LLMs for cultural alignment?

超越艺术杰作或旅游陈词滥调:如何评估您的LLM文化对齐性?

António Branco, João Silva, Nuno Marques, Luis Gomes, Ricardo Campos, Raquel Sequeira, Sara Nerea, Rodrigo Silva, Miguel Marques, Rodrigo Duarte, Artur Putyato, Diogo Folques, Tiago Valente

机构 * University of Lisbon(里斯本大学) University of Beira Interior(贝拉内尔大学)

专题命中 AI治理与伦理 :alignment(title,abstract);分类 cs.CL

AI总结 本文提出文化评估数据集的设计指南,并通过对比实验展示其在区分文化专精模型与非专精模型方面的有效性。

Comments RESOURCEFUL-2026 Workshop at LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25249 2026-04-29 cs.CL cs.AI 73%

Below-Chance Blindness: Prompted Underperformance in Small LLMs Produces Positional Bias Rather than Answer Avoidance

低于平均水平的盲目性:在小语言模型中受提示的欠绩效产生位置偏差而非答案回避

Jon-Paul Cacioli

机构 * Independent Researcher(独立研究者)

专题命中 AI治理与伦理 :safety(abstract);AI safety(abstract);分类 cs.CL、cs.AI

AI总结 研究探讨了在小规模语言模型中,受提示的欠绩效是否导致位置偏差而非答案回避,发现模型在受指令下表现出位置偏好的倾向,而非刻意回避答案。

Comments 10 pages, 2 figures, 2 tables. Pre-registered: https://osf.io/6zftv/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25684 2026-04-29 cs.AI 70%

Think Before You Act -- A Neurocognitive Governance Model for Autonomous AI Agents

在行动前思考--一种用于自主AI代理的神经认知治理模型

Eranga Bandara, Ross Gore, Asanga Gunaratna, Sachini Rajapakse, Isurunima Kularathna, Ravi Mukkamala, Sachin Shetty, Xueping Liang, Amin Hass, Tharaka Hewa, Abdul Rahman, Christopher K. Rhea, Anita H. Clayton, Preston Samuel, Atmaram Yarlagadda

机构 * Old Dominion University(老奥德纳大学) AI Motion Labs(AI运动实验室) Department of Psychiatry and Neurobehavioral Sciences(精神病学与神经行为科学系) University of Virginia School of Medicine(弗吉尼亚大学医学院) Florida International University(佛罗里达国际大学) Accenture Technology Labs(埃森哲技术实验室) Center for Wireless Communications(无线通信中心) University of Oulu(奥卢大学) Blanchfield Army Community Hospital(布莱恩菲尔德陆军社区医院) McDonald Army Health Center(麦克唐纳陆军健康中心)

专题命中 AI治理与伦理 :alignment(abstract);safety(abstract);分类 cs.AI

AI总结 本文提出一种神经认知治理框架,通过将人类自我治理过程映射到LLM驱动的代理推理中,实现95%的合规准确率和零人工监督升级,展示嵌入治理的代理推理能产生更一致、可解释和可审计的合规性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03254 2026-04-29 cs.CY cs.AI 62%

Is your AI Model Accurate Enough? The Difficult Choices Behind Rigorous AI Development and the EU AI Act

你的AI模型准确吗?严格AI开发背后的艰难选择以及欧盟AI法案

Lucas G. Uberti-Bona Marin, Bram Rijsbosch, Kristof Meding, Gerasimos Spanakis, Gijs van Dijck, Konrad Kollnig

机构 * Law \& Tech Lab, Maastricht University Maastricht The Netherlands University of Tübingen - Computational Law Lab TÜBingen Germany Law \& Tech Lab, Maastricht University University of Tübingen - Computational Law Lab

专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI、cs.CY

AI总结 本文探讨AI准确性的评估依赖于情境相关的规范决策,通过欧盟AI法案分析四个关键选择,揭示技术规范在AI部署中的作用。

Comments To appear in the 2026 ACM Conference on Fairness, Accountability, and Transparency (ACM FAccT '26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13400 2026-04-29 cs.CY cs.AI 62%

Justice in Judgment: Unveiling (Hidden) Bias in LLM-assisted Peer Reviews

审判中的公正:揭示(隐藏)在LLM辅助同行评审中的偏见

Sai Suresh Macharla Vasu, Ivaxi Sheth, Hui-Po Wang, Ruta Binkyte, Mario Fritz

机构 * CISPA Helmholtz Center for Information Security(CISPA 欧洲信息安全研究中心) Saarland University(萨尔兰大学)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI、cs.CY

AI总结 本文研究LLM生成的同行评审中的偏见,通过操控作者元数据发现机构偏见、资历偏好和性别影响,揭示隐性偏见在软评分中的显现。

Comments Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏