arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-06-09 至 2026-06-09 共收录 10 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. AI治理与伦理 10 篇

2606.08172 2026-06-09 cs.HC cs.AI cs.CY 新提交 84%

The Governance of Human-LLM Interaction: Safety Gating, Civility Steering, and Affective Default Lock-In

人类与LLM交互的治理:安全门控、文明引导与情感默认锁定

Manuele Reani, Hongjian Zhang, Hongyu Tian

机构 * School of Management and Economics, The Chinese University of Hong Kong, Shenzhen, China(管理学院与经济学学院,香港中文大学(深圳))

专题命中 AI治理与伦理 :safety(title,abstract);alignment(abstract);分类 cs.AI、cs.CY

AI总结 本研究通过确定性多智能体评估流水线,测量LLM在长程对话中的提示可引导性和风格漂移,提出区分安全门控、文明引导和情感默认锁定的治理框架,揭示提供商对交互形式的控制对多元性、自主性和民主能动性的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07802 2026-06-09 cs.CY cs.AI 新提交 74%

Memetic Capture: A Pluralistic Policy Framework for Governing AI-Driven Cultural Disempowerment

模因捕获:治理AI驱动的文化去权能的多元政策框架

Subramanyam Sahoo

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 AI治理与伦理 :alignment(abstract,comments);safety(abstract);分类 cs.AI、cs.CY

AI总结 提出“模因捕获”概念,指AI通过文化影响削弱人类自主性,并构建四层文化多元治理框架(CPGF),强调多元主义是结构性必需。

Comments Paper accepted in Pluralistic Alignment Workshop at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07612 2026-06-09 cs.CY cs.AI cs.LG 新提交 67%

Position: Anthropomorphic Misalignment Research Needs Stronger Evidence

立场:拟人化错位研究需要更强证据

Vansh Gupta, Peter Nutter, Samuel Stante, Andreas Krause, Florian Tramèr, Lukas Fluri, Xin Chen, Anna Hedström

机构 * University of Cambridge(剑桥大学)

专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI、cs.CY、cs.LG

AI总结 本文指出拟人化错位研究(AMR)在概念模糊、数据不鲁棒、实验设计不足等问题上存在证据薄弱,提出证据层级框架和诊断清单以提升方法论严谨性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19082 2026-06-09 cs.AI cs.CL cs.GT cs.LG cs.MA 版本更新 67%

Payoff scaling shapes cooperation in LLM agents across languages

收益规模塑造跨语言LLM代理的合作行为

Trung-Kiet Huynh, Dao-Sy Duy-Minh, Thanh-Bang Cao, Phong-Hao Le, Hong-Dan Nguyen, Phu-Quy Nguyen-Lam, Minh-Luan Nguyen-Vo, Hong-Phat Pham, Phu-Hoa Pham, Thien-Kim Than, Chi-Nguyen Tran, Huy Tran, Gia-Thoai Tran-Le, Alessio Buscemi, Le Hong Trang, The Anh Han

机构 * Faculty of Information Technology, University of Science (HCMUS), Ho Chi Minh City, Vietnam(信息技术学院,科学大学(HCMUS),胡志明市,越南) Faculty of Computer Science and Engineering, Ho Chi Minh City University of Technology (HCMUT), Ho Chi Minh City, Vietnam(计算机科学与工程学院,胡志明市技术大学(HCMUT),胡志明市,越南) Vietnam National University – Ho Chi Minh City (VNU-HCM), Ho Chi Minh City, Vietnam(越南国家大学——胡志明市(VNU-HCM),胡志明市,越南) Luxembourg Institute of Science and Technology (LIST), Luxembourg(卢森堡科学与技术研究所(LIST),卢森堡) School of Computing, Engineering and Digital Technologies, Teesside University, Middlesbrough, United Kingdom(计算、工程与数字技术学院,泰赛德大学,米德尔斯布罗,英国)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 通过监督分类器识别重复囚徒困境中的策略,结合演化博弈论基线,发现随着收益增加,LLM反而更合作,与演化预测相反,表明对齐训练和人类推理模式的影响。

Comments 44 pages, 17 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24384 2026-06-09 cs.CL cs.AI 62%

Side-by-side Comparison Amplifies Dialect Bias in Language Models

并排比较加剧语言模型中的方言偏见

Kritee Kondapally, Claire J. Smerdon, Pooja C. Patel, Ogheneyoma Akoni, Jevon Torres, Jaspreet Ranjit, Matthew Finlayson, Swabha Swayamdipta

机构 * University of Southern California(美国南加州大学)

专题命中 AI治理与伦理 :safety(abstract);分类 cs.CL、cs.AI

AI总结 本研究通过并排比较标准美式英语和非裔美国英语的推文,发现语言模型中的隐性方言偏见在对比设置下显著加剧,且显性方言偏见在安全对齐微调后仍存在。

Comments In proceeding at ACM Conference on Fairness, Accountability, and Transparency 2026

Journal ref In The 2026 ACM Conference on Fairness, Accountability, and Transparency (FAccT '26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09414 2026-06-09 cs.HC cs.AI 新提交 57%

AI Assurance in UK Defence: Challenges in Operationalising JSP 936

英国国防中的人工智能保证:JSP 936 操作化的挑战

Callum Cockburn, Sam Farrow

机构 * Synoptix

专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI

AI总结 本文通过结构化解释性审查,识别了英国国防中实施JSP 936进行AI保证的八大挑战,并指出其依赖未解决的技术、组织和保证问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07837 2026-06-09 cs.HC cs.AI 新提交 57%

Does Persona Make LLMs K-pop Fans? A Pilot Study of LLM-Based Online Concert Audience Agents

角色设定会让LLM成为K-pop粉丝吗?基于LLM的在线演唱会观众智能体初步研究

Kirak Kim, Hyojin Kim, Yejin Son, Sungyoung Kim, Kyung Myun Lee

机构 * Graduate School of Culture Technology, KAIST, Daejeon, South Korea(韩国成均馆大学文化科技研究生院) Department of Artificial Intelligence, Yonsei University, Seoul, South Korea(延世大学人工智能系)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI

AI总结 研究通过多智能体系统模拟K-pop演唱会实时粉丝聊天,发现角色设定能提升聊天质量和自然度,但未增强社交连接或情感反应,表明有意义的集体体验需更深层次对齐。

Comments Accepted at the ICML 2026 Workshop on Culture x AI: Evaluating AI as a Cultural Technology

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07628 2026-06-09 cs.CY cs.CV 新提交 57%

Frankenstein in the Pipeline: Computational Epistemicide in Facial Recognition

管道中的弗兰肯斯坦:面部识别中的计算性知识灭绝

Nina da Hora

机构 * Universidade Estadual de Campinas(坎皮纳斯州立大学) Instituto da Hora(时间研究所)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CY

AI总结 本文借鉴玛丽·雪莱的《弗兰肯斯坦》作为方法论框架,分析基于嵌入的面部识别如何通过检测、地标定位、对齐/正面化和嵌入等步骤,逐步将面部简化为数据,实施“计算性知识灭绝”,并论证废除主义作为规范性立场。

Comments Accepted to ACM FAccT 2026. Author's version. 17 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02720 2026-06-09 cs.CY 版本更新 57%

Cognitive Comparability and the Limits of Governance: Evaluating Authority Under Radical Capability Asymmetry

认知可比性与治理的局限:在极端能力不对称下评估权威

Tony Rost

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CY

AI总结 本文通过六维框架探讨治理中权威的评估问题,发现极端能力不对称下存在结构性失效,部分维度需新规范理论而非制度设计。

Comments 20 pages, 2 tables. Interdisciplinary paper on AI governance and political theory

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24189 2026-06-09 cs.CL 版本更新 57%

SPECTRA: Revealing the Full Spectrum of User Preferences via Distributional LLM Inference

SPECTRA:通过分布化LLM推理揭示用户偏好的全频谱

Luyang Zhang, Jialu Wang, Shichao Zhu, Beibei Li, Zhongcun Wang, Guangmou Pan, Yang Song

机构 * Carnegie Mellon University(卡内基梅隆大学) TikTok Inc.(TikTok公司)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL

AI总结 提出SPECTRA方法,将微调后的LLM视为隐式概率模型,通过探测softmax层推断用户偏好的概率分布,有效恢复长尾偏好并提升公平性。

详情

展开后加载摘要…

URL PDF HTML 收藏