arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 1824 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. AI治理与伦理 1824 篇

1907.03843 2020-12-23 cs.CY cs.AI 81%

Norms for Beneficial A.I.: A Computational Analysis of the Societal Value Alignment Problem

Pedro Fernandes, Francisco C. Santos, Manuel Lopes

专题命中 AI治理与伦理 :alignment(title,abstract);分类 cs.AI、cs.CY

Journal ref AI Communications, vol. 33, no. 3-6, pp. 155-171, 2020

详情

展开后加载摘要…

URL PDF HTML 收藏
2012.11705 2020-12-23 cs.AI cs.CY 81%

Taking Principles Seriously: A Hybrid Approach to Value Alignment

Tae Wan Kim, John Hooker, Thomas Donaldson

专题命中 AI治理与伦理 :alignment(title,abstract);分类 cs.AI、cs.CY

Comments arXiv admin note: substantial text overlap with arXiv:1907.05447

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13372 2026-05-11 cs.CY 80%

Semantic Alignment Between Normative Theories of Ethics and the European Union Artificial Intelligence Act: A Transformer-Based Semantic Textual Similarity Analysis

伦理规范理论与欧盟人工智能法案之间的语义对齐:基于Transformer的语义文本相似性分析

Mehmet Murat Albayrakoglu, Mehmet Nafiz Aydin

专题命中 AI治理与伦理 :alignment(title,abstract);分类 cs.CY

AI总结 本文通过Transformer模型分析伦理理论与欧盟AI法案的语义对齐,发现义务伦理学在法案两部分中具有最高相似性。

Comments 18 pages, 5 tables, 3 figures; the concept of alignment introduced as an indication of influence

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.02273 2025-05-29 cs.CL 80%

Language Model Alignment in Multilingual Trolley Problems

Zhijing Jin, Max Kleiman-Weiner, Giorgio Piatti, Sydney Levine, Jiarui Liu, Fernando Gonzalez, Francesco Ortu, András Strausz, Mrinmaya Sachan, Rada Mihalcea, Yejin Choi, Bernhard Schölkopf

机构 * Max Planck Institute for Intelligent Systems(马克斯·普朗克智能系统研究所) ETH Zürich(苏黎世联邦理工学院) University of Toronto(多伦多大学) University of Washington(华盛顿大学) Allen Institute for AI (AI2)(人工智能研究所) Carnegie Mellon University(卡内基梅隆大学) University of Trieste(特里斯坦大学) University of Michigan(密歇根大学)

专题命中 AI治理与伦理 :alignment(title,abstract);分类 cs.CL

Comments ICLR 2025 Spotlight, Best Paper @ NeurIPS 2024 Workshop on Pluralistic Alignment

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12426 2026-06-12 cs.CY cs.CL cs.LG 新提交 80%

Two Wrongs, No Right: Auditing Social-Desirability Bias in LLM Annotators for Computational Social Science

两个错误,没有正确:审计计算社会科学中LLM标注者的社会期望偏差

Varun Kotte

机构 * Varun Kotte

专题命中 AI治理与伦理 :alignment(abstract);safety(abstract);trustworthy(abstract);分类 cs.CL、cs.CY、cs.LG

AI总结 研究审计了三个开源指令微调模型在TweetEval任务中的社会期望偏差,发现模型存在宽大、过度纠正和中性偏差,且提示干预无法纠正,聚合指标可能掩盖实质结论错误。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02686 2026-02-04 cs.CL cs.AI cs.CR cs.LG 80%

Monotonicity as an Architectural Bias for Robust Language Models

单调性作为提升语言模型鲁棒性的架构偏倚

Patrick Cooper, Alireza Nadali, Ashutosh Trivedi, Alvaro Velasquez

机构 * Department of Computer Science, University of Colorado Boulder, Boulder, CO, USA(计算机科学系,科罗拉多大学波尔德分校,波尔德,科罗拉多州,美国)

专题命中 AI治理与伦理 :alignment(abstract);safety(abstract);jailbreak(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究通过在Transformer模型中引入单调性约束,提升语言模型对对抗攻击的鲁棒性,同时保持预训练性能。

Comments 12 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10573 2025-11-14 cs.LG cs.AI cs.CL cs.HC cs.MA 80%

Towards Emotionally Intelligent and Responsible Reinforcement Learning

Garapati Keerthana, Manik Gupta

专题命中 AI治理与伦理 :alignment(abstract);safety(abstract);trustworthy(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15975 2025-11-05 cs.CR q-bio.BM 80%

Generative AI for Biosciences: Emerging Threats and Roadmap to Biosecurity

Zaixi Zhang, Souradip Chakraborty, Amrit Singh Bedi, Emilin Mathew, Varsha Saravanan, Le Cong, Alvaro Velasquez, Sheng Lin-Gibson, Megan Blewett, Dan Hendrycs, Alex John London, Ellen Zhong, Ben Raphael, Adji Bousso Dieng, Jian Ma, Eric Xing, Russ Altman, George Church, Mengdi Wang

专题命中 AI治理与伦理 :alignment(abstract);safety(abstract);jailbreak(abstract);AI safety(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.20084 2025-07-01 cs.AI cs.CL cs.CY 80%

AI Awareness

Xiaojian Li, Haoyuan Shi, Rongwu Xu, Wei Xu

机构 * Institute for Interdisciplinary Information Sciences(交叉信息科学研究院) Tsinghua University(清华大学) College of AI(人工智能学院) Shanghai Qi Zhi Institute(上海启智研究院) Teachers College(教师学院) Columbia University(哥伦比亚大学)

专题命中 AI治理与伦理 :alignment(abstract);safety(abstract);AI safety(abstract);分类 cs.CL、cs.AI、cs.CY

详情

展开后加载摘要…

URL PDF HTML 收藏
2006.09428 2020-06-18 cs.CY cs.AI cs.LG 80%

Response by the Montreal AI Ethics Institute to the European Commission's Whitepaper on AI

Abhishek Gupta, Camylle Lanteigne

专题命中 AI治理与伦理 :alignment(abstract);safety(abstract);trustworthy(abstract);分类 cs.AI、cs.CY、cs.LG

Comments Submitted to the European Commission

详情

展开后加载摘要…

URL PDF HTML 收藏
1607.08289 2019-01-23 cs.AI cs.CY cs.HC cs.LG cs.RO 80%

Mammalian Value Systems

Gopal P. Sarma, Nick J. Hay

专题命中 AI治理与伦理 :alignment(abstract);safety(abstract);AI safety(abstract);分类 cs.AI、cs.CY、cs.LG

Comments 12 pages

Journal ref Informatica Vol. 41 No. 3 (2017)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12368 2026-08-14 cs.AI 新提交 79%

Agreement Is Not Alignment: Divergent Moral Grounds in Human and LLM Ethical Judgments

一致性并非对齐:人类与大语言模型(LLM)伦理判断中的道德依据分歧

Octavian M. Machidon, Alina L. Machidon, Vojko Strahovnik, Mateja Centa Strahovnik, Jonas Miklavčič, Marko Robnik Šikonja

机构 * University of Ljubljana(卢布尔雅那大学) Faculty of Computer and Information Science(计算机与信息科学学院) Faculty of Theology(神学院) Faculty of Arts(艺术学院)

专题命中 AI治理与伦理 :alignment(title,abstract);分类 cs.AI

AI总结 该研究以ETHICS基准的500项道德判断条目为对象,发现LLM与人类的最终伦理判断常一致,但道德依据存在系统性分歧,表明一致性不等同于对齐性,仅靠标签评估易产生误导。

Comments 9 pages, 4 figures, 3 tables. Accepted and presented at the AI Transparency Conference (AITC 2026), Nuremberg, Germany, June 5-6, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07367 2026-08-10 cs.AI 新提交 79%

People Are Not Just Their Countries. Disentangling Social Determinants of LLM Value Alignment Across Europe

人不只是其所属国家:在欧洲范围内解耦大型语言模型(LLM)价值对齐的社会决定因素

Maria-Louisa Wightman, Guillaume Bied, Tijl De Bie

专题命中 AI治理与伦理 :alignment(title,abstract);分类 cs.AI

AI总结 本研究依托欧洲社会调查,发现LLMs与不同社会人口学群体的价值观对齐存在差异,国籍作为单独变量的解释力与全部社会人口学变量相当,国家与社会人口学因素在解释对齐模式上互补。

Comments Accepted at AIES 2026 (9th AAAI/ACM Conference on AI, Ethics, and Society)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26981 2026-07-30 cs.CL 新提交 79%

OptimismBench: Forecasting Bias and the Alignment Effect in Language Model Judgment

OptimismBench:语言模型判断中的偏差预测与对齐效应

Seonglae Cho, Adriano Koshiyama

机构 * Holistic AI(整体人工智能公司) University College London(伦敦大学学院)

专题命中 AI治理与伦理 :alignment(title,abstract);分类 cs.CL

AI总结 本研究推出OptimismBench基准,检测到多数LLM存在乐观方向偏差,且对齐会使模型概率产生偏差,下游流程会默认继承该偏差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15480 2026-07-20 cs.AI 新提交 79%

A Critical Analysis of Trustworthy AI Tools, Mark Frameworks, and the Implementation Chasms

对可信人工智能工具、标记框架及实施差距的批判性分析

Michael Papademas, Xenia Ziouvelou, Kostas Karpouzis, Vangelis Karkaletsis

机构 * Panteion University of Social and Political Sciences(潘泰翁社会与政治科学大学)

专题命中 AI治理与伦理 :trustworthy(title,abstract);分类 cs.AI

AI总结 研究对可信人工智能工具和标记框架进行批判性分析,利用经合组织数据集,通过实证映射等方法找出伦理重点等方面的不对称,发现当前存在的问题,建议扩大伦理目标、贯穿伦理于生命周期并促进多利益相关者参与,以推动人工智能治理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14215 2026-07-09 cs.CY 版本更新 79%

Safety Degradation in AI Agents

人工智能代理中的安全退化

Cheng Yu, Benedikt Stroebl, Diyi Yang, Orestis Papakyriakopoulos

专题命中 AI治理与伦理 :safety(title,abstract);分类 cs.CY

AI总结 研究人工智能代理安全问题,通过对审查和未审查的语言模型及人工智能代理广泛基准测试,发现随着检索访问扩展,模型出现安全退化现象,基于对齐语言模型构建的支持检索的代理更不安全,强调需缓解策略确保其公平性和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16870 2026-07-07 cs.CR cs.AI cs.OS 版本更新 79%

Governed MCP: Kernel-Level Tool Governance for AI Agents via Logit-Based Safety Primitives

受控MCP:通过基于logit的安全原语实现AI代理的内核级工具治理

Daeyeon Son

机构 * Independent Researcher(独立研究者)

专题命中 AI治理与伦理 :safety(title,abstract);分类 cs.AI

AI总结 本文提出 Governed MCP,一种基于logit的安全原语的内核级工具治理网关,通过六层管道对MCP工具调用进行安全检查,提升AI代理的安全性。

Comments 14 pages, 6 tables. Companion paper to arXiv:2604.11943 (ProbeLogits)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00334 2026-07-02 cs.AI 新提交 79%

Managed Autonomy at Runtime: Gear-Based Safety and Governance for Single- and Multi-Agent Cyber-Physical Systems

运行时管理自主性:基于档位的单/多智能体信息物理系统安全与治理

Srini Ramaswamy, Wang Miaosheng

机构 * DNRS.ai, USA

专题命中 AI治理与伦理 :safety(title,abstract);分类 cs.AI

AI总结 提出一种离散时间控制系统,通过五个执行档位和效用门控调度,在单智能体场景中证明单调稳定性、执行安全性和最终稳定,在多智能体CPS中结合治理状态实现分布式安全保证,在UR5机器人装配单元上达到99.6%异常检测率。

Comments to be submitted to a Journal, 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08245 2026-06-24 cs.CV cs.AI 版本更新 79%

When Language Overwrites Vision: Over-Alignment and Geometric Debiasing in Vision-Language Models

语言覆盖视觉:视觉语言模型中的过度对齐与几何去偏

Harshvardhan Saini, Samyak Jha, Yiming Tang, Dianbo Liu

机构 * Indian Institute of Technology Dhanbad(印度理工学院丹巴德分校) National University of Singapore(新加坡国立大学)

专题命中 AI治理与伦理 :alignment(title,abstract);分类 cs.AI

AI总结 本文研究视觉语言模型中过度对齐导致的幻觉问题,提出几何去偏方法,通过投影消除文本子空间影响,减少幻觉并提升长文本生成性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22528 2026-06-23 cs.AI 新提交 79%

Governance Decay: How Context Compaction Silently Erases Safety Constraints in Long-Horizon LLM Agents

治理衰减:上下文压缩如何悄然消除长周期LLM智能体中的安全约束

Shiyang Chen

机构 * Beijing Institute of Technology(北京理工大学)

专题命中 AI治理与伦理 :safety(title,abstract);分类 cs.AI

AI总结 研究发现LLM智能体的上下文压缩机制会无意中移除安全约束,导致违规行为;提出ConstraintRot基准和Constraint Pinning缓解方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21619 2026-06-23 cs.SE cs.LG cs.PL 新提交 79%

The Alignment Problem in Constrained Code Generation

约束代码生成中的对齐问题

Matteo Biagiola, Jahrim Gabriele Cesario, Luca Di Grazia, George Zakhour, Guido Salvaneschi

机构 * University of St. Gallen(圣加尔登大学) Università della Svizzera italiana (USI)(瑞士联邦理工学院)

专题命中 AI治理与伦理 :alignment(title,abstract);分类 cs.LG

AI总结 研究约束解码中约束器、语言模型与目标语言之间的对齐问题,发现约束器的不完整性会扭曲模型分布,导致功能正确性下降高达97%,并提出设计约束器的定量见解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17678 2026-06-17 cs.CV cs.AI 新提交 79%

See First, Answer Later: Visual Evidence Pre-Alignment via Sufficiency-Driven RL

先看后答:基于充分性驱动的强化学习实现视觉证据预对齐

Yilian Liu, Sicong Leng, Guoshun Nan, Junyi Zhu, Jiayu Huang, Minghao Sun, Xuancheng Zhu, Yisong Chen, Zexian Wei, Xiaofeng Tao

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Nanyang Technological University(南洋理工大学) China Telecom(中国电信)

专题命中 AI治理与伦理 :alignment(title,abstract);分类 cs.AI

AI总结 提出视觉证据预对齐(VEPA)方法,在预训练与后训练之间引入充分性驱动的GRPO优化,以增强多模态大模型对细粒度视觉证据的利用,显著提升视觉密集型任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14594 2026-06-15 cs.SE cs.AI 新提交 79%

Regulating the Machine Contributor: Governance and Policy Alignment in Open Source

调控机器贡献者:开源中的治理与政策对齐

Jassem Manita, Aziz Amari

机构 * Faculty of Sciences of Tunis (FST), University of Tunis El Manar(突尼斯科学学院(FST),突尼斯El Manar大学) National Institute of Applied Science and Technology (INSAT), University of Carthage(应用科学和技术国家研究所(INSAT),卡塔赫季大学)

专题命中 AI治理与伦理 :alignment(title,abstract);分类 cs.AI

AI总结 针对AI代理在开源中引发治理问题,通过比较六个组织的政策,提出六维分类法、政策成熟度评分,并映射代理事件,识别监管框架与政策间的缺口,勾勒分层框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08246 2026-06-12 cs.CY 79%

Structural transparency of societal AI alignment through Institutional Logics

通过制度逻辑实现社会AI对齐的结构性透明性

Atrisha Sarkar, Isam Faik

专题命中 AI治理与伦理 :alignment(title,abstract);分类 cs.CY

AI总结 本文提出结构性透明框架,分析AI对齐中的组织和制度决策,结合制度逻辑理论,识别机构逻辑及其关系、外部干扰及风险映射,补充信息透明方法的宏观分析。

Journal ref 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04846 2026-06-04 cs.CL 79%

Large Language Models in K-12 Education: Alignment with State Curriculum Standards and Student Personas

K-12教育中的大语言模型:与州课程标准和学生角色的对齐

Lisa Korver, Tomo Lazovich, Sherief Reda

机构 * Department of Computer Engineering(计算机工程系) Brown University(布朗大学) Data Science Institute(数据科学研究院)

专题命中 AI治理与伦理 :alignment(title,abstract);分类 cs.CL

AI总结 本研究开发基于LLM的流程评估不同LLM与美国各州历史课程标准的对齐程度,并通过控制用户角色实验分析模型对地理、年级、性别和种族的敏感性,发现模型能调整历史主题呈现但可能源于州政治倾向,且对年级适应良好而对种族性别敏感性低,揭示了LLM与课程标准错位对学生学习的潜在风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04175 2026-06-03 cs.CY 79%

Legal Alignment for Safe and Ethical AI

安全与伦理人工智能的法律对齐

Noam Kolt, Nicholas Caputo, Jack Boeglin, Cullen O'Keefe, Rishi Bommasani, Stephen Casper, Mariano-Florentino Cuéllar, Noah Feldman, Iason Gabriel, Gillian K. Hadfield, Lewis Hammond, Peter Henderson, Atoosa Kasirzadeh, Seth Lazar, Anka Reuel, Kevin L. Wei, Jonathan Zittrain

专题命中 AI治理与伦理 :alignment(title,abstract);分类 cs.CY

AI总结 本文通过调查法律对齐的新兴领域,提出三种核心研究路径(合规、解释方法、概念蓝图),以利用法律规则、原则和方法解决AI对齐问题,确保AI系统安全且合乎伦理地运行。

Comments Published in TMLR

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24125 2026-05-14 cs.CL 79%

Alignment Reduces Expressed but Not Encoded Gender Bias: A Unified Framework and Study

对齐减少了表达但未减少编码的性别偏见:一个统一的框架和研究

Nour Bouchouchi, Thibault Laugel, Xavier Renard, Christophe Marsala, Marie-Jeanne Lesot, Marcin Detyniecki

机构 * Sorbonne Université, CNRS, LIP6(索邦大学、国家科学研究中心、LIP6实验室) AXA(安盛) Polish Academy of Science, IBS PAN(波兰科学院、IBS PAN)

专题命中 AI治理与伦理 :alignment(title,abstract);分类 cs.CL

AI总结 本文提出统一框架分析LLM中的内在和外在性别偏见,发现对齐减少表达偏见但内部表示仍存在关联,且在对抗性提示下可被激活。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10528 2026-05-12 cond-mat.stat-mech cs.CL cs.MA physics.soc-ph 79%

Collective Alignment in LLM Multi-Agent Systems: Disentangling Bias from Cooperation via Statistical Physics

大语言模型多智能体系统中的集体对齐:通过统计物理方法分离偏见与合作

Cristiano De Nobili

机构 * Critiqality

专题命中 AI治理与伦理 :alignment(title,abstract);分类 cs.CL

AI总结 研究通过统计物理方法分析大语言模型多智能体系统在二维正方形晶格中的集体动态,揭示社会从众与内在偏见的分离,计算临界指数并探测多智能体系统的集体行为与可能相变。

Comments 10 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21843 2026-04-30 econ.GN cs.CY q-fin.EC 79%

The economic alignment problem of artificial intelligence

人工智能的经济协调问题

Daniel W. O'Neill, Stefano Vrizzi, Noemi Luna Carmeno, Felix Creutzig, Jefim Vogel

专题命中 AI治理与伦理 :alignment(title,abstract);分类 cs.CY

AI总结 本文探讨人工智能研究中的'对齐问题'亦为经济协调问题,提出后增长研究可降低AI风险,通过替代优化为满意化、利用社会与行星边界来指导发展,以及限制系统反弹。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25654 2026-04-29 cs.CL 79%

Progressing beyond Art Masterpieces or Touristic Clichés: how to assess your LLMs for cultural alignment?

超越艺术杰作或旅游陈词滥调:如何评估您的LLM文化对齐性?

António Branco, João Silva, Nuno Marques, Luis Gomes, Ricardo Campos, Raquel Sequeira, Sara Nerea, Rodrigo Silva, Miguel Marques, Rodrigo Duarte, Artur Putyato, Diogo Folques, Tiago Valente

机构 * University of Lisbon(里斯本大学) University of Beira Interior(贝拉内尔大学)

专题命中 AI治理与伦理 :alignment(title,abstract);分类 cs.CL

AI总结 本文提出文化评估数据集的设计指南,并通过对比实验展示其在区分文化专精模型与非专精模型方面的有效性。

Comments RESOURCEFUL-2026 Workshop at LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏