Norms for Beneficial A.I.: A Computational Analysis of the Societal Value Alignment Problem
专题命中 AI治理与伦理 :alignment(title,abstract);分类 cs.AI、cs.CY
Journal ref AI Communications, vol. 33, no. 3-6, pp. 155-171, 2020
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
专题命中 AI治理与伦理 :alignment(title,abstract);分类 cs.AI、cs.CY
Journal ref AI Communications, vol. 33, no. 3-6, pp. 155-171, 2020
专题命中 AI治理与伦理 :alignment(title,abstract);分类 cs.AI、cs.CY
Comments arXiv admin note: substantial text overlap with arXiv:1907.05447
伦理规范理论与欧盟人工智能法案之间的语义对齐:基于Transformer的语义文本相似性分析
专题命中 AI治理与伦理 :alignment(title,abstract);分类 cs.CY
AI总结 本文通过Transformer模型分析伦理理论与欧盟AI法案的语义对齐,发现义务伦理学在法案两部分中具有最高相似性。
Comments 18 pages, 5 tables, 3 figures; the concept of alignment introduced as an indication of influence
机构 * Max Planck Institute for Intelligent Systems(马克斯·普朗克智能系统研究所) ; ETH Zürich(苏黎世联邦理工学院) ; University of Toronto(多伦多大学) ; University of Washington(华盛顿大学) ; Allen Institute for AI (AI2)(人工智能研究所) ; Carnegie Mellon University(卡内基梅隆大学) ; University of Trieste(特里斯坦大学) ; University of Michigan(密歇根大学)
专题命中 AI治理与伦理 :alignment(title,abstract);分类 cs.CL
Comments ICLR 2025 Spotlight, Best Paper @ NeurIPS 2024 Workshop on Pluralistic Alignment
两个错误,没有正确:审计计算社会科学中LLM标注者的社会期望偏差
机构 * Varun Kotte
专题命中 AI治理与伦理 :alignment(abstract);safety(abstract);trustworthy(abstract);分类 cs.CL、cs.CY、cs.LG
AI总结 研究审计了三个开源指令微调模型在TweetEval任务中的社会期望偏差,发现模型存在宽大、过度纠正和中性偏差,且提示干预无法纠正,聚合指标可能掩盖实质结论错误。
单调性作为提升语言模型鲁棒性的架构偏倚
机构 * Department of Computer Science, University of Colorado Boulder, Boulder, CO, USA(计算机科学系,科罗拉多大学波尔德分校,波尔德,科罗拉多州,美国)
专题命中 AI治理与伦理 :alignment(abstract);safety(abstract);jailbreak(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本研究通过在Transformer模型中引入单调性约束,提升语言模型对对抗攻击的鲁棒性,同时保持预训练性能。
Comments 12 pages, 1 figure
专题命中 AI治理与伦理 :alignment(abstract);safety(abstract);trustworthy(abstract);分类 cs.CL、cs.AI、cs.LG
专题命中 AI治理与伦理 :alignment(abstract);safety(abstract);jailbreak(abstract);AI safety(abstract)
机构 * Institute for Interdisciplinary Information Sciences(交叉信息科学研究院) ; Tsinghua University(清华大学) ; College of AI(人工智能学院) ; Shanghai Qi Zhi Institute(上海启智研究院) ; Teachers College(教师学院) ; Columbia University(哥伦比亚大学)
专题命中 AI治理与伦理 :alignment(abstract);safety(abstract);AI safety(abstract);分类 cs.CL、cs.AI、cs.CY
专题命中 AI治理与伦理 :alignment(abstract);safety(abstract);trustworthy(abstract);分类 cs.AI、cs.CY、cs.LG
Comments Submitted to the European Commission
专题命中 AI治理与伦理 :alignment(abstract);safety(abstract);AI safety(abstract);分类 cs.AI、cs.CY、cs.LG
Comments 12 pages
Journal ref Informatica Vol. 41 No. 3 (2017)
一致性并非对齐:人类与大语言模型(LLM)伦理判断中的道德依据分歧
机构 * University of Ljubljana(卢布尔雅那大学) ; Faculty of Computer and Information Science(计算机与信息科学学院) ; Faculty of Theology(神学院) ; Faculty of Arts(艺术学院)
专题命中 AI治理与伦理 :alignment(title,abstract);分类 cs.AI
AI总结 该研究以ETHICS基准的500项道德判断条目为对象,发现LLM与人类的最终伦理判断常一致,但道德依据存在系统性分歧,表明一致性不等同于对齐性,仅靠标签评估易产生误导。
Comments 9 pages, 4 figures, 3 tables. Accepted and presented at the AI Transparency Conference (AITC 2026), Nuremberg, Germany, June 5-6, 2026
人不只是其所属国家:在欧洲范围内解耦大型语言模型(LLM)价值对齐的社会决定因素
专题命中 AI治理与伦理 :alignment(title,abstract);分类 cs.AI
AI总结 本研究依托欧洲社会调查,发现LLMs与不同社会人口学群体的价值观对齐存在差异,国籍作为单独变量的解释力与全部社会人口学变量相当,国家与社会人口学因素在解释对齐模式上互补。
Comments Accepted at AIES 2026 (9th AAAI/ACM Conference on AI, Ethics, and Society)
OptimismBench:语言模型判断中的偏差预测与对齐效应
机构 * Holistic AI(整体人工智能公司) ; University College London(伦敦大学学院)
专题命中 AI治理与伦理 :alignment(title,abstract);分类 cs.CL
AI总结 本研究推出OptimismBench基准,检测到多数LLM存在乐观方向偏差,且对齐会使模型概率产生偏差,下游流程会默认继承该偏差。
对可信人工智能工具、标记框架及实施差距的批判性分析
机构 * Panteion University of Social and Political Sciences(潘泰翁社会与政治科学大学)
专题命中 AI治理与伦理 :trustworthy(title,abstract);分类 cs.AI
AI总结 研究对可信人工智能工具和标记框架进行批判性分析,利用经合组织数据集,通过实证映射等方法找出伦理重点等方面的不对称,发现当前存在的问题,建议扩大伦理目标、贯穿伦理于生命周期并促进多利益相关者参与,以推动人工智能治理。
人工智能代理中的安全退化
专题命中 AI治理与伦理 :safety(title,abstract);分类 cs.CY
AI总结 研究人工智能代理安全问题,通过对审查和未审查的语言模型及人工智能代理广泛基准测试,发现随着检索访问扩展,模型出现安全退化现象,基于对齐语言模型构建的支持检索的代理更不安全,强调需缓解策略确保其公平性和可靠性。
受控MCP:通过基于logit的安全原语实现AI代理的内核级工具治理
机构 * Independent Researcher(独立研究者)
专题命中 AI治理与伦理 :safety(title,abstract);分类 cs.AI
AI总结 本文提出 Governed MCP,一种基于logit的安全原语的内核级工具治理网关,通过六层管道对MCP工具调用进行安全检查,提升AI代理的安全性。
Comments 14 pages, 6 tables. Companion paper to arXiv:2604.11943 (ProbeLogits)
运行时管理自主性:基于档位的单/多智能体信息物理系统安全与治理
机构 * DNRS.ai, USA
专题命中 AI治理与伦理 :safety(title,abstract);分类 cs.AI
AI总结 提出一种离散时间控制系统,通过五个执行档位和效用门控调度,在单智能体场景中证明单调稳定性、执行安全性和最终稳定,在多智能体CPS中结合治理状态实现分布式安全保证,在UR5机器人装配单元上达到99.6%异常检测率。
Comments to be submitted to a Journal, 18 pages
语言覆盖视觉:视觉语言模型中的过度对齐与几何去偏
机构 * Indian Institute of Technology Dhanbad(印度理工学院丹巴德分校) ; National University of Singapore(新加坡国立大学)
专题命中 AI治理与伦理 :alignment(title,abstract);分类 cs.AI
AI总结 本文研究视觉语言模型中过度对齐导致的幻觉问题,提出几何去偏方法,通过投影消除文本子空间影响,减少幻觉并提升长文本生成性能。
治理衰减:上下文压缩如何悄然消除长周期LLM智能体中的安全约束
机构 * Beijing Institute of Technology(北京理工大学)
专题命中 AI治理与伦理 :safety(title,abstract);分类 cs.AI
AI总结 研究发现LLM智能体的上下文压缩机制会无意中移除安全约束,导致违规行为;提出ConstraintRot基准和Constraint Pinning缓解方法。
约束代码生成中的对齐问题
机构 * University of St. Gallen(圣加尔登大学) ; Università della Svizzera italiana (USI)(瑞士联邦理工学院)
专题命中 AI治理与伦理 :alignment(title,abstract);分类 cs.LG
AI总结 研究约束解码中约束器、语言模型与目标语言之间的对齐问题,发现约束器的不完整性会扭曲模型分布,导致功能正确性下降高达97%,并提出设计约束器的定量见解。
先看后答:基于充分性驱动的强化学习实现视觉证据预对齐
机构 * Beijing University of Posts and Telecommunications(北京邮电大学) ; Nanyang Technological University(南洋理工大学) ; China Telecom(中国电信)
专题命中 AI治理与伦理 :alignment(title,abstract);分类 cs.AI
AI总结 提出视觉证据预对齐(VEPA)方法,在预训练与后训练之间引入充分性驱动的GRPO优化,以增强多模态大模型对细粒度视觉证据的利用,显著提升视觉密集型任务性能。
调控机器贡献者:开源中的治理与政策对齐
机构 * Faculty of Sciences of Tunis (FST), University of Tunis El Manar(突尼斯科学学院(FST),突尼斯El Manar大学) ; National Institute of Applied Science and Technology (INSAT), University of Carthage(应用科学和技术国家研究所(INSAT),卡塔赫季大学)
专题命中 AI治理与伦理 :alignment(title,abstract);分类 cs.AI
AI总结 针对AI代理在开源中引发治理问题,通过比较六个组织的政策,提出六维分类法、政策成熟度评分,并映射代理事件,识别监管框架与政策间的缺口,勾勒分层框架。
通过制度逻辑实现社会AI对齐的结构性透明性
专题命中 AI治理与伦理 :alignment(title,abstract);分类 cs.CY
AI总结 本文提出结构性透明框架,分析AI对齐中的组织和制度决策,结合制度逻辑理论,识别机构逻辑及其关系、外部干扰及风险映射,补充信息透明方法的宏观分析。
Journal ref 2026
K-12教育中的大语言模型:与州课程标准和学生角色的对齐
机构 * Department of Computer Engineering(计算机工程系) ; Brown University(布朗大学) ; Data Science Institute(数据科学研究院)
专题命中 AI治理与伦理 :alignment(title,abstract);分类 cs.CL
AI总结 本研究开发基于LLM的流程评估不同LLM与美国各州历史课程标准的对齐程度,并通过控制用户角色实验分析模型对地理、年级、性别和种族的敏感性,发现模型能调整历史主题呈现但可能源于州政治倾向,且对年级适应良好而对种族性别敏感性低,揭示了LLM与课程标准错位对学生学习的潜在风险。
安全与伦理人工智能的法律对齐
专题命中 AI治理与伦理 :alignment(title,abstract);分类 cs.CY
AI总结 本文通过调查法律对齐的新兴领域,提出三种核心研究路径(合规、解释方法、概念蓝图),以利用法律规则、原则和方法解决AI对齐问题,确保AI系统安全且合乎伦理地运行。
Comments Published in TMLR
对齐减少了表达但未减少编码的性别偏见:一个统一的框架和研究
机构 * Sorbonne Université, CNRS, LIP6(索邦大学、国家科学研究中心、LIP6实验室) ; AXA(安盛) ; Polish Academy of Science, IBS PAN(波兰科学院、IBS PAN)
专题命中 AI治理与伦理 :alignment(title,abstract);分类 cs.CL
AI总结 本文提出统一框架分析LLM中的内在和外在性别偏见,发现对齐减少表达偏见但内部表示仍存在关联,且在对抗性提示下可被激活。
大语言模型多智能体系统中的集体对齐:通过统计物理方法分离偏见与合作
机构 * Critiqality
专题命中 AI治理与伦理 :alignment(title,abstract);分类 cs.CL
AI总结 研究通过统计物理方法分析大语言模型多智能体系统在二维正方形晶格中的集体动态,揭示社会从众与内在偏见的分离,计算临界指数并探测多智能体系统的集体行为与可能相变。
Comments 10 pages, 7 figures
人工智能的经济协调问题
专题命中 AI治理与伦理 :alignment(title,abstract);分类 cs.CY
AI总结 本文探讨人工智能研究中的'对齐问题'亦为经济协调问题,提出后增长研究可降低AI风险,通过替代优化为满意化、利用社会与行星边界来指导发展,以及限制系统反弹。
超越艺术杰作或旅游陈词滥调:如何评估您的LLM文化对齐性?
机构 * University of Lisbon(里斯本大学) ; University of Beira Interior(贝拉内尔大学)
专题命中 AI治理与伦理 :alignment(title,abstract);分类 cs.CL
AI总结 本文提出文化评估数据集的设计指南,并通过对比实验展示其在区分文化专精模型与非专精模型方面的有效性。
Comments RESOURCEFUL-2026 Workshop at LREC 2026