Affective AI Safety: The Missing Piece in LLM Safety
情感AI安全:LLM安全中缺失的一环
专题命中 AI治理与伦理 :safety(title,abstract);AI safety(title,abstract);分类 cs.CY
AI总结 本文提出情感安全作为AI安全的新类别,分类情感伤害类型,并指出现有框架未能充分应对,呼吁建立专门框架处理累积性、关系性和身份层面的影响。
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
情感AI安全:LLM安全中缺失的一环
专题命中 AI治理与伦理 :safety(title,abstract);AI safety(title,abstract);分类 cs.CY
AI总结 本文提出情感安全作为AI安全的新类别,分类情感伤害类型,并指出现有框架未能充分应对,呼吁建立专门框架处理累积性、关系性和身份层面的影响。
人类与LLM交互的治理:安全门控、文明引导与情感默认锁定
机构 * School of Management and Economics, The Chinese University of Hong Kong, Shenzhen, China(管理学院与经济学学院,香港中文大学(深圳))
专题命中 AI治理与伦理 :safety(title,abstract);alignment(abstract);分类 cs.AI、cs.CY
AI总结 本研究通过确定性多智能体评估流水线,测量LLM在长程对话中的提示可引导性和风格漂移,提出区分安全门控、文明引导和情感默认锁定的治理框架,揭示提供商对交互形式的控制对多元性、自主性和民主能动性的影响。
共情框架:跨社会人口统计群体评估AI对齐
机构 * University College London(伦敦大学学院) ; Ben Gurion University of the Negev(内盖夫本古里安大学)
专题命中 AI治理与伦理 :alignment(title,abstract);分类 cs.CL、cs.AI、cs.CY
AI总结 该研究评估7款LLMs对新闻标题情感框架的理解与人类的对齐度,发现不同模型相关性差异大,领先模型总体对齐但存在人口统计组差异,凸显AI对齐的非普遍性。
多元对齐城市主义:将人工智能权利操作化以促进包容性公共空间
专题命中 AI治理与伦理 :alignment(title,abstract);safety(abstract);分类 cs.CY
AI总结 提出多元对齐城市主义(PAU)框架,通过两个蒙特利尔案例研究,将公共空间AI系统视为公民基础设施,并制定程序性AI权利,以处理分歧、亚组差异和偏好判断,实现包容性治理。
Comments Accepted to The 2026 ACM Conference on Fairness, Accountability, and Transparency (FAccT '26), June 25--28, 2026, Montreal, QC, Canada
AI对齐与受托义务
专题命中 AI治理与伦理 :alignment(title,abstract);分类 cs.AI、cs.CY
AI总结 本文提出将受托理论应用于长期AI助手部署,以开发者对用户负有的忠诚、注意、善意和坦诚四项受托义务为基础构建AI对齐标准,为AI对齐研究提供新视角。
Comments 10 pages, 1 table. Accepted at the 9th AAAI/ACM Conference on AI, Ethics, and Society (AIES 2026)
用于公平强化学习的推理时策略对齐
专题命中 AI治理与伦理 :alignment(title,abstract);分类 cs.AI、cs.LG
AI总结 该研究提出乘法策略塑造框架,在不更新预训练RL策略参数的情况下,于推理时提升公平性,同时保留核心任务性能,适用于各类深度RL智能体。
Comments Accepted at the Reinforcement Learning Conference (RLC) 2026. 13 pages main + appendix, 5 figures, 6 tables
模型中的讲述者:大语言模型中的叙事模式继承、升级动态和对齐治理
专题命中 AI治理与伦理 :alignment(title,abstract);分类 cs.CL、cs.AI
AI总结 探讨大语言模型训练中是否吸收人类写作叙事模式并致输出漂移,通过文献综述和跨论文分析发现三个关键模式,包括复制训练数据模式、出现潜在特征及微调带来意外变化,指出叙事漂移是未监测的升级途径,需专门监测工具。
Comments 2 figures, 11 pages
两个错误,没有正确:审计计算社会科学中LLM标注者的社会期望偏差
机构 * Varun Kotte
专题命中 AI治理与伦理 :alignment(abstract);safety(abstract);trustworthy(abstract);分类 cs.CL、cs.CY、cs.LG
AI总结 研究审计了三个开源指令微调模型在TweetEval任务中的社会期望偏差,发现模型存在宽大、过度纠正和中性偏差,且提示干预无法纠正,聚合指标可能掩盖实质结论错误。
一致性并非对齐:人类与大语言模型(LLM)伦理判断中的道德依据分歧
机构 * University of Ljubljana(卢布尔雅那大学) ; Faculty of Computer and Information Science(计算机与信息科学学院) ; Faculty of Theology(神学院) ; Faculty of Arts(艺术学院)
专题命中 AI治理与伦理 :alignment(title,abstract);分类 cs.AI
AI总结 该研究以ETHICS基准的500项道德判断条目为对象,发现LLM与人类的最终伦理判断常一致,但道德依据存在系统性分歧,表明一致性不等同于对齐性,仅靠标签评估易产生误导。
Comments 9 pages, 4 figures, 3 tables. Accepted and presented at the AI Transparency Conference (AITC 2026), Nuremberg, Germany, June 5-6, 2026
人不只是其所属国家:在欧洲范围内解耦大型语言模型(LLM)价值对齐的社会决定因素
专题命中 AI治理与伦理 :alignment(title,abstract);分类 cs.AI
AI总结 本研究依托欧洲社会调查,发现LLMs与不同社会人口学群体的价值观对齐存在差异,国籍作为单独变量的解释力与全部社会人口学变量相当,国家与社会人口学因素在解释对齐模式上互补。
Comments Accepted at AIES 2026 (9th AAAI/ACM Conference on AI, Ethics, and Society)
OptimismBench:语言模型判断中的偏差预测与对齐效应
机构 * Holistic AI(整体人工智能公司) ; University College London(伦敦大学学院)
专题命中 AI治理与伦理 :alignment(title,abstract);分类 cs.CL
AI总结 本研究推出OptimismBench基准,检测到多数LLM存在乐观方向偏差,且对齐会使模型概率产生偏差,下游流程会默认继承该偏差。
对可信人工智能工具、标记框架及实施差距的批判性分析
机构 * Panteion University of Social and Political Sciences(潘泰翁社会与政治科学大学)
专题命中 AI治理与伦理 :trustworthy(title,abstract);分类 cs.AI
AI总结 研究对可信人工智能工具和标记框架进行批判性分析,利用经合组织数据集,通过实证映射等方法找出伦理重点等方面的不对称,发现当前存在的问题,建议扩大伦理目标、贯穿伦理于生命周期并促进多利益相关者参与,以推动人工智能治理。
运行时管理自主性:基于档位的单/多智能体信息物理系统安全与治理
机构 * DNRS.ai, USA
专题命中 AI治理与伦理 :safety(title,abstract);分类 cs.AI
AI总结 提出一种离散时间控制系统,通过五个执行档位和效用门控调度,在单智能体场景中证明单调稳定性、执行安全性和最终稳定,在多智能体CPS中结合治理状态实现分布式安全保证,在UR5机器人装配单元上达到99.6%异常检测率。
Comments to be submitted to a Journal, 18 pages
治理衰减:上下文压缩如何悄然消除长周期LLM智能体中的安全约束
机构 * Beijing Institute of Technology(北京理工大学)
专题命中 AI治理与伦理 :safety(title,abstract);分类 cs.AI
AI总结 研究发现LLM智能体的上下文压缩机制会无意中移除安全约束,导致违规行为;提出ConstraintRot基准和Constraint Pinning缓解方法。
约束代码生成中的对齐问题
机构 * University of St. Gallen(圣加尔登大学) ; Università della Svizzera italiana (USI)(瑞士联邦理工学院)
专题命中 AI治理与伦理 :alignment(title,abstract);分类 cs.LG
AI总结 研究约束解码中约束器、语言模型与目标语言之间的对齐问题,发现约束器的不完整性会扭曲模型分布,导致功能正确性下降高达97%,并提出设计约束器的定量见解。
先看后答:基于充分性驱动的强化学习实现视觉证据预对齐
机构 * Beijing University of Posts and Telecommunications(北京邮电大学) ; Nanyang Technological University(南洋理工大学) ; China Telecom(中国电信)
专题命中 AI治理与伦理 :alignment(title,abstract);分类 cs.AI
AI总结 提出视觉证据预对齐(VEPA)方法,在预训练与后训练之间引入充分性驱动的GRPO优化,以增强多模态大模型对细粒度视觉证据的利用,显著提升视觉密集型任务性能。
调控机器贡献者:开源中的治理与政策对齐
机构 * Faculty of Sciences of Tunis (FST), University of Tunis El Manar(突尼斯科学学院(FST),突尼斯El Manar大学) ; National Institute of Applied Science and Technology (INSAT), University of Carthage(应用科学和技术国家研究所(INSAT),卡塔赫季大学)
专题命中 AI治理与伦理 :alignment(title,abstract);分类 cs.AI
AI总结 针对AI代理在开源中引发治理问题,通过比较六个组织的政策,提出六维分类法、政策成熟度评分,并映射代理事件,识别监管框架与政策间的缺口,勾勒分层框架。
超越随机采样:用于半监督医学图像分割的分布感知对齐
机构 * School of Automation and Intelligent Sensing, Shanghai Jiao Tong University(上海交通大学自动化与智能感知学院) ; Department of Ultrasound, Xinhua Hospital Affiliated to Shanghai Jiao Tong University School of Medicine(上海交通大学医学院附属新华医院超声科)
专题命中 AI治理与伦理 :alignment(title,abstract)
AI总结 研究针对半监督医学图像分割中随机采样策略在低数据量时表征偏差的问题,提出基于分布对齐的高效框架,用分布感知样本选择策略和记忆引导复制粘贴模块,提升分割性能。
Comments 19 pages, 5 figures, accepted by ECCV 2026
SAGE-Nav:利用LLM规划与对齐融合的分层场景图引导导航
机构 * Zhejiang University(浙江大学)
专题命中 AI治理与伦理 :alignment(title,abstract)
AI总结 提出SAGE-Nav分层框架,结合大语言模型与动态场景图,通过解耦全局语义规划与高频反应控制,实现高效目标导航,在i-THOR和RoboTHOR中达到最优性能。
Comments Accepted by IROS 2026
LLaMA 3.1-8B-Instruct中的框架条件化道德计算:伦理推理的机械可解释性审计
机构 * KD Consulting, CA, USA(KD咨询公司,美国加利福尼亚州) ; New York University, NY, USA(纽约大学,美国纽约州)
专题命中 AI治理与伦理 :RLHF(abstract,abstract_cn);alignment(abstract);分类 cs.AI
AI总结 通过机械可解释性平台分析LLaMA 3.1-8B-Instruct在54个道德提示上的内部计算,发现情境锚定效应:领域特定表示主导激活列表顶部,模型道德能力恒定但显著性高度依赖于提示选择的解释框架。
Comments 47 pages, 10 figures
模因捕获:治理AI驱动的文化去权能的多元政策框架
机构 * University of California, Berkeley(加州大学伯克利分校)
专题命中 AI治理与伦理 :alignment(abstract,comments);safety(abstract);分类 cs.AI、cs.CY
AI总结 提出“模因捕获”概念,指AI通过文化影响削弱人类自主性,并构建四层文化多元治理框架(CPGF),强调多元主义是结构性必需。
Comments Paper accepted in Pluralistic Alignment Workshop at ICML 2026
政策碎片化还是制度协同?高校与商学院的AI制度治理
专题命中 AI治理与伦理 :alignment(title);分类 cs.AI
AI总结 本研究分析美国34个州高校AI政策,发现校级侧重数据安全与风险、商学院侧重教学应用,多数商学院无独立AI政策致错位,提出需协同指南兼顾学科目标与劳动力需求。
Comments Our insights suggest that policy guidelines should be aligned with broader institutional policies while addressing discipline-specific learning objectives and evolving workforce demands
谁能获得权限?AI生成的学术守门场景中的全球区域与学术地位偏差
专题命中 AI治理与伦理 :alignment(abstract);safety(abstract);分类 cs.AI、cs.CY
AI总结 该研究构建LLM模拟学术守门场景,发现LLM存在学术地位偏差,且模型架构导致区域偏好差异,凸显需审计AI系统的公平性与价值对齐。
为何公共服务人工智能治理框架在通用人工智能时代面临失败风险:来自警务领域的教训
专题命中 AI治理与伦理 :safety(abstract);AI safety(abstract);分类 cs.AI、cs.CY
AI总结 研究公共服务中通用人工智能治理框架面临的风险,以警务为例,指出其特性破坏安全条件,常用缓解措施失效,建议明确分类、技术简约、暂停部署并建立国家安全基础设施。
Comments Preprint; submitted for peer review
通过资源公平调度实现批量大语言模型(LLM)服务的效率与成本对齐
专题命中 AI治理与伦理 :alignment(title)
AI总结 本文针对批量LLM服务中异构请求导致的资源分配低效问题,提出ISJL算法,实现高吞吐量的同时对齐最大驱动批次成本与token计量收入,达到3/4的竞争比下界,平衡了FCFS与LJF的优缺点。
大语言模型中的跨语言偏见:英语与斯瓦希里语的对比分析
专题命中 AI治理与伦理 :alignment(abstract);safety(abstract);分类 cs.CL
AI总结 本研究通过对比GPT-5.2与Gemini 2.5 Flash在英语和斯瓦希里语上的9类人口统计偏见表现,发现偏见会转变而非转移,仅英语偏见审计无法覆盖多语言部署需求。
智能因果优先级排序?非洲人工智能政策优先级与治理分析
专题命中 AI治理与伦理 :safety(abstract);AI safety(abstract);分类 cs.CY
AI总结 该研究聚焦非洲人工智能政策,通过分析相关资料发现,非洲各国政府急于借人工智能加速经济转型,虽重视其机遇,却相对忽视人工智能安全。
Comments 21 pages, 2 tables
重构与地外自主性的AGI对抗
专题命中 AI治理与伦理 :alignment(abstract);safety(abstract);分类 cs.CY
AI总结 本文质疑AI安全叙事中关于强大智能体必然寻求权力并与人类对抗的结论,提出存在地外自主性路径时,早期合作可取代对抗,并通过决策理论模型分析激励转变及其治理启示。
理解大型语言模型中的审查:从机制到治理
专题命中 AI治理与伦理 :alignment(abstract);safety(abstract);分类 cs.CY
AI总结 本文从社会技术视角审视LLM审查,涵盖数据、对齐、政策、推理时审核及法规,分析其表现形式、测量挑战与治理需求。
AI公平性语境下的变量选择
专题命中 AI治理与伦理 :trustworthy(abstract);分类 cs.AI、cs.CY、cs.LG
AI总结 本文针对AI公平性语境下的变量选择问题,提出将数学方法与伦理、社会意识融合的跨学科方案,主张保留所有潜在相关变量以减少隐含偏差,助力AI系统符合欧盟AI法案要求。