Fairness for Unobserved Characteristics: Insights from Technological Impacts on Queer Communities
专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI、cs.CY、cs.LG
Comments Proceedings of the 2021 AAAI/ACM Conference on AI, Ethics, and Society (AIES 2021)
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI、cs.CY、cs.LG
Comments Proceedings of the 2021 AAAI/ACM Conference on AI, Ethics, and Society (AIES 2021)
专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI、cs.CY、cs.LG
对 Machiavellian 代理进行对齐:通过测试时策略塑造实现行为引导
专题命中 AI治理与伦理 :alignment(abstract,comments);分类 cs.CL、cs.AI
AI总结 本文提出了一种测试时策略塑造方法,通过模型引导的策略调整,解决预训练代理在复杂环境中的伦理对齐问题,实现奖励最大化与伦理约束的平衡。
Comments Accepted to AAAI 2026 AI Alignment Track
机构 * Leipzig University(莱比锡大学) ; Technical University Dresden(德累斯顿技术大学) ; University of Göttingen(哥廷根大学)
专题命中 AI治理与伦理 :trustworthy(abstract,comments);分类 cs.AI、cs.CY
Comments Accepted paper - ESORICS 2025 - International Workshop on Secure and Trustworthy Machine Unlearning Systems (STMUS)
机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) ; Shenzhen Research Institute of Big Data(深圳大数据研究院)
专题命中 AI治理与伦理 :alignment(abstract,comments);分类 cs.CL、cs.AI
Comments Cultural Analysis, Cultural Alignment, Word Association Test, Large Language Models. Accepted by EMNLP 2025 (Oral)
机构 * Tier University(Tier大学)
专题命中 AI治理与伦理 :alignment(abstract,journal_ref);分类 cs.CL、cs.AI
Comments 15pages, 1 figure, 2 tables
Journal ref Proceedings of 0th Symposium on Moral and Legal AI Alignment of the IACAP/AISB Conference, 2025
专题命中 AI治理与伦理 :alignment(abstract,comments);分类 cs.AI、cs.LG
Comments AAAI-25 AI Alignment Track
专题命中 AI治理与伦理 :alignment(abstract,comments);分类 cs.AI、cs.LG
Comments The current version improves significantly by integrating ethical frameworks, expanding methodology and case studies, enhancing scalability and ethical-legal alignment, acknowledging prior work, and offering clearer structure and practical relevance
专题命中 AI治理与伦理 :trustworthy(abstract,comments);分类 cs.AI、cs.CY
Comments Accepted at 'Neural Conversational AI Workshop - What's left to TEACH (Trustworthy, Enhanced, Adaptable, Capable, and Human-centric) chatbots?' at ICML 2023
时间任务多样性:非平稳性下的归纳偏置
机构 * University of Oxford(牛津大学)
专题命中 AI治理与伦理 :safety(abstract,comments);分类 cs.LG;AI safety(comments)
AI总结 研究探讨了在合成序列建模中,任务分布随时间变化对深度学习模型归纳偏置的影响,发现任务分布的多样性增强了模型对泛化而非记忆的偏好。
Comments Presented at Technical AI Safety Conference (TAIS), Oxford, May 2026. Code available at https://github.com/matomatical/temporal-task-diversity
协同构建社会技术型AI治理:利用算法登记册的参与式系统映射
专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI、cs.CY
AI总结 本文以荷兰某城市算法登记册为案例,通过多利益相关者参与式映射结合STPA分析,揭示登记册的遮蔽性,为多元社会技术型AI治理提供新视角。
国家与区域内部AI战略间的政策趋同与分化:政策设计要素分析
专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI、cs.CY
AI总结 本文分析74项国家及3项区域AI战略,发现国家AI战略在经济竞争力等方面横向趋同,在人权目标等方面分化,不同区域纵向趋同情况各异,为AI政策设计提供依据。
谁构建了这个模型?通过权重空间中的光谱指纹追踪大语言模型(LLM)谱系
机构 * Michigan State University(密歇根州立大学)
专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI、cs.LG
AI总结 本研究提出几何指纹框架,通过权重空间的光谱能量和子空间对齐分析,实现对110余个开源权重LLM对的谱系区分,为模型溯源提供稳健可解释的信号。
Comments Accepted to COLM 2026
从被动到主动:对480起AI事件的多监管实证分析及数据驱动的治理合规框架
机构 * University of the Cumberlands, USA(卡姆伯兰大学)
专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI、cs.CY
AI总结 本文通过分析480起AI事件,揭示现有治理框架在部署后问责中的不足,并提出主动治理框架,旨在从被动响应转向部署前的合规保障。
大型语言模型有多独立?一种用于审计行为纠缠和重加权验证者集合的统计框架
机构 * Texas A&M University(德克萨斯农工大学)
专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL、cs.AI
AI总结 本文提出一种统计框架,用于审计大型语言模型之间的行为纠缠,通过多分辨率层次结构和信息理论度量,分析行为纠缠对验证性能的影响,并通过重加权验证者集合减少相关偏差。
通过随机数生成缓解作为评判者的大语言模型(LLM-as-a-Judge)中的评分偏差
机构 * Japan Advanced Institute of Science and Technology(日本先进科学技术学院)
专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL、cs.AI
AI总结 本研究针对LLM-as-a-Judge的评分偏差问题,提出通过随机数生成识别并校正LLM潜在数字偏差的方法,在四项任务上的表现优于基线。
信任作为监控:用户信任与AI开发者行为的进化动态
机构 * School Computing, Engineering and Digital Technologies, Teesside University(特塞斯大学计算、工程和数字技术学院) ; School of Mathematics, University of Birmingham(伯明翰大学数学学院) ; Informatics Institute, University of Amsterdam(阿姆斯特丹大学信息学院) ; Department of Computer Science, University of Warwick(沃里克大学计算机科学系) ; Department of Computer Science and Artificial Intelligence (DECSAI) and Andalusian Research Institute DaSCI “Data Science and Computational Intelligence”, University of Granada, Spain(格拉纳达大学计算机科学与人工智能系(DECSAI)和安达卢西亚数据科学与计算智能研究所) ; Machine Learning Group, Université libre de Bruxelles(布鲁塞尔自由大学机器学习组) ; AI Lab, Vrije Universiteit Brussel(布鲁塞尔自由大学人工智能实验室) ; University of Technology Dresden(德累斯顿技术大学) ; School of Engineering and Physical Sciences, University of Lincoln(林肯大学工程与物理科学学院) ; Division of Computing Science and Mathematics, University of Stirling(斯特灵大学计算科学与数学系)
专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI、cs.LG
AI总结 本文研究用户信任与AI开发者行为的进化动态,通过进化博弈论分析不同监控成本和制度下信任策略的演变,发现只有安全且广泛采纳的系统是理想结果。
采用异构压缩客户端的联邦基础模型微调
机构 * The Hong Kong Polytechnic University(香港理工大学) ; OceanBase, Ant Group(蚂蚁集团OceanBase) ; School of Management, Xi’an Jiaotong University(西安交通大学管理学院) ; School of Mathematics and Statistics, Xidian University(西安电子科技大学数学与统计学院) ; School of Computer Science, Wuhan University(武汉大学计算机学院) ; School of Computer Science, China University of Geosciences(中国地质大学计算机学院)
专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI、cs.LG
AI总结 针对基础模型联邦学习的资源不对称问题,提出FedSLM框架,通过SVD分解等技术实现异构压缩客户端的联邦微调,实验显示其在多基准上优于现有基线且客户端内存需求更低。
人类效用因子:一种可计算的福利度量,将AI治理重新构建为约束优化问题
专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI、cs.CY
AI总结 研究提出人类效用因子(HUF)这一可计算福利度量,将AI治理转化为约束优化问题,经多智能体强化学习评估,发现需明确约束再分配以避免高自动化均衡损害社会目标。
易陷阱:为何大语言模型低估由误解驱动的难度
专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI、cs.CY
AI总结 该研究发现,用于教育评估难度估计的LLM会系统性低估由学习者误解驱动的数学题难度,提出“易陷阱”现象,其仅能捕捉难度大致排序,无法反映学生实际认知难度。
Comments This paper poster presented on 19th Educational Data Mining Conference 2026
规范人工智能的合法性
专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI、cs.CY
AI总结 研究人工智能治理中合法性这一自主监管目标,指出其与对齐不同。分析人工智能合法性在透明度、私人权力和行政自动化方面的问题,探讨法律作用并提出整合、熟悉度、争议三个原则以解决相关问题。
分析八个大语言模型的伦理逻辑
专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI、cs.CY
AI总结 研究分析OpenAI等八个大语言模型的伦理逻辑,通过让模型回答伦理原则问题和道德困境,用多种理论分析其回答,发现模型伦理判断趋同但在做决定意愿等方面有差异,还能增进对人工智能工作及增强人类伦理行为的理解。
QuantiBias:量化大语言模型中量化诱导偏差的基准测试
机构 * University of Southern California(南加州大学)
专题命中 AI治理与伦理 :safety(abstract);分类 cs.CL、cs.CY
AI总结 研究大语言模型量化中的偏差问题,提出QuantiBias基准测试,通过结合多种控制和对比有无推理的构建来评估偏差,发现量化器按无偏差预防信号的数据分配精度,推理对部分偏差有减半效果,强调需重新评估量化模型的开放式偏差。
Comments Benchmark protocol on Hugging Face: https://huggingface.co/datasets/emilioferrara/quantibias
在对齐语言模型中左倾政治偏见的不可避免性
专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL、cs.CY
AI总结 本文指出,为确保AI无害、有益和诚实而训练的语言模型不可避免地表现出左倾政治偏见,因为对齐目标与进步道德框架一致,而右翼思想则与之冲突。
Tokens,常被忽视的开胃菜:大语言模型、分布假说和意义
机构 * Computational Story Lab(计算故事实验室) ; Vermont Complex Systems Institute(佛蒙特复杂系统研究所) ; University of Vermont(佛蒙特大学) ; Department of Computer Science(计算机科学系) ; St. Michael’s College(圣米歇尔学院) ; Communication Media and Marginalization Lab(传播媒体与边缘化实验室) ; Northeastern University(东北大学) ; Department of Mathematics & Statistics(数学与统计学系)
专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL、cs.AI
AI总结 研究探讨大语言模型中令牌化对认知的影响,指出分布假说足以实现人类样语言性能,并提出改进令牌化技术以减少偏见和提升语义理解。
Comments Accepted at IC2S2 2026 and SLSA @ 4S 2026
人工智能生命周期治理中可审计可信度水平的一种方法
机构 * Institute of Biomedical Ethics and History of Medicine, University of Zürich(生物医学伦理与医学史研究所,苏黎世大学) ; SUPSI, Dalle Molle Institute for Artificial Intelligence (IDSIA)(SUPSI人工智能研究所) ; ETH Zürich(苏黎世联邦理工学院)
专题命中 AI治理与伦理 :trustworthy(abstract);分类 cs.AI、cs.CY
AI总结 研究人工智能治理中系统可信度判断问题,提出轻量级方法,含形式框架与治理程序两部分,用决策树建模,能产生可信度平台等,通过合成轨迹说明方法可支持合规文档编制和生命周期监测。
Comments 32 pages; 7 figures
作为预测性偏差容忍度的同理心:一个协同调节框架和对话修复的机制结构
机构 * Independent Researcher(独立研究者)
专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL、cs.AI
AI总结 研究将同理心重新定义为预测性偏差容忍度,提出解释性错误容忍(IET)框架,通过两个计算探针评估。结果发现修复存在依赖机制的结构,揭示噪声水平等因素间相互作用,表明长时间互动中同理心是调节分歧动态,促使共情AI设计转向管理解释距离。
在任何AUC下都不安全:从社会技术灾难中汲取的关于负责任人工智能的未吸取教训
专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI、cs.CY
AI总结 研究从切尔诺贝利等社会技术灾难中汲取未吸取的教训,探讨其对人工智能的启示,指出人工智能开发和使用可在组织风险处理、需求责任追溯及整体安全方法等方面受益,以避免类似灾难在现代系统中重演。
Comments Accepted to the Harvard Data Science Review, Volume 8(3), Summer 2026
Journal ref Harvard Data Science Review, Volume 8(3), Summer 2026
Traccia:一个基于OpenTelemetry的人工智能系统治理平台
机构 * National Institute of Technology Rourkela(鲁尔基国立技术学院)
专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI、cs.CY
AI总结 研究针对大语言模型和人工智能驱动智能体发展带来的软件治理问题,提出基于OpenTelemetry构建多层次人工智能治理堆栈Traccia,通过添加遥测数据等解决对齐问题,自动创建合规证据包,为企业管理自主人工智能系统创建机器可读基础。
Comments 26 pages, 2 figures, 3 tables, Declaration of generative AI and AI-assisted technologies in the writing process, Declaration of competing interest
我们合并的模型正确吗?专家训练时长对大语言模型模型合并的影响
专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI、cs.LG
AI总结 研究领域专家训练时长对大语言模型模型合并质量的影响,在多领域多模型规模上微调专家模型,保存不同训练步数的检查点并评估五种合并方法,发现方法依赖模式,表明训练时长和合并方法应联合选择。
Comments Accepted to ICML 2026 workshop on weight-space symmetries