The Challenge of Value Alignment: from Fairer Algorithms to AI Safety
专题命中 AI治理与伦理 :alignment(title,abstract);safety(title,abstract);AI safety(title,abstract);分类 cs.CY
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
专题命中 AI治理与伦理 :alignment(title,abstract);safety(title,abstract);AI safety(title,abstract);分类 cs.CY
专题命中 AI治理与伦理 :alignment(title,abstract);safety(title);AI safety(title);分类 cs.CY
Comments 46 pages, 9 figures (including appendix), 1 table
人工智能安全治理中的互操作性:伦理、法规与标准
专题命中 AI治理与伦理 :safety(title,abstract);AI safety(title,abstract);alignment(abstract);分类 cs.AI、cs.CY
AI总结 本报告通过比较四个国家在自动驾驶、教育和跨境数据流动领域的伦理、法律和技术框架,提出促进人工智能安全治理互操作性的政策建议。
Comments 122 pages
注意差距!迈向统一人工智能安全与伦理研究的路径
机构 * Department of Machine Learning(机器学习系) ; Carnegie Mellon University(卡内基梅隆大学) ; Department of Computer Science(计算机科学系) ; Emory University(埃默里大学)
专题命中 AI治理与伦理 :safety(title,abstract);AI safety(title,abstract);alignment(abstract);分类 cs.AI、cs.CY
AI总结 本文通过文献计量学分析揭示人工智能安全与伦理研究的结构性分裂,并提出通过共享基准、跨机构平台和混合方法整合两者以构建更公正的人工智能系统。
Comments Accepted for presentation at IASEAI 2026
机构 * Responsible AI & Machine Ethics Research Group (RAIME)(负责任的人工智能与机器伦理研究组) ; German Research Center for Artificial Intelligence (DFKI)(德国人工智能研究中心) ; Saarland Informatics Campus D 3 2(萨尔兰州信息学校园D32)
专题命中 AI治理与伦理 :alignment(title,abstract);safety(title,abstract);AI safety(abstract);分类 cs.AI、cs.CY
Comments accepted for the LNCS post proceedings of the AISoLA 2024 conference
位置:代理AI的安全性与公平性取决于交互拓扑,而非模型规模或对齐
机构 * Department of Computer Science, University of British Columbia, Vancouver, Canada(英属哥伦比亚大学计算机科学系) ; Department of Artificial Intelligence, IIT Hyderabad, Hyderabad, India(印度海得拉巴理工学院人工智能系) ; Amazon, Delhi, India(印度德里亚马逊公司)
专题命中 AI治理与伦理 :alignment(title,abstract);safety(title,abstract);AI safety(abstract);分类 cs.AI
AI总结 本文指出代理AI的安全性由交互拓扑决定,而非模型规模或对齐程度。研究揭示了顺序不稳定、信息级联和功能崩溃等拓扑驱动的问题,并强调需通过动态系统视角评估安全性和公平性。
Comments 18 pages, 8 figures. Position paper
对齐飞轮:一种以治理为中心的混合MAS架构用于架构无关的安全性
机构 * IDLab, Ghent University - imec, Belgium(ID实验室,根特大学-imec,比利时)
专题命中 AI治理与伦理 :safety(title,abstract);alignment(title,abstract);分类 cs.LG
AI总结 本文提出一种以治理为中心的混合MAS架构,通过分离决策生成与安全治理,解决自主决策组件部署后的安全行为透明性问题,采用补丁局部性原则实现安全故障的低成本修复。
Comments Accepted for the EMAS workshop at AAMAS 2026
专题命中 AI治理与伦理 :safety(title,abstract);AI safety(title,abstract);alignment(abstract);分类 cs.CY
Comments Forthcoming at EAAMO 2025
专题命中 AI治理与伦理 :alignment(title,abstract);safety(title,abstract);AI safety(abstract);分类 cs.AI
专题命中 AI治理与伦理 :safety(title,abstract);AI safety(title,abstract);分类 cs.AI、cs.CY
Comments A response to the International AI Safety Report, which was released in preparation for the AI Action Summit in Paris, February 2025
在大语言模型中的同质化问题:迈向人工智能安全中的有意义多样性
机构 * Independent Researcher(独立研究者)
专题命中 AI治理与伦理 :safety(title,abstract);AI safety(title,abstract);分类 cs.CL、cs.AI、cs.CY
AI总结 本文探讨了大语言模型中同质化问题,提出通过编码价值观系统来促进多样性,通过实验揭示性别偏见并引入xeno-reproduction概念以缓解同质化。
机构 * University of Cambridge(剑桥大学) ; University of Oulu(奥卢大学) ; National University of Singapore(新加坡国立大学)
专题命中 AI治理与伦理 :safety(title,abstract);trustworthy(title,abstract);alignment(abstract)
专题命中 AI治理与伦理 :alignment(title,abstract);safety(title,abstract);分类 cs.CL、cs.AI、cs.LG
Comments Accepted to CVPR 2025, codes in process
研究人以研究AI:关于人类研究在AI安全与伦理中的认知适配性及障碍的专家观点
专题命中 AI治理与伦理 :safety(title,abstract);AI safety(title,abstract);分类 cs.AI、cs.CY
AI总结 本研究通过对93名AI安全与伦理领域专家的调查及17名专家的访谈,分析了人类研究在AI安全与伦理领域的认知适配性与障碍,并提出相关建议以避免流于形式的“人类洗白”。
Comments Ninth AAAI/ACM Conference on AI, Ethics, and Society (AIES 2026)
效率与对齐:研究大语言模型参数高效微调中的安全与公平风险
专题命中 AI治理与伦理 :alignment(title,abstract);safety(title,abstract);分类 cs.AI、cs.LG
AI总结 该研究发现良性参数高效微调会改变大语言模型的安全与公平性,基于适配器的方法更安全,基础模型和PEFT类型会影响对齐偏移,需按类别审计安全与公平性。
Comments Revised version with expanded experiments, robustness analyses, and appendices
通过可微内部对齐嵌入实现嵌入式安全对齐智能
机构 * Sardar Vallabhbhai National Institute of Technology (SVNIT)(萨达尔·瓦拉布尔·尼尔达理工学院)
专题命中 AI治理与伦理 :alignment(title,abstract);safety(title,abstract);分类 cs.AI、cs.LG
AI总结 本文提出嵌入式安全对齐智能框架,通过可微内部对齐嵌入实现多智能体强化学习中的安全对齐,探讨了反事实对齐惩罚、感知注意力等机制及理论性质。
Comments 32 pages, 1 figure. Theoretical framework; no empirical results
机构 * School of Physics, Mathematics and Computing(物理、数学与计算学系) ; Network Analysis and Social Influence Modelling (NASIM) Lab(网络分析与社会影响建模实验室) ; The University of Western Australia(西澳大学)
专题命中 AI治理与伦理 :alignment(title,abstract);safety(title,abstract);分类 cs.CL、cs.AI
机构 * Cornell Tech(康奈尔科技) ; Cornell University(康奈尔大学) ; Carnegie Mellon University(卡内基梅隆大学)
专题命中 AI治理与伦理 :safety(title,abstract);AI safety(title,abstract);分类 cs.AI、cs.CY
Comments 35 pages, 5 figures
专题命中 AI治理与伦理 :safety(title,abstract);AI safety(title,abstract);分类 cs.CL、cs.AI
专题命中 AI治理与伦理 :safety(title,abstract);AI safety(title,abstract);分类 cs.AI、cs.CY
专题命中 AI治理与伦理 :safety(title,abstract);AI safety(title,abstract);分类 cs.AI、cs.CY
Comments Revised version with refined exposition and technical details. 12 pages + references, 5 figures
专题命中 AI治理与伦理 :safety(title,abstract);AI safety(title,abstract);分类 cs.AI、cs.CY
Comments AI & Soc (2024)
情感AI安全:LLM安全中缺失的一环
专题命中 AI治理与伦理 :safety(title,abstract);AI safety(title,abstract);分类 cs.CY
AI总结 本文提出情感安全作为AI安全的新类别,分类情感伤害类型,并指出现有框架未能充分应对,呼吁建立专门框架处理累积性、关系性和身份层面的影响。
进退维谷:大型语言模型中伦理推理与安全对齐之间的张力
机构 * Department of Computer Science and Technology, Institute for AI, BNRist, Tsinghua University(计算机科学与技术系,人工智能研究院,BNRist,清华大学) ; IDG/McGovern Institute for Brain Research, Tsinghua University(IDG/麦克戈文脑科学研究院,清华大学) ; Chinese Institute for Brain Research (CIBR)(中国脑科学研究院(CIBR)) ; Shanghai Jiao Tong University(上海交通大学) ; ByteDance(字节跳动)
专题命中 AI治理与伦理 :alignment(title,abstract);safety(title,abstract);分类 cs.AI
AI总结 本文提出TRIAL多轮红队方法,通过将有害请求嵌入伦理框架来利用模型伦理推理能力,并引入ERR防御框架(分层有害门控LoRA架构)以区分工具性回应与解释性回应,实现鲁棒防御。
SafeMed-R1: 临床医生审计的安全与伦理对齐用于医疗大语言模型
机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; Joint Laboratory of Biomedical Artificial Intelligence(生物医学人工智能联合实验室) ; Shanghai Institute of Infectious Disease and Biosecurity(上海传染病与生物安全研究院) ; Shanghai Health Development Research Center (Shanghai Medical Information Center)(上海健康发展战略研究中心(上海医疗信息中心)) ; University of Washington(华盛顿大学) ; Department of Eye and Vision Sciences, University of Liverpool(利物浦大学眼科与视觉科学系) ; Liverpool Centre for Cardiovascular Science, University of Liverpool(利物浦大学心血管科学中心) ; School of Computer Science and Technology, Tongji University(同济大学计算机科学与技术学院)
专题命中 AI治理与伦理 :alignment(title,abstract);safety(title,abstract);分类 cs.AI
AI总结 提出SafeMed-R1模型,通过可追溯的临床信任信号管道和红队压力测试实现安全与伦理对齐,在临床基准上达到79.6%的宏平均准确率,并将不安全输出减少约3-5%。
通过空域约束策略优化缓解安全对齐税
机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))
专题命中 AI治理与伦理 :alignment(title,abstract);safety(title,abstract);分类 cs.LG
AI总结 通过空域约束策略优化缓解安全对齐税,提出NSPO框架在保留LLM核心能力的同时提升安全性能。
Comments accepted by ICLR 2026
专题命中 AI治理与伦理 :safety(title,abstract);AI safety(title,abstract);分类 cs.CY
Comments Accepted to ACM Conference on Fairness, Accountability, and Transparency (FAccT 2025)
专题命中 AI治理与伦理 :safety(title,abstract);AI safety(title,abstract);分类 cs.CY
专题命中 AI治理与伦理 :safety(title,abstract);AI safety(title,abstract);分类 cs.CY
Comments Accepted to the Proceedings of the Conference on AI Ethics and Society (AIES), 2024
专题命中 AI治理与伦理 :safety(title,abstract);AI safety(title);分类 cs.AI、cs.CY
Journal ref Journal of Artificial Intelligence Research 76 (2023) 1043-1075