arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 1823 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. AI治理与伦理 1823 篇

2101.06060 2021-01-19 cs.CY 92%

The Challenge of Value Alignment: from Fairer Algorithms to AI Safety

Iason Gabriel, Vafa Ghazavi

专题命中 AI治理与伦理 :alignment(title,abstract);safety(title,abstract);AI safety(title,abstract);分类 cs.CY

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24065 2025-10-17 cs.CY 90%

AI Safety, Alignment, and Ethics (AI SAE)

Dylan Waldner

专题命中 AI治理与伦理 :alignment(title,abstract);safety(title);AI safety(title);分类 cs.CY

Comments 46 pages, 9 figures (including appendix), 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06153 2026-01-13 cs.CY cs.AI 90%

Interoperability in AI Safety Governance: Ethics, Regulations, and Standards

人工智能安全治理中的互操作性:伦理、法规与标准

Yik Chan Chin, David A. Raho, Hag-Min Kim, Chunli Bi, James Ong, Jingbo Huang, Serge Stinckwich

专题命中 AI治理与伦理 :safety(title,abstract);AI safety(title,abstract);alignment(abstract);分类 cs.AI、cs.CY

AI总结 本报告通过比较四个国家在自动驾驶、教育和跨境数据流动领域的伦理、法律和技术框架,提出促进人工智能安全治理互操作性的政策建议。

Comments 122 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10058 2025-12-12 cs.AI cs.CY cs.HC cs.SI 90%

Mind the Gap! Pathways Towards Unifying AI Safety and Ethics Research

注意差距!迈向统一人工智能安全与伦理研究的路径

Dani Roytburg, Beck Miller

机构 * Department of Machine Learning(机器学习系) Carnegie Mellon University(卡内基梅隆大学) Department of Computer Science(计算机科学系) Emory University(埃默里大学)

专题命中 AI治理与伦理 :safety(title,abstract);AI safety(title,abstract);alignment(abstract);分类 cs.AI、cs.CY

AI总结 本文通过文献计量学分析揭示人工智能安全与伦理研究的结构性分裂,并提出通过共享基准、跨机构平台和混合方法整合两者以构建更公正的人工智能系统。

Comments Accepted for presentation at IASEAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06286 2025-06-10 cs.CY cs.AI cs.HC 90%

Disentangling AI Alignment: A Structured Taxonomy Beyond Safety and Ethics

Kevin Baum

机构 * Responsible AI & Machine Ethics Research Group (RAIME)(负责任的人工智能与机器伦理研究组) German Research Center for Artificial Intelligence (DFKI)(德国人工智能研究中心) Saarland Informatics Campus D 3 2(萨尔兰州信息学校园D32)

专题命中 AI治理与伦理 :alignment(title,abstract);safety(title,abstract);AI safety(abstract);分类 cs.AI、cs.CY

Comments accepted for the LNCS post proceedings of the AISoLA 2024 conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01147 2026-05-05 cs.AI 89%

Position: Safety and Fairness in Agentic AI Depend on Interaction Topology, Not on Model Scale or Alignment

位置:代理AI的安全性与公平性取决于交互拓扑,而非模型规模或对齐

Tanav Singh Bajaj, Nikhil Singh, Karan Anand, Eishkaran Singh

机构 * Department of Computer Science, University of British Columbia, Vancouver, Canada(英属哥伦比亚大学计算机科学系) Department of Artificial Intelligence, IIT Hyderabad, Hyderabad, India(印度海得拉巴理工学院人工智能系) Amazon, Delhi, India(印度德里亚马逊公司)

专题命中 AI治理与伦理 :alignment(title,abstract);safety(title,abstract);AI safety(abstract);分类 cs.AI

AI总结 本文指出代理AI的安全性由交互拓扑决定,而非模型规模或对齐程度。研究揭示了顺序不稳定、信息级联和功能崩溃等拓扑驱动的问题,并强调需通过动态系统视角评估安全性和公平性。

Comments 18 pages, 8 figures. Position paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02259 2026-04-30 cs.MA cs.LG cs.RO 89%

The Alignment Flywheel: A Governance-Centric Hybrid MAS for Architecture-Agnostic Safety

对齐飞轮:一种以治理为中心的混合MAS架构用于架构无关的安全性

Elias Malomgré, Pieter Simoens

机构 * IDLab, Ghent University - imec, Belgium(ID实验室,根特大学-imec,比利时)

专题命中 AI治理与伦理 :safety(title,abstract);alignment(title,abstract);分类 cs.LG

AI总结 本文提出一种以治理为中心的混合MAS架构,通过分离决策生成与安全治理,解决自主决策组件部署后的安全行为透明性问题,采用补丁局部性原则实现安全故障的低成本修复。

Comments Accepted for the EMAS workshop at AAMAS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22872 2025-10-03 cs.CY 89%

Anti-Regulatory AI: How "AI Safety" is Leveraged Against Regulatory Oversight

Rui-Jie Yew, Brian Judge

专题命中 AI治理与伦理 :safety(title,abstract);AI safety(title,abstract);alignment(abstract);分类 cs.CY

Comments Forthcoming at EAAMO 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.00752 2023-03-21 cs.AI 89%

Safety without alignment

András Kornai, Michael Bukatin, Zsolt Zombori

专题命中 AI治理与伦理 :alignment(title,abstract);safety(title,abstract);AI safety(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.04743 2025-03-10 cs.CY cs.AI 89%

AI Safety is Stuck in Technical Terms -- A System Safety Response to the International AI Safety Report

Roel Dobbe

专题命中 AI治理与伦理 :safety(title,abstract);AI safety(title,abstract);分类 cs.AI、cs.CY

Comments A response to the International AI Safety Report, which was released in preparation for the AI Action Summit in Paris, February 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06116 2026-07-10 cs.AI cs.CL cs.CY 89%

The Homogenization Problem in LLMs: Towards Meaningful Diversity in AI Safety

在大语言模型中的同质化问题:迈向人工智能安全中的有意义多样性

Ian Rios-Sialer

机构 * Independent Researcher(独立研究者)

专题命中 AI治理与伦理 :safety(title,abstract);AI safety(title,abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 本文探讨了大语言模型中同质化问题,提出通过编码价值观系统来促进多样性,通过实验揭示性别偏见并引入xeno-reproduction概念以缓解同质化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05095 2025-06-06 cs.CV 89%

FG 2025 TrustFAA: the First Workshop on Towards Trustworthy Facial Affect Analysis: Advancing Insights of Fairness, Explainability, and Safety (TrustFAA)

Jiaee Cheong, Yang Liu, Harold Soh, Hatice Gunes

机构 * University of Cambridge(剑桥大学) University of Oulu(奥卢大学) National University of Singapore(新加坡国立大学)

专题命中 AI治理与伦理 :safety(title,abstract);trustworthy(title,abstract);alignment(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.10000 2025-04-15 cs.CR cs.AI cs.CL cs.CV cs.LG 89%

Do We Really Need Curated Malicious Data for Safety Alignment in Multi-modal Large Language Models?

Yanbo Wang, Jiyang Guan, Jian Liang, Ran He

专题命中 AI治理与伦理 :alignment(title,abstract);safety(title,abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted to CVPR 2025, codes in process

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05656 2026-08-11 cs.CY cs.AI cs.HC 版本更新 88%

Studying People to Study AI: Expert Perspectives on the Epistemic Fit and Barriers of Human Research in AI Safety & Ethics

研究人以研究AI:关于人类研究在AI安全与伦理中的认知适配性及障碍的专家观点

Jessica Y. Bo, Paula Akemi Aoyagui, Shalaleh Rismani, Dipto Das, Syed Ishtiaque Ahmed, Ashton Anderson

专题命中 AI治理与伦理 :safety(title,abstract);AI safety(title,abstract);分类 cs.AI、cs.CY

AI总结 本研究通过对93名AI安全与伦理领域专家的调查及17名专家的访谈,分析了人类研究在AI安全与伦理领域的认知适配性与障碍,并提出相关建议以避免流于形式的“人类洗白”。

Comments Ninth AAAI/ACM Conference on AI, Ethics, and Society (AIES 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00382 2026-08-04 cs.AI cs.LG 版本更新 88%

Efficiency vs. Alignment: Investigating Safety and Fairness Risks in Parameter-Efficient Fine-Tuning of LLMs

效率与对齐:研究大语言模型参数高效微调中的安全与公平风险

Mina Taraghi, Yann Pequignot, Amin Nikanjam, Mohamed Amine Merzouk, Foutse Khomh

专题命中 AI治理与伦理 :alignment(title,abstract);safety(title,abstract);分类 cs.AI、cs.LG

AI总结 该研究发现良性参数高效微调会改变大语言模型的安全与公平性,基于适配器的方法更安全,基础模型和PEFT类型会影响对齐偏移,需按类别审计安全与公平性。

Comments Revised version with expanded experiments, robustness analyses, and appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18309 2025-12-23 cs.LG cs.AI 88%

Embedded Safety-Aligned Intelligence via Differentiable Internal Alignment Embeddings

通过可微内部对齐嵌入实现嵌入式安全对齐智能

Harsh Rathva, Ojas Srivastava, Pruthwik Mishra

机构 * Sardar Vallabhbhai National Institute of Technology (SVNIT)(萨达尔·瓦拉布尔·尼尔达理工学院)

专题命中 AI治理与伦理 :alignment(title,abstract);safety(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出嵌入式安全对齐智能框架,通过可微内部对齐嵌入实现多智能体强化学习中的安全对齐,探讨了反事实对齐惩罚、感知注意力等机制及理论性质。

Comments 32 pages, 1 figure. Theoretical framework; no empirical results

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00673 2025-09-03 cs.CL cs.AI cs.IR 88%

Confident, Calibrated, or Complicit: Probing the Trade-offs between Safety Alignment and Ideological Bias in Language Models in Detecting Hate Speech

Sanjeeevan Selvaganapathy, Mehwish Nasim

机构 * School of Physics, Mathematics and Computing(物理、数学与计算学系) Network Analysis and Social Influence Modelling (NASIM) Lab(网络分析与社会影响建模实验室) The University of Western Australia(西澳大学)

专题命中 AI治理与伦理 :alignment(title,abstract);safety(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.20848 2025-06-18 cs.GT cs.AI cs.CY econ.TH 88%

The Backfiring Effect of Weak AI Safety Regulation

Benjamin Laufer, Jon Kleinberg, Hoda Heidari

机构 * Cornell Tech(康奈尔科技) Cornell University(康奈尔大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 AI治理与伦理 :safety(title,abstract);AI safety(title,abstract);分类 cs.AI、cs.CY

Comments 35 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21344 2025-05-28 cs.AI cs.CL 88%

The Multilingual Divide and Its Impact on Global AI Safety

Aidan Peppin, Julia Kreutzer, Alice Schoenauer Sebag, Kelly Marchisio, Beyza Ermis, John Dang, Samuel Cahyawijaya, Shivalika Singh, Seraphina Goldfarb-Tarrant, Viraat Aryabumi, Aakanksha, Wei-Yin Ko, Ahmet Üstün, Matthias Gallé, Marzieh Fadaee, Sara Hooker

专题命中 AI治理与伦理 :safety(title,abstract);AI safety(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.10536 2024-09-18 cs.CY cs.AI 88%

The potential functions of an international institution for AI safety. Insights from adjacent policy areas and recent trends

A. Leone De Castris, C. Thomas

专题命中 AI治理与伦理 :safety(title,abstract);AI safety(title,abstract);分类 cs.AI、cs.CY

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.09794 2024-06-25 cs.AI cs.CY cs.SY eess.SY 88%

Human-AI Safety: A Descendant of Generative AI and Control Systems Safety

Andrea Bajcsy, Jaime F. Fisac

专题命中 AI治理与伦理 :safety(title,abstract);AI safety(title,abstract);分类 cs.AI、cs.CY

Comments Revised version with refined exposition and technical details. 12 pages + references, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.17419 2024-03-28 cs.AI cs.CY 88%

AI Safety: Necessary, but insufficient and possibly problematic

Deepak P

专题命中 AI治理与伦理 :safety(title,abstract);AI safety(title,abstract);分类 cs.AI、cs.CY

Comments AI & Soc (2024)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23380 2026-06-24 cs.CY 新提交 88%

Affective AI Safety: The Missing Piece in LLM Safety

情感AI安全:LLM安全中缺失的一环

Carolin Ifländer, Alba Curry, Flor Miriam Plaza-del-Arco, Amanda Cercas Curry

专题命中 AI治理与伦理 :safety(title,abstract);AI safety(title,abstract);分类 cs.CY

AI总结 本文提出情感安全作为AI安全的新类别,分类情感伤害类型,并指出现有框架未能充分应对,呼吁建立专门框架处理累积性、关系性和身份层面的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.05367 2026-06-02 cs.CR cs.AI 88%

Between a Rock and a Hard Place: The Tension Between Ethical Reasoning and Safety Alignment in LLMs

进退维谷:大型语言模型中伦理推理与安全对齐之间的张力

Shei Pern Chua, Zhen Leng Thai, Kai Jun Teh, Xiao Li, Qibing Ren, Xiaolin Hu

机构 * Department of Computer Science and Technology, Institute for AI, BNRist, Tsinghua University(计算机科学与技术系,人工智能研究院,BNRist,清华大学) IDG/McGovern Institute for Brain Research, Tsinghua University(IDG/麦克戈文脑科学研究院,清华大学) Chinese Institute for Brain Research (CIBR)(中国脑科学研究院(CIBR)) Shanghai Jiao Tong University(上海交通大学) ByteDance(字节跳动)

专题命中 AI治理与伦理 :alignment(title,abstract);safety(title,abstract);分类 cs.AI

AI总结 本文提出TRIAL多轮红队方法,通过将有害请求嵌入伦理框架来利用模型伦理推理能力,并引入ERR防御框架(分层有害门控LoRA架构)以区分工具性回应与解释性回应,实现鲁棒防御。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28338 2026-05-28 cs.AI 88%

SafeMed-R1: Clinician-Audited Safety and Ethics Alignment for Medical Large Language Models

SafeMed-R1: 临床医生审计的安全与伦理对齐用于医疗大语言模型

Chao Ding, Mouxiao Bian, Tianbin Li, Minjia Yuan, Yidong Jiang, Yankai Jiang, Jinru Ding, Jiayuan Chen, Zhuangzhi Gao, Pengcheng Chen, Zhao He, Rongzhao Zhang, Meiling Liu, Luyi Jiang, Jie Xu

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Joint Laboratory of Biomedical Artificial Intelligence(生物医学人工智能联合实验室) Shanghai Institute of Infectious Disease and Biosecurity(上海传染病与生物安全研究院) Shanghai Health Development Research Center (Shanghai Medical Information Center)(上海健康发展战略研究中心(上海医疗信息中心)) University of Washington(华盛顿大学) Department of Eye and Vision Sciences, University of Liverpool(利物浦大学眼科与视觉科学系) Liverpool Centre for Cardiovascular Science, University of Liverpool(利物浦大学心血管科学中心) School of Computer Science and Technology, Tongji University(同济大学计算机科学与技术学院)

专题命中 AI治理与伦理 :alignment(title,abstract);safety(title,abstract);分类 cs.AI

AI总结 提出SafeMed-R1模型,通过可追溯的临床信任信号管道和红队压力测试实现安全与伦理对齐,在临床基准上达到79.6%的宏平均准确率,并将不安全输出减少约3-5%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11391 2026-02-02 cs.LG 88%

Mitigating the Safety Alignment Tax with Null-Space Constrained Policy Optimization

通过空域约束策略优化缓解安全对齐税

Yifan Niu, Han Xiao, Dongyi Liu, Nuo Chen, Jia Li

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 AI治理与伦理 :alignment(title,abstract);safety(title,abstract);分类 cs.LG

AI总结 通过空域约束策略优化缓解安全对齐税,提出NSPO框架在保留LLM核心能力的同时提升安全性能。

Comments accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.12914 2025-04-18 cs.CY 88%

In Which Areas of Technical AI Safety Could Geopolitical Rivals Cooperate?

Ben Bucknall, Saad Siddiqui, Lara Thurnherr, Conor McGurk, Ben Harack, Anka Reuel, Patricia Paskov, Casey Mahoney, Sören Mindermann, Scott Singer, Vinay Hiremath, Charbel-Raphaël Segerie, Oscar Delaney, Alessandro Abate, Fazl Barez, Michael K. Cohen, Philip Torr, Ferenc Huszár, Anisoara Calinescu, Gabriel Davis Jones, Yoshua Bengio, Robert Trager

专题命中 AI治理与伦理 :safety(title,abstract);AI safety(title,abstract);分类 cs.CY

Comments Accepted to ACM Conference on Fairness, Accountability, and Transparency (FAccT 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.11705 2025-04-01 cs.CY 88%

The BIG Argument for AI Safety Cases

Ibrahim Habli, Richard Hawkins, Colin Paterson, Philippa Ryan, Yan Jia, Mark Sujan, John McDermid

专题命中 AI治理与伦理 :safety(title,abstract);AI safety(title,abstract);分类 cs.CY

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.16562 2024-10-23 cs.CY 88%

Vernacularizing Taxonomies of Harm is Essential for Operationalizing Holistic AI Safety

Wm. Matthew Kennedy, Daniel Vargas Campos

专题命中 AI治理与伦理 :safety(title,abstract);AI safety(title,abstract);分类 cs.CY

Comments Accepted to the Proceedings of the Conference on AI Ethics and Society (AIES), 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2208.14788 2023-04-21 cs.CY cs.AI 87%

Negative Human Rights as a Basis for Long-term AI Safety and Regulation

Ondrej Bajgar, Jan Horenovsky

专题命中 AI治理与伦理 :safety(title,abstract);AI safety(title);分类 cs.AI、cs.CY

Journal ref Journal of Artificial Intelligence Research 76 (2023) 1043-1075

详情

展开后加载摘要…

URL PDF HTML 收藏