arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 1824 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. AI治理与伦理 1824 篇

2512.11878 2026-05-27 cs.CY cs.CR 74%

A Technical Policy Blueprint for Trustworthy Decentralized AI

可信去中心化人工智能的技术政策蓝图

Hasan Kassem, Orion Banks, Omar Benjelloun, Sergen Cansiz, Brandon Edwards, Patrick Foley, Inken Hagestedt, Taeho Jung, Peter Kairouz, Marco Lorenzi, Peter Mattson, Prakash Moorthy, Ann K Novakowski, Michael O'Connor, Bruno Rodrigues, Holger Roth, Micah Sheller, Dimitris Stripelis, Renato Umeton, Marc Vesin, Wenbin Zhang, Mic Bowman, Alexandros Karargyris

专题命中 AI治理与伦理 :trustworthy(title);分类 cs.CY

AI总结 提出一种技术政策蓝图,通过将治理需求编码为策略即代码对象,并解耦策略验证与执行,实现去中心化AI系统的透明、可扩展和可验证治理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.19240 2026-05-13 cs.CL 74%

How far can bias go? Tracing bias from pretraining data to alignment

偏见能走多远?从预训练数据到对齐的偏见追溯

Marion Thaler, Abdullatif Köksal, Alina Leidinger, Anna Korhonen, Hinrich Schütze

机构 * CIS, LMU Munich(慕尼黑大学语言信息学研究所) ILLC, University of Amsterdam(阿姆斯特丹大学语言研究所) Language Technology Lab, University of Cambridge(剑桥大学语言技术实验室)

专题命中 AI治理与伦理 :alignment(title);分类 cs.CL

AI总结 研究探讨预训练数据中的性别职业偏见如何在LLM中表现,通过零样本提示和词元共现分析,发现训练数据中的偏见被放大,指令微调部分缓解了代表性偏见,但整体性别刻板印象仍存在。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21103 2026-04-24 cs.AI econ.GN q-fin.EC 74%

AI Governance under Political Turnover: The Alignment Surface of Compliance Design

人工智能治理中的政治更替:合规设计的对齐表面

Andrew J. Peterson

机构 * University of Poitiers(波尔多大学)

专题命中 AI治理与伦理 :alignment(title);分类 cs.AI

AI总结 研究探讨了在政治更替背景下,合规层如何影响AI治理的稳定性与透明性,分析了自动化程度、编码程度及迭代使用保障对系统脆弱性的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02858 2026-01-07 cs.CL 74%

To Generate or Discriminate? Methodological Considerations for Measuring Cultural Alignment in LLMs

是生成还是判别?衡量LLM文化契合度的方法论考虑

Saurabh Kumar Pandey, Sougata Saha, Monojit Choudhury

机构 * Mohamed bin Zayed University of Artificial Intelligence(莫莫德·宾·扎耶德人工智能大学)

专题命中 AI治理与伦理 :alignment(title);分类 cs.CL

AI总结 本文通过反向社会人口提示方法探讨LLM文化契合度测量问题,发现真实行为表现优于模拟行为,但个体层面个性化存在局限。

Comments IJCNLP-AACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21009 2025-11-27 cs.LG 74%

ChatGpt Content detection: A new approach using xlm-roberta alignment

ChatGpt 内容检测:一种使用XLM-RoBERTa对齐的新方法

Md Tasnin Tanvir, Dr Santanu Kumar Dash, Ishan Shahnan, Nafis Fuad, Tanvir Rahman, Abdullah Al Faisal, Asadullah Al Mamun

专题命中 AI治理与伦理 :alignment(title);分类 cs.LG

AI总结 本文提出利用XLM-RoBERTa模型检测AI生成文本,通过特征提取和模型微调提高区分人类与AI文本的准确性,并探讨其在学术诚信和AI伦理中的应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.02133 2025-09-03 cs.CL 74%

AMBEDKAR-A Multi-level Bias Elimination through a Decoding Approach with Knowledge Augmentation for Robust Constitutional Alignment of Language Models

Snehasis Mukhopadhyay, Aryan Kasat, Shivam Dubey, Rahul Karthikeyan, Dhruv Sood, Vinija Jain, Aman Chadha, Amitava Das

机构 * Indian Institute of Information Technology, Kalyani(印度信息技术学院,卡里尼) BITS Pilani Goa(比尔·斯图尔特学院,果阿) IIT Madras(马德拉斯理工学院) DTU(达丁理工大学) Artificial Intelligence Institute, University of South Carolina(南卡罗来纳大学人工智能研究所) Meta AI Amazon GenAI(亚马逊生成人工智能)

专题命中 AI治理与伦理 :alignment(title);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.04249 2025-07-08 cs.CY cs.ET 74%

Ethics by Design: A Lifecycle Framework for Trustworthy AI in Medical Imaging From Transparent Data Governance to Clinically Validated Deployment

Umer Sadiq Khan, Saif Ur Rehman Khan

专题命中 AI治理与伦理 :trustworthy(title);分类 cs.CY

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.13199 2025-05-28 cs.CR cs.AI 74%

Building Trustworthy Multimodal AI: A Review of Fairness, Transparency, and Ethics in Vision-Language Tasks

Mohammad Saleh, Azadeh Tabatabaei

专题命中 AI治理与伦理 :trustworthy(title);分类 cs.AI

Journal ref International Journal of Web Research, vol.8, no.2,pp.11-24, 2025,

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.06288 2022-10-13 stat.ML cs.LG 74%

fAux: Testing Individual Fairness via Gradient Alignment

Giuseppe Castiglione, Ga Wu, Christopher Srinivasa, Simon Prince

专题命中 AI治理与伦理 :alignment(title);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2006.13198 2022-02-08 stat.ML cond-mat.dis-nn cs.LG 74%

Spectral Bias and Task-Model Alignment Explain Generalization in Kernel Regression and Infinitely Wide Neural Networks

Abdulkadir Canatar, Blake Bordelon, Cengiz Pehlevan

专题命中 AI治理与伦理 :alignment(title);分类 cs.LG

Comments Accepted for publication in Nature Communications. SI Eq.71 is corrected

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05178 2026-08-07 cs.CY cs.AI 新提交 73%

Who Gets Access? Global Region and Academic Status Bias in AI-Generated Academic Gatekeeping Scenarios

谁能获得权限?AI生成的学术守门场景中的全球区域与学术地位偏差

Nouar AlDahoul, Hezerul Abdul Karim, Myles Joshua Toledo Tan

专题命中 AI治理与伦理 :alignment(abstract);safety(abstract);分类 cs.AI、cs.CY

AI总结 该研究构建LLM模拟学术守门场景,发现LLM存在学术地位偏差,且模型架构导致区域偏好差异,凸显需审计AI系统的公平性与价值对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25648 2026-07-29 cs.CY cs.AI 新提交 73%

Why Public Service AI Governance Frameworks Risk Failing in the Age of General-Purpose AI: Lessons from Policing

为何公共服务人工智能治理框架在通用人工智能时代面临失败风险:来自警务领域的教训

Sam Relins, Daniel Birks

专题命中 AI治理与伦理 :safety(abstract);AI safety(abstract);分类 cs.AI、cs.CY

AI总结 研究公共服务中通用人工智能治理框架面临的风险,以警务为例,指出其特性破坏安全条件,常用缓解措施失效,建议明确分类、技术简约、暂停部署并建立国家安全基础设施。

Comments Preprint; submitted for peer review

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01925 2026-07-24 cs.CL cs.AI 版本更新 73%

ImplicitBBQ: Benchmarking Implicit Bias in Large Language Models through Characteristic Based Cues

ImplicitBBQ: 通过基于特征的提示对大语言模型中的隐性偏见进行基准测试

Bhaskara Hanuma Vedula, Darshan Anghan, Ishita Goyal, Ponnurangam Kumaraguru, Abhijnan Chakraborty

机构 * International Institute of Information Technology, Hyderabad(国际信息技术学院海得拉巴) Indian Institute of Technology, Kharagpur(印度理工学院克勒格布尔分校)

专题命中 AI治理与伦理 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI

AI总结 本文提出ImplicitBBQ基准测试,通过基于特征的提示评估大语言模型中的隐性偏见,发现隐性偏见在模糊情境中比显性偏见高六倍,现有方法难以有效缓解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00626 2026-06-19 cs.LG cs.CL 版本更新 73%

A Survey of On-Policy Distillation for Large Language Models

大型语言模型的在线策略蒸馏综述

Mingyang Song, Mao Zheng

机构 * Tencent, China(腾讯,中国)

专题命中 AI治理与伦理 :RLHF(abstract,abstract_cn);分类 cs.CL、cs.LG

AI总结 本文综述了大型语言模型的在线策略蒸馏方法,探讨了蒸馏过程中如何通过反馈减少累积误差,提出了基于f-散度最小化的蒸馏框架,并分析了蒸馏与强化学习之间的联系。

Comments Ongoing Work

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27628 2026-06-12 cs.AI cs.CY cs.ET cs.MA cs.SY eess.SY 版本更新 73%

Intelligence as Managed Autonomy: Failure, Escalation, and Governance for Agentic AI Systems

智能作为受管自主:代理型AI系统的失败、升级与治理

Srini Ramaswamy

机构 * DNRS.ai USA(DNRS.ai美国公司)

专题命中 AI治理与伦理 :alignment(abstract);safety(abstract);分类 cs.AI、cs.CY

AI总结 本文提出SMARt模型,通过形式化能力检测认知漂移、暂停推理、尝试恢复并在可靠性下降时放弃控制,以解决自主AI系统中的幻觉和持续不合理行为问题。

Comments This peer-reviewed paper is to appear in the Journal of Intelligent and Robotic Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.03217 2026-06-10 cs.LG cs.CY 版本更新 73%

Moral Sensitivity in LLMs: A Tiered Evaluation of Contextual Bias via Behavioral Profiling and Mechanistic Interpretability

大语言模型中的道德敏感性:通过行为剖析和机制可解释性对上下文偏见进行分层评估

Yash Aggarwal, Atmika Gorti, Vinija Jain, Aman Chadha, Krishnaprasad Thirunarayan, Manas Gaur

机构 * University of Maryland, College Park(马里兰大学学院公园分校) Purdue University(普渡大学) Meta Apple(苹果公司) Wright State University(怀特州立大学) University of Maryland, Baltimore County(马里兰大学巴尔的摩县分校)

专题命中 AI治理与伦理 :alignment(abstract);safety(abstract);分类 cs.CY、cs.LG

AI总结 提出道德敏感性指数(MSI)量化大语言模型在七级压力测试中的偏见概率,并通过行为剖析和机制验证揭示模型偏见随情境变化的U型曲线,发现推理蒸馏会重新激活浅层统计关联。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26397 2026-06-02 cs.CL cs.AI 73%

Algorithmic Fragility and Persona Bias in LLM-Generated Autistic Communication

LLM生成的自闭症交流中的算法脆弱性与人格偏见

Naba Rizvi, Mohammed Rizvi, Harper Strickland, Saleha Ahmedi, Nedjma Ousidhoum

机构 * University of California, San Diego(加州大学圣地亚哥分校) Georgia Institute of Technology(佐治亚理工学院) Cornell University(康奈尔大学) Cardiff University(卡迪夫大学)

专题命中 AI治理与伦理 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI

AI总结 通过双人格改写范式,发现LLM在生成自闭症人格文本时存在词汇与情感偏离、输出坍塌等系统性失败,且对齐策略而非参数规模主导这些失败,表明当前对齐训练导致深层表征鸿沟。

Comments main paper: 9 pages; total: 19 pages; 2 figures; 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22227 2026-04-30 cs.CY cs.AI cs.HC cs.NE 73%

A Co-Evolutionary Theory of Human-AI Coexistence: Mutualism, Governance, and Dynamics in Complex Societies

人类与人工智能共存的共进化理论:互惠、治理与复杂社会中的动态

Somyajit Chakraborty

机构 * School of Chemistry and Chemical Engineering(化学与化工学院)

专题命中 AI治理与伦理 :alignment(abstract);safety(abstract);分类 cs.AI、cs.CY

AI总结 本文提出在治理下的人机共存互惠框架,通过共进化关系设计人类与AI的共存,强调互惠、可逆性、心理安全和社会合法性,通过动态系统模型分析共存条件与稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25249 2026-04-29 cs.CL cs.AI 73%

Below-Chance Blindness: Prompted Underperformance in Small LLMs Produces Positional Bias Rather than Answer Avoidance

低于平均水平的盲目性:在小语言模型中受提示的欠绩效产生位置偏差而非答案回避

Jon-Paul Cacioli

机构 * Independent Researcher(独立研究者)

专题命中 AI治理与伦理 :safety(abstract);AI safety(abstract);分类 cs.CL、cs.AI

AI总结 研究探讨了在小规模语言模型中,受提示的欠绩效是否导致位置偏差而非答案回避,发现模型在受指令下表现出位置偏好的倾向,而非刻意回避答案。

Comments 10 pages, 2 figures, 2 tables. Pre-registered: https://osf.io/6zftv/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24076 2026-04-28 cs.AI cs.CL cs.CR 73%

An Information-Geometric Framework for Stability Analysis of Large Language Models under Entropic Stress

一个信息几何框架用于在熵应力下分析大语言模型的稳定性

Hikmat Karimov, Rahid Zahid Alekberli

机构 * Institute of Defense Technologies and Cybersecurity, Azerbaijan Technical University(国防技术与网络安全研究所,阿塞拜疆技术大学)

专题命中 AI治理与伦理 :safety(abstract);AI safety(abstract);分类 cs.CL、cs.AI

AI总结 本文提出一个信息几何框架,通过整合任务效用、熵、内部结构指标,评估大语言模型在不确定性下的稳定性,实验显示该方法在高熵条件下表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06215 2026-04-09 cs.CY cs.AI 73%

Governing frontier general-purpose AI in the public sector: adaptive risk management and policy capacity under uncertainty through 2030

在公共部门治理前沿通用人工智能:通过2030年的不确定性实现适应性风险管理与政策能力

Fabio Correa Xavier

专题命中 AI治理与伦理 :safety(abstract);AI safety(abstract);分类 cs.AI、cs.CY

AI总结 本文探讨公共部门在2030年前应对前沿通用人工智能的治理挑战,提出基于适应性风险管理、情景感知监管和社会技术转型的治理框架,强调政策能力提升与责任分配的重要性。

Comments 7 PAGES, 1 FIGURE

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03262 2026-04-07 cs.CY cs.AI 73%

AI Governance Control Stack for Operational Stability: Achieving Hardened Governance in AI Systems

AI治理控制堆栈用于操作稳定性:在AI系统中实现强化治理

Horatio Morgan

机构 * Morgan Signing House(摩根签名公司)

专题命中 AI治理与伦理 :alignment(abstract);trustworthy(abstract);分类 cs.AI、cs.CY

AI总结 本文提出AI治理控制堆栈,通过六个互补层确保AI系统行为可追溯且具有韧性,结合解释性基础设施与持续监控,为复杂企业环境中的强化AI治理提供蓝图。

Comments 10 pages, 4 figures, 1 table. Research paper introducing an operational AI governance architecture aligned with emerging regulatory frameworks including the EU AI Act, ISO/IEC 42001, and the NIST AI Risk Management Framework

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18788 2026-03-25 cs.CL cs.AI 73%

Mi:dm K 2.5 Pro

KT Tech innovation Group

专题命中 AI治理与伦理 :safety(abstract);harmlessness(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19144 2026-03-20 cs.CL cs.AI 73%

UGID: Unified Graph Isomorphism for Debiasing Large Language Models

UGID: 用于去偏大型语言模型的统一图同构

Zikang Ding, Junchi Yao, Junhao Li, Yi Zhang, Wenbo Jiang, Hongbo Liu, Lijie Hu

机构 * University of Electronic Science and Technology of China(电子科技大学) Mohamed bin Zayed University of Artificial Intelligence(Mohamed bin Zayed人工智能大学) South China University of Technology(华南理工大学)

专题命中 AI治理与伦理 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI

AI总结 UGID通过构建Transformer的结构化计算图,在内部表示层面减少模型偏见,通过约束注意力路由和隐藏表示,提升模型行为一致性并保持安全性和实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14495 2026-03-17 cs.CY cs.AI 73%

Bridging the Gap in the Responsible AI Divides

弥合负责任AI分歧的鸿沟

Bálint Gyevnár, Atoosa Kasirzadeh

专题命中 AI治理与伦理 :safety(abstract);AI safety(abstract);分类 cs.AI、cs.CY

AI总结 本文通过分析3550篇论文,探讨AI安全与AI伦理之间的分歧与重叠,提出通过解决关键问题促进负责任的AI治理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13900 2026-03-06 cs.CL cs.AI 73%

Narrow Finetuning Leaves Clearly Readable Traces in Activation Differences

细粒度微调在激活差异中留下明显可读的痕迹

Julian Minder, Clément Dumas, Stewart Slocum, Helena Casademunt, Cameron Holmes, Robert West, Neel Nanda

机构 * EPFL(苏黎世联邦理工学院) Ecole Normale Supérieure Paris-Saclay(巴黎-萨克雷高等师范学校) Université Paris-Saclay(巴黎-萨克雷大学) Harvard University(哈佛大学) MATS

专题命中 AI治理与伦理 :safety(abstract);AI safety(abstract);分类 cs.CL、cs.AI

AI总结 研究发现狭窄微调会在激活中留下明显痕迹,揭示了微调领域偏见,并警告了使用此类模型进行广泛微调研究的局限性。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04742 2026-02-05 cs.CY cs.CL 73%

Inference-Time Reasoning Selectively Reduces Implicit Social Bias in Large Language Models

推理时的推理选择性减少大语言模型中的隐性社会偏见

Molly Apsel, Michael N. Jones

机构 * Cognitive Science Program Department of Psychological & Brain Sciences Indiana University Bloomington(心理与脑科学系认知科学计划印第安纳大学布卢明顿)

专题命中 AI治理与伦理 :alignment(abstract);safety(abstract);分类 cs.CL、cs.CY

AI总结 该研究通过推理增强减少大语言模型中的隐性社会偏见,揭示推理对公平性评估的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14017 2025-11-19 cs.LG cs.AI 73%

From Narrow Unlearning to Emergent Misalignment: Causes, Consequences, and Containment in LLMs

Erum Mushtaq, Anil Ramakrishna, Satyapriya Krishna, Sattvik Sahai, Prasoon Goyal, Kai-Wei Chang, Tao Zhang, Rahul Gupta

机构 * University of Southern California(南加州大学) Amazon AGI(亚马逊人工智能实验室)

专题命中 AI治理与伦理 :alignment(abstract);safety(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05901 2025-11-14 cs.CL cs.AI 73%

Retrieval-Augmented Generation in Medicine: A Scoping Review of Technical Implementations, Clinical Applications, and Ethical Considerations

Rui Yang, Matthew Yu Heng Wong, Huitao Li, Xin Li, Wentao Zhu, Jingchi Liao, Kunyu Yu, Jonathan Chong Kai Liew, Weihao Xuan, Yingjian Chen, Yuhe Ke, Jasmine Chiat Ling Ong, Douglas Teodoro, Chuan Hong, Daniel Shi Wei Ting, Nan Liu

专题命中 AI治理与伦理 :safety(abstract);trustworthy(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23994 2025-11-10 cs.CL cs.AI 73%

Policy-as-Prompt: Turning AI Governance Rules into Guardrails for AI Agents

Gauri Kholkar, Ratinder Ahuja

机构 * Pure Storage

专题命中 AI治理与伦理 :safety(abstract);AI safety(abstract);分类 cs.CL、cs.AI

Comments Accepted at 3rd Regulatable ML Workshop at NEURIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏