arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 2719 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. AI治理与伦理 138 篇

2608.12368 2026-08-14 cs.AI 新提交 79%

Agreement Is Not Alignment: Divergent Moral Grounds in Human and LLM Ethical Judgments

一致性并非对齐:人类与大语言模型(LLM)伦理判断中的道德依据分歧

Octavian M. Machidon, Alina L. Machidon, Vojko Strahovnik, Mateja Centa Strahovnik, Jonas Miklavčič, Marko Robnik Šikonja

机构 * University of Ljubljana(卢布尔雅那大学) Faculty of Computer and Information Science(计算机与信息科学学院) Faculty of Theology(神学院) Faculty of Arts(艺术学院)

专题命中 AI治理与伦理 :alignment(title,abstract);分类 cs.AI

AI总结 该研究以ETHICS基准的500项道德判断条目为对象,发现LLM与人类的最终伦理判断常一致,但道德依据存在系统性分歧,表明一致性不等同于对齐性,仅靠标签评估易产生误导。

Comments 9 pages, 4 figures, 3 tables. Accepted and presented at the AI Transparency Conference (AITC 2026), Nuremberg, Germany, June 5-6, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07367 2026-08-10 cs.AI 新提交 79%

People Are Not Just Their Countries. Disentangling Social Determinants of LLM Value Alignment Across Europe

人不只是其所属国家:在欧洲范围内解耦大型语言模型(LLM)价值对齐的社会决定因素

Maria-Louisa Wightman, Guillaume Bied, Tijl De Bie

专题命中 AI治理与伦理 :alignment(title,abstract);分类 cs.AI

AI总结 本研究依托欧洲社会调查,发现LLMs与不同社会人口学群体的价值观对齐存在差异,国籍作为单独变量的解释力与全部社会人口学变量相当,国家与社会人口学因素在解释对齐模式上互补。

Comments Accepted at AIES 2026 (9th AAAI/ACM Conference on AI, Ethics, and Society)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26981 2026-07-30 cs.CL 新提交 79%

OptimismBench: Forecasting Bias and the Alignment Effect in Language Model Judgment

OptimismBench:语言模型判断中的偏差预测与对齐效应

Seonglae Cho, Adriano Koshiyama

机构 * Holistic AI(整体人工智能公司) University College London(伦敦大学学院)

专题命中 AI治理与伦理 :alignment(title,abstract);分类 cs.CL

AI总结 本研究推出OptimismBench基准,检测到多数LLM存在乐观方向偏差,且对齐会使模型概率产生偏差,下游流程会默认继承该偏差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15480 2026-07-20 cs.AI 新提交 79%

A Critical Analysis of Trustworthy AI Tools, Mark Frameworks, and the Implementation Chasms

对可信人工智能工具、标记框架及实施差距的批判性分析

Michael Papademas, Xenia Ziouvelou, Kostas Karpouzis, Vangelis Karkaletsis

机构 * Panteion University of Social and Political Sciences(潘泰翁社会与政治科学大学)

专题命中 AI治理与伦理 :trustworthy(title,abstract);分类 cs.AI

AI总结 研究对可信人工智能工具和标记框架进行批判性分析,利用经合组织数据集,通过实证映射等方法找出伦理重点等方面的不对称,发现当前存在的问题,建议扩大伦理目标、贯穿伦理于生命周期并促进多利益相关者参与,以推动人工智能治理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00334 2026-07-02 cs.AI 新提交 79%

Managed Autonomy at Runtime: Gear-Based Safety and Governance for Single- and Multi-Agent Cyber-Physical Systems

运行时管理自主性:基于档位的单/多智能体信息物理系统安全与治理

Srini Ramaswamy, Wang Miaosheng

机构 * DNRS.ai, USA

专题命中 AI治理与伦理 :safety(title,abstract);分类 cs.AI

AI总结 提出一种离散时间控制系统,通过五个执行档位和效用门控调度,在单智能体场景中证明单调稳定性、执行安全性和最终稳定,在多智能体CPS中结合治理状态实现分布式安全保证,在UR5机器人装配单元上达到99.6%异常检测率。

Comments to be submitted to a Journal, 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22528 2026-06-23 cs.AI 新提交 79%

Governance Decay: How Context Compaction Silently Erases Safety Constraints in Long-Horizon LLM Agents

治理衰减:上下文压缩如何悄然消除长周期LLM智能体中的安全约束

Shiyang Chen

机构 * Beijing Institute of Technology(北京理工大学)

专题命中 AI治理与伦理 :safety(title,abstract);分类 cs.AI

AI总结 研究发现LLM智能体的上下文压缩机制会无意中移除安全约束,导致违规行为;提出ConstraintRot基准和Constraint Pinning缓解方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21619 2026-06-23 cs.SE cs.LG cs.PL 新提交 79%

The Alignment Problem in Constrained Code Generation

约束代码生成中的对齐问题

Matteo Biagiola, Jahrim Gabriele Cesario, Luca Di Grazia, George Zakhour, Guido Salvaneschi

机构 * University of St. Gallen(圣加尔登大学) Università della Svizzera italiana (USI)(瑞士联邦理工学院)

专题命中 AI治理与伦理 :alignment(title,abstract);分类 cs.LG

AI总结 研究约束解码中约束器、语言模型与目标语言之间的对齐问题,发现约束器的不完整性会扭曲模型分布,导致功能正确性下降高达97%,并提出设计约束器的定量见解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17678 2026-06-17 cs.CV cs.AI 新提交 79%

See First, Answer Later: Visual Evidence Pre-Alignment via Sufficiency-Driven RL

先看后答:基于充分性驱动的强化学习实现视觉证据预对齐

Yilian Liu, Sicong Leng, Guoshun Nan, Junyi Zhu, Jiayu Huang, Minghao Sun, Xuancheng Zhu, Yisong Chen, Zexian Wei, Xiaofeng Tao

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Nanyang Technological University(南洋理工大学) China Telecom(中国电信)

专题命中 AI治理与伦理 :alignment(title,abstract);分类 cs.AI

AI总结 提出视觉证据预对齐(VEPA)方法,在预训练与后训练之间引入充分性驱动的GRPO优化,以增强多模态大模型对细粒度视觉证据的利用,显著提升视觉密集型任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14594 2026-06-15 cs.SE cs.AI 新提交 79%

Regulating the Machine Contributor: Governance and Policy Alignment in Open Source

调控机器贡献者:开源中的治理与政策对齐

Jassem Manita, Aziz Amari

机构 * Faculty of Sciences of Tunis (FST), University of Tunis El Manar(突尼斯科学学院(FST),突尼斯El Manar大学) National Institute of Applied Science and Technology (INSAT), University of Carthage(应用科学和技术国家研究所(INSAT),卡塔赫季大学)

专题命中 AI治理与伦理 :alignment(title,abstract);分类 cs.AI

AI总结 针对AI代理在开源中引发治理问题,通过比较六个组织的政策,提出六维分类法、政策成熟度评分,并映射代理事件,识别监管框架与政策间的缺口,勾勒分层框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16081 2026-08-18 cs.CV 新提交 78%

SafeGesture: Evaluating Fine-Grained Hand Gesture Understanding in Vision-Language Models through Scenario-Conditioned Safety Interpretation

SafeGesture:通过场景条件安全解释评估视觉语言模型的细粒度手势理解能力

Taegang Kim, Saleh Afroogh, Junfeng Jiao

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) Urban Information Lab, The University of Texas at Austin(德克萨斯大学奥斯汀分校城市信息实验室)

专题命中 AI治理与伦理 :safety(title,abstract)

AI总结 本文提出SafeGesture基准,评估5款视觉语言模型的细粒度手势安全理解能力,发现模型存在感知与推理脱节,瓶颈为场景条件安全推理而非手势识别。

Comments 14 pages, 22 tables, 2 figures. Code and benchmark resources available at https://github.com/The-Responsible-AI-Initiative/SafeGesture

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04249 2026-07-07 cs.CV 新提交 78%

Beyond Random Sampling: Distribution-Aware Alignment for Semi-Supervised Medical Image Segmentation

超越随机采样:用于半监督医学图像分割的分布感知对齐

Weihao Yan, Yeqiang Qian, Yi Dong, Ming Yang

机构 * School of Automation and Intelligent Sensing, Shanghai Jiao Tong University(上海交通大学自动化与智能感知学院) Department of Ultrasound, Xinhua Hospital Affiliated to Shanghai Jiao Tong University School of Medicine(上海交通大学医学院附属新华医院超声科)

专题命中 AI治理与伦理 :alignment(title,abstract)

AI总结 研究针对半监督医学图像分割中随机采样策略在低数据量时表征偏差的问题,提出基于分布对齐的高效框架,用分布感知样本选择策略和记忆引导复制粘贴模块,提升分割性能。

Comments 19 pages, 5 figures, accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25497 2026-06-25 cs.RO 新提交 78%

SAGE-Nav: Leveraging LLM Planning and Alignment Fusion for Hierarchical Scene Graph-Guided Navigation

SAGE-Nav:利用LLM规划与对齐融合的分层场景图引导导航

Hao Su, Yuehao Huang, Yukai Ma, Yong Liu, Jiajun Lv

机构 * Zhejiang University(浙江大学)

专题命中 AI治理与伦理 :alignment(title,abstract)

AI总结 提出SAGE-Nav分层框架,结合大语言模型与动态场景图,通过解耦全局语义规划与高频反应控制,实现高效目标导航,在i-THOR和RoboTHOR中达到最优性能。

Comments Accepted by IROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16710 2026-08-18 cs.LG 新提交 77%

The Ethical Decision Head: Operationalizing Normative Ethics in Autonomous Vehicles via Reinforcement Learning from Human Feedback

伦理决策头:基于人类反馈的强化学习在自动驾驶中实现规范伦理

Thomas Mbrice, Ammar Ali, Sami Mian, Khai Hern Low, Eric Chen, Arshia Aghajani, Wolf Schäfer, Amin Shirangi

机构 * Stony Brook University(石溪大学)

专题命中 AI治理与伦理 :RLHF(abstract,abstract_cn);safety(abstract);分类 cs.LG

AI总结 本文提出伦理决策头(EDH)框架,结合PPO与人类偏好奖励模型,在CARLA仿真中训练自动驾驶智能体,发现人类对自动驾驶伦理的理论规定与实践奖励存在差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14565 2026-08-18 cs.AI 新提交 77%

Position: AI Lock-In Is in Progress, and We Must Be Prepared

立场:AI锁定正在发生,我们必须做好准备

Jaeho Kim, Seokhyun Lee, Jieun Lee, Changhee Lee

专题命中 AI治理与伦理 :alignment(abstract);safety(abstract);AI safety(abstract);分类 cs.AI

AI总结 该研究指出AI锁定是被低估的AI安全风险,分析其在个体、社会、国家层面的形成与升级机制,提出需提前应对以维护自主权与国家安全。

Comments ICML 2026 Position Track Spotlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15507 2026-06-16 cs.AI 新提交 77%

Frame-Conditioned Moral Computation in LLaMA 3.1-8B-Instruct: A Mechanistic Interpretability Audit of Ethical Reasoning

LLaMA 3.1-8B-Instruct中的框架条件化道德计算:伦理推理的机械可解释性审计

Ali Dasdan, Manan Shah, W. Russell Neuman, Chad Coleman, Kund Meghani, Safinah Ali

机构 * KD Consulting, CA, USA(KD咨询公司,美国加利福尼亚州) New York University, NY, USA(纽约大学,美国纽约州)

专题命中 AI治理与伦理 :RLHF(abstract,abstract_cn);alignment(abstract);分类 cs.AI

AI总结 通过机械可解释性平台分析LLaMA 3.1-8B-Instruct在54个道德提示上的内部计算,发现情境锚定效应:领域特定表示主导激活列表顶部,模型道德能力恒定但显著性高度依赖于提示选择的解释框架。

Comments 47 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07802 2026-06-09 cs.CY cs.AI 新提交 74%

Memetic Capture: A Pluralistic Policy Framework for Governing AI-Driven Cultural Disempowerment

模因捕获:治理AI驱动的文化去权能的多元政策框架

Subramanyam Sahoo

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 AI治理与伦理 :alignment(abstract,comments);safety(abstract);分类 cs.AI、cs.CY

AI总结 提出“模因捕获”概念,指AI通过文化影响削弱人类自主性,并构建四层文化多元治理框架(CPGF),强调多元主义是结构性必需。

Comments Paper accepted in Pluralistic Alignment Workshop at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03584 2026-08-05 cs.AI cs.CE cs.ET 新提交 74%

Policy Fragmentation or Institutional Alignment? Institutional Governance of AI in Universities and Business Schools

政策碎片化还是制度协同?高校与商学院的AI制度治理

Lydia Manikonda, Dominique Outlaw

专题命中 AI治理与伦理 :alignment(title);分类 cs.AI

AI总结 本研究分析美国34个州高校AI政策,发现校级侧重数据安全与风险、商学院侧重教学应用,多数商学院无独立AI政策致错位,提出需协同指南兼顾学科目标与劳动力需求。

Comments Our insights suggest that policy guidelines should be aligned with broader institutional policies while addressing discipline-specific learning objectives and evolving workforce demands

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05178 2026-08-07 cs.CY cs.AI 新提交 73%

Who Gets Access? Global Region and Academic Status Bias in AI-Generated Academic Gatekeeping Scenarios

谁能获得权限?AI生成的学术守门场景中的全球区域与学术地位偏差

Nouar AlDahoul, Hezerul Abdul Karim, Myles Joshua Toledo Tan

专题命中 AI治理与伦理 :alignment(abstract);safety(abstract);分类 cs.AI、cs.CY

AI总结 该研究构建LLM模拟学术守门场景,发现LLM存在学术地位偏差,且模型架构导致区域偏好差异,凸显需审计AI系统的公平性与价值对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25648 2026-07-29 cs.CY cs.AI 新提交 73%

Why Public Service AI Governance Frameworks Risk Failing in the Age of General-Purpose AI: Lessons from Policing

为何公共服务人工智能治理框架在通用人工智能时代面临失败风险:来自警务领域的教训

Sam Relins, Daniel Birks

专题命中 AI治理与伦理 :safety(abstract);AI safety(abstract);分类 cs.AI、cs.CY

AI总结 研究公共服务中通用人工智能治理框架面临的风险,以警务为例,指出其特性破坏安全条件,常用缓解措施失效,建议明确分类、技术简约、暂停部署并建立国家安全基础设施。

Comments Preprint; submitted for peer review

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02244 2026-08-04 cs.DC cs.SY eess.SY 新提交 71%

Efficiency and Cost Alignment in Batched LLM Serving via Resource-Fair Scheduling

通过资源公平调度实现批量大语言模型(LLM)服务的效率与成本对齐

Dayi Yao, Zijie Zhou

专题命中 AI治理与伦理 :alignment(title)

AI总结 本文针对批量LLM服务中异构请求导致的资源分配低效问题,提出ISJL算法,实现高吞吐量的同时对齐最大驱动批次成本与token计量收入,达到3/4的竞争比下界,平衡了FCFS与LJF的优缺点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03532 2026-08-05 cs.CL 新提交 70%

Cross-Lingual Bias in Large Language Models: A Comparative Analysis of English and Swahili

大语言模型中的跨语言偏见:英语与斯瓦希里语的对比分析

Ruolei Zhang, Teddy Njuguna, Yue Feng

专题命中 AI治理与伦理 :alignment(abstract);safety(abstract);分类 cs.CL

AI总结 本研究通过对比GPT-5.2与Gemini 2.5 Flash在英语和斯瓦希里语上的9类人口统计偏见表现,发现偏见会转变而非转移,仅英语偏见审计无法覆盖多语言部署需求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18459 2026-07-22 cs.CY 新提交 70%

Intelligent Cause Prioritisation? An Analysis of AI Policy Priorities and Governance in Africa

智能因果优先级排序?非洲人工智能政策优先级与治理分析

Osaremen Iluobe, Kisso Selvan

专题命中 AI治理与伦理 :safety(abstract);AI safety(abstract);分类 cs.CY

AI总结 该研究聚焦非洲人工智能政策,通过分析相关资料发现,非洲各国政府急于借人工智能加速经济转型,虽重视其机遇,却相对忽视人工智能安全。

Comments 21 pages, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30666 2026-07-01 cs.CY 新提交 70%

Reframing AGI Confrontation with Off Earth Autonomy

重构与地外自主性的AGI对抗

Alexey Potapov

专题命中 AI治理与伦理 :alignment(abstract);safety(abstract);分类 cs.CY

AI总结 本文质疑AI安全叙事中关于强大智能体必然寻求权力并与人类对抗的结论,提出存在地外自主性路径时,早期合作可取代对抗,并通过决策理论模型分析激励转变及其治理启示。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30661 2026-07-01 cs.CY 新提交 70%

Understanding Censorship in Large Language Models: From Mechanisms to Governance

理解大型语言模型中的审查:从机制到治理

Quanyan Zhu

专题命中 AI治理与伦理 :alignment(abstract);safety(abstract);分类 cs.CY

AI总结 本文从社会技术视角审视LLM审查,涵盖数据、对齐、政策、推理时审核及法规,分析其表现形式、测量挑战与治理需求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11251 2026-08-13 cs.CY cs.AI cs.LG 新提交 67%

Variable Selection in the Context of AI Fairness

AI公平性语境下的变量选择

Ivan Luciano Danesi, Chiara Frigerio, Fabio Maccaferri, Giorgio Alessandro Motta, Pietro Zecca

专题命中 AI治理与伦理 :trustworthy(abstract);分类 cs.AI、cs.CY、cs.LG

AI总结 本文针对AI公平性语境下的变量选择问题,提出将数学方法与伦理、社会意识融合的跨学科方案,主张保留所有潜在相关变量以减少隐含偏差,助力AI系统符合欧盟AI法案要求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06112 2026-08-07 cs.AI cs.CL cs.LG cs.MA 新提交 67%

From Siloed Algorithms to Compliance-First Agentic Platforms: A Multi-Layered Architecture for Hospital AI Systems

从孤立算法到合规优先的智能体平台:面向医院AI系统的多层架构

Manideep Dhar, Ritwik Singh, Sharat Chandra Kumar Manikonda

专题命中 AI治理与伦理 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对医院AI部署孤立、规模化难的问题,提出含智能体编排、合规策略、隐私保护数据层的多层架构,通过原型验证可减少任务耗时与文档工作量,为医院AI平台建设提供实用蓝图。

Comments Peer-reviewed published article

Journal ref IJISRT, 11-2026(5), IJISRT26MAY1651

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28934 2026-08-03 cs.CL cs.AI cs.CY 新提交 67%

FairFund-Bench: Evaluating Distributive Bias in LLM Resource Allocation

FairFund-Bench:评估大语言模型资源分配中的分配偏差

Martin Lukk

机构 * University of Toronto(多伦多大学)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 FairFund-Bench基准通过调整审计格式等特征,发现LLM资源分配的偏差受审计类型影响,且因果框架效应强于人口统计效应,可用于评估LLM的分配偏差。

Comments 19 pages, 7 figures. Code and data: https://github.com/martinlukk/fairfund-bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07359 2026-07-09 cs.CR 新提交 67%

The AI Resilience Gap: Bringing Artificial Intelligence Inside the Operational Resilience Perimeter

人工智能弹性差距:将人工智能纳入运营弹性范围

Jonathan Shelby

专题命中 AI治理与伦理 :safety(abstract);trustworthy(abstract)

AI总结 研究人工智能在受监管公司应用中运营弹性不足问题,提出人工智能弹性框架,通过依赖映射等方法将人工智能依赖纳入运营弹性范围,弥补监管逻辑差距,为相关人员提供可操作路径。

Comments 11 pages, 2 Figures, 4 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07612 2026-06-09 cs.CY cs.AI cs.LG 新提交 67%

Position: Anthropomorphic Misalignment Research Needs Stronger Evidence

立场:拟人化错位研究需要更强证据

Vansh Gupta, Peter Nutter, Samuel Stante, Andreas Krause, Florian Tramèr, Lukas Fluri, Xin Chen, Anna Hedström

机构 * University of Cambridge(剑桥大学)

专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI、cs.CY、cs.LG

AI总结 本文指出拟人化错位研究(AMR)在概念模糊、数据不鲁棒、实验设计不足等问题上存在证据薄弱,提出证据层级框架和诊断清单以提升方法论严谨性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16893 2026-08-19 cs.CY cs.AI 新提交 62%

A Framework for Using and Evaluating LLMs as Surrogate Experts in Security Surveys: Reliability, Bias, and Implications

在安全调查中使用和评估大语言模型(LLM)作为代理专家的框架:可靠性、偏差及启示

Despoina Giarimpampa, Roland Meier, Tegawendé F. Bissyandé, Vincent Lenders, Jacques Klein

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI、cs.CY

AI总结 本研究提出了评估LLM作为安全调查代理专家的框架,发现LLM虽内部一致但与专家响应存在系统性偏差,可用于试点和假设生成但不能替代专家征询。

详情

展开后加载摘要…

URL PDF HTML 收藏