arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 3248 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全训练 3248 篇

2607.21993 2026-07-27 cs.GT 新提交 82%

Three-Body Alignment: Aligning Chess Agent with Human Reasoning through Reranked Rationale

三体对齐:通过重新排序的理由将国际象棋智能体与人类推理对齐

Jaymari Chua, Chen Wang, Liming Zhu, Lina Yao

专题命中 安全训练 :alignment(title,abstract);safety(abstract)

AI总结 研究如何通过国际象棋中的“三体对齐”,分析人类专家、引擎辅助评论员和大语言模型产生的理由间语义差异,构建多源理由数据集,进行实证分析与实验,开发数据集结构并开源,以改善智能体与人类对齐及决策的可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18127 2026-07-20 cs.LG cs.AI cs.CL 82%

Safe-SAIL: Towards a Fine-grained Safety Landscape of Large Language Models via Sparse Autoencoder Interpretation Framework

Safe-SAIL: 通过稀疏自编码解释框架构建大语言模型的细粒度安全景观

Jiaqi Weng, Han Zheng, Hanyu Zhang, Ej Zhou, Qinqin He, Jialing Tao, Hui Xue, Zhixuan Chu, Xiting Wang

机构 * Alibaba Group(阿里巴巴集团) The State Key Laboratory of Blockchain and Data Security, Zhejiang University(浙江大学区块链与数据安全国家重点实验室) Language Technology Lab, University of Cambridge(剑桥大学语言技术实验室) Renmin University of China(中国人民大学)

专题命中 安全训练 :safety(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出Safe-SAIL框架,通过稀疏自编码解释方法高效识别安全领域特征,减少解释成本55%,并系统评估1758个安全相关特征,揭示风险特征识别和安全关键实体编码机制。

Journal ref Findings of the Association for Computational Linguistics: ACL 2026, pages 18916-18935 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15081 2026-07-17 cs.CR 新提交 82%

DataShield: Uncovering Risky Fine-Tuning Data Across LLMs Through Consensus Subspace Alignment

DataShield:通过共识子空间对齐揭示跨语言模型的风险微调数据

Zefeng Wu, Weiwei Qi, Jielong Chen, Tianhang Zheng, Di Hong, Chaochao Lu, Liang He, Zhan Qin, Kui Ren

专题命中 安全训练 :alignment(title,abstract);safety(abstract)

AI总结 研究针对LLMs微调数据存在安全风险及现有方法局限性,提出DataShield框架,通过共识子空间对齐识别风险微调样本和响应段,经实验对比,该方法能有效降低误识率,还保留下游效用并避免特定模型风险计算。

Comments 24 pages, 12 figures, 19 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14544 2026-07-17 cs.CV 新提交 82%

3D Geometric Tooth Alignment Planning via Deep Reinforcement Learning

通过深度强化学习进行3D几何牙齿对齐规划

Yong Li, Jianwen Lou, Jiayue Ma, Yao-Xiang Ding, Youyi Zheng, Haihua Zhu

机构 * School of Software Technology, Zhejiang University(浙江大学软件学院) State Key Laboratory of CAD&CG, Zhejiang University(浙江大学CAD&CG国家重点实验室) Stomatology Hospital, Zhejiang University School of Medicine(浙江大学医学院附属口腔医院)

专题命中 安全训练 :alignment(title,abstract);safety(abstract)

AI总结 研究针对3D几何牙齿对齐规划问题,提出基于深度强化学习的框架。利用马尔可夫决策过程,结合三项创新:基于Transformer的智能体、动态掩码方案和两阶段课程学习策略,在数据集上评估,该方法在路径安全和效率上优于基线,提供自动化正畸对齐规划方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24051 2026-06-24 cs.CV 新提交 82%

DriveStack-VLA: Render-Teacher Alignment for BEV-Based DeepStack Vision-Language-Action Model

DriveStack-VLA: 基于BEV的DeepStack视觉-语言-动作模型的渲染-教师对齐

Jingke Wang, Zhenru Zhao, Shuangming Lei, Hao Su, Yuehao Huang, Yijia Xie, Kai Tang, Guanglin Xu, AiXue Ye, Yukai Ma, Yong Liu

机构 * Zhejiang University(浙江大学) The 2012 Labs, Huawei(华为2012实验室)

专题命中 安全训练 :alignment(title,abstract);safety(abstract)

AI总结 提出DriveStack-VLA框架,通过DeepStack连接注入BEV表示并采用渲染-教师对齐增强空间感知,引入自批评模块优化轨迹选择,在多个驾驶基准上取得领先性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18632 2026-06-18 cs.RO 新提交 82%

ROBOSHACKLES: A Safety Dataset for Human-Injury Prevention in Embodied Foundation Models

ROBOSHACKLES: 面向具身基础模型中人体伤害预防的安全数据集

Zhuowen Yin, Chongyang Liu, Wenzhang Yang, Renjue Li, Yinxing Xue

机构 * Institute of Al for Industries, Chinese Academy of Sciences(工业人工智能研究所,中国科学院) University of Science and Technology of China(中国科学技术大学)

专题命中 安全训练 :safety(title,abstract);alignment(abstract)

AI总结 为解决机器人伤害人类数据难以安全收集的问题,提出基于真实观测的安全数据构建流水线,生成包含1万条视频的ROBOSHACKLES数据集,涵盖直接和间接伤害类别,评估发现现有模型在安全关键场景下100%产生不安全动作。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16349 2026-06-17 cs.CR 新提交 82%

From Refusal Geometry to Safety Geometry: Harmfulness--Refusal Coupling under Dynamic Adversarial Fine-Tuning

从拒绝几何到安全几何:动态对抗微调下的有害性-拒绝耦合

Wenhao Lan, Shan Li, Xinhua Lai, Meiqi Wu, Junbin Yang, Haihua Shen

专题命中 安全训练 :safety(title,abstract);alignment(abstract)

AI总结 研究通过双安全几何协议测量语言模型在对抗微调中有害性与拒绝机制的耦合程度,发现R2D2训练早期高耦合带来强鲁棒性但牺牲实用性,后期低耦合恢复部分实用性但攻击成功率回升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21609 2026-05-22 cs.CL cs.AI cs.CY 82%

CR4T: Rewrite-Based Guardrails for Adolescent LLM Safety

CR4T:基于重写的青少年LLM安全机制

Heajun An, Qi Zhang, Vedanth Achanta, Jin-Hee Cho

机构 * Virginia Tech(弗吉尼亚理工大学)

专题命中 安全训练 :safety(title,abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 本文提出CR4T框架,通过选择性响应重构替代拒绝导向的安全机制,以更符合青少年发展需求的方式提升LLM的安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21496 2026-05-22 cs.LG cs.AI cs.CL 82%

HealthCraft: A Reinforcement Learning Safety Environment for Emergency Medicine

HealthCraft: 一种用于急救医学的强化学习安全环境

Brandon Dent

机构 * GOATnote Inc.(GOATnote公司)

专题命中 安全训练 :safety(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出HealthCraft,首个公开的强化学习环境,用于在真实急救医学条件下奖励轨迹级安全,通过FHIR R4世界状态、24个MCP工具和双层评估标准,评估模型在急救任务中的安全性和性能,揭示了模型在多步骤工作流中的安全失败问题。

Comments 16 pages, 5 figures, 6 tables. Code, task suite, and Docker bundle: https://github.com/GOATnote-Inc/healthcraft

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10653 2026-05-12 cs.RO 82%

Embodied AI in Action: Insights from SAE World Congress 2026 on Safety, Trust, Robotics, and Real-World Deployment

具身人工智能在行动:来自2026年SAE世界大会关于安全、信任、机器人和现实世界部署的洞察

Jan-Mou Li, Paul Schmitt, Wei Tong, Majed Mohammed, Akshay Chalana, Arpan Kusari, Edward Griffor

专题命中 安全训练 :safety(title,abstract);trustworthy(abstract)

AI总结 本文探讨了具身人工智能在现实系统中的应用挑战,强调需通过系统工程、生命周期管理与标准制定来确保安全可靠部署。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08416 2026-05-12 cs.AI cs.CY cs.LG 82%

Alignment as Jurisprudence

对齐作为法学

Nicholas Caputo

机构 * Oxford Martin AI Governance Initiative(牛津马丁人工智能治理研究所)

专题命中 安全训练 :alignment(title,abstract);分类 cs.AI、cs.CY、cs.LG

AI总结 本文探讨法学与对齐的相似结构,通过法律解释主义和宪法AI等方法,揭示两者在规则与案例互动中的价值,并指出AI如何改进法律理解和应用。

Journal ref 27 Yale Journal of Law and Technology 390 (Sept. 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07630 2026-05-11 cs.CL cs.AI cs.LG 82%

Safe, or Simply Incapable? Rethinking Safety Evaluation for Phone-Use Agents

安全,还是仅仅无能?重新思考手机使用代理的安全性评估

Zhengyang Tang, Yi Zhang, Chenxin Li, Xin Lai, Pengyuan Lyu, Yiduo Guo, Weinong Wang, Junyi Li, Yang Ding, Huawen Shen, Zhengyao Fang, Xingran Zhou, Liang Wu, Fei Tang, Sunqi Fan, Shangpin Peng, Zheng Ruan, Anran Zhang, Benyou Wang, Chengquan Zhang, Han Hu

机构 * Tencent Hunyuan(腾讯文言) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Tsinghua University(清华大学)

专题命中 安全训练 :safety(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出PhoneSafety基准,通过700个关键安全时刻评估手机使用代理的安全性,发现更强的通用能力不等于更安全的选择,且无能行为更像是能力信号而非安全信号。

Comments work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18280 2026-05-04 cs.LG cs.AI cs.CL 82%

Detection Is Cheap, Routing Is Learned: Why Refusal-Based Alignment Evaluation Fails

检测成本低,路由是学习的:为何基于拒绝的对齐评估失败

Gregory N. Frank

机构 * Independent Researcher(独立研究者)

专题命中 安全训练 :alignment(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究指出现有对齐评估忽视路由层,通过政治审查实验发现检测准确率不具诊断性,路由机制因模型和实验室而异,拒绝不再是主要审查机制,需采用检测-路由-生成三阶段框架。

Comments Code and data: https://github.com/gregfrank/routing-is-learned

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00081 2026-05-04 cs.CR cs.LO 82%

Alignment Contracts for Agentic Security Systems

代理安全系统的对齐契约

Isaac David, Marco Guarnieri, Arthur Gervais

专题命中 安全训练 :alignment(title,abstract);safety(abstract)

AI总结 本文提出对齐契约框架,用于规范和强制执行可观测效果的行为约束,通过有限轨迹语义和模块化合同工程规则,确保安全系统的边界控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14602 2026-03-24 cs.CL cs.AI cs.LG 82%

PA3: Policy-Aware Agent Alignment through Chain-of-Thought

PA3: 通过链式推理实现政策感知的智能体对齐

Shubhashis Roy Dipta, Daniel Bis, Kun Zhou, Lichao Wang, Benjamin Z. Yao, Chenlei Guo, Ruhi Sarikaya

机构 * University of Maryland, Baltimore County(马里兰大学巴尔的摩分校) Amazon Alexa AI(亚马逊Alexa AI)

专题命中 安全训练 :alignment(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出一种多阶段对齐方法,通过链式推理让模型在推理时回忆并应用相关业务政策,无需在上下文中包含完整政策,同时引入PolicyRecall奖励和hallucination惩罚,提升性能并减少字数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10588 2026-03-12 cs.AI cs.CL cs.LG 82%

Does LLM Alignment Really Need Diversity? An Empirical Study of Adapting RLVR Methods for Moral Reasoning

LLM对齐真的需要多样性吗?对道德推理适应RLVR方法的实证研究

Zhaowei Zhang, Xiaohan Liu, Xuekai Zhu, Junchao Huang, Ceyao Zhang, Zhiyuan Feng, Yaodong Yang, Xiaoyuan Yi, Xing Xie

机构 * Institute for Artificial Intelligence, Peking University(北京大学人工智能研究院) Microsoft Research(微软研究院) University of Michigan(密歇根大学) Shanghai Jiao Tong University(上海交通大学) CUHKSZ(香港中文大学(深圳)) THU(清华大学)

专题命中 安全训练 :alignment(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文通过实证研究发现,LLM对齐任务并不需要多样性算法,标准奖励最大化RLVR方法在道德推理中同样有效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04364 2026-03-05 cs.LG cs.AI cs.CL 82%

Dual-Modality Multi-Stage Adversarial Safety Training: Robustifying Multimodal Web Agents Against Cross-Modal Attacks

双模多阶段对抗安全训练:增强多模态网络代理对跨模态攻击的鲁棒性

Haoyu Liu, Dingcheng Li, Lukas Rutishauser, Zeyu Zheng

机构 * UC Berkeley, IEOR & BAIR(伯克利大学) Google(谷歌) Google Deepmind(谷歌DeepMind)

专题命中 安全训练 :safety(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 DMAST通过三阶段对抗训练提升多模态网络代理对跨模态攻击的鲁棒性,显著提高任务完成效率并优于现有防御方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01029 2026-03-03 cs.CV 82%

Vision-Language Feature Alignment for Road Anomaly Segmentation

视觉-语言特征对齐用于道路异常分割

Zhuolin He, Jiacheng Tang, Jian Pu, Xiangyang Xue

机构 * School of Computer Science, Fudan University(复旦大学计算机科学学院) Institute of Science and Technology for Brain-Inspired Intelligence, Fudan University(复旦大学脑启发智能科学与技术研究院)

专题命中 安全训练 :alignment(title,abstract);safety(abstract)

AI总结 VL-Anomaly通过结合视觉-语言模型的语义先验,提出了一种新的道路异常分割框架,有效提升异常检测的准确性和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.19054 2026-02-13 cs.CR 82%

Poly-Guard: Massive Multi-Domain Safety Policy-Grounded Guardrail Dataset

Poly-Guard: 大规模多领域安全政策导向的防护数据集

Mintong Kang, Zhaorun Chen, Chejian Xu, Jiawei Zhang, Chengquan Guo, Minzhou Pan, Ivan Revilla, Yu Sun, Bo Li

专题命中 安全训练 :safety(title,abstract);alignment(abstract)

AI总结 Poly-Guard是一个大规模多领域安全政策导向的防护数据集,旨在提升防护系统的安全性和领域适应性。

Comments NeurIPS 2025 Dataset & Benchmark

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04056 2026-02-05 eess.SY cs.RO cs.SY 82%

Modular Safety Guardrails Are Necessary for Foundation-Model-Enabled Robots in the Real World

模块化安全护栏是现实世界中由基础模型赋能的机器人所必需的

Joonkyung Kim, Wenxi Chen, Davood Soleymanzadeh, Yi Ding, Xiangbo Gao, Zhengzhong Tu, Ruqi Zhang, Fan Fei, Sushant Veer, Yiwei Lyu, Minghui Zheng, Yan Gu

机构 * Purdue University(普渡大学) Amazon(亚马逊公司) NVIDIA(英伟达公司)

专题命中 安全训练 :safety(title,abstract);alignment(abstract)

AI总结 本文提出模块化安全护栏以解决现实世界中由基础模型赋能的机器人在开放、长尾和随时间适应的环境中的安全挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17911 2026-01-27 cs.CR 82%

Prompt Injection Evaluations: Refusal Boundary Instability and Artifact-Dependent Compliance in GPT-4-Series Models

提示注入评估:GPT-4系列模型中的拒绝边界不稳定性与依赖于人工制品的合规性

Thomas Heverin

专题命中 安全训练 :prompt injection(title,abstract);safety(abstract)

AI总结 本研究发现GPT-4系列模型的拒绝行为受人工制品类型影响,存在拒绝边界不稳定性,单提示评估高估安全鲁棒性。

Comments 15 pages, 3 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21107 2025-12-25 cs.CL cs.AI cs.LG 82%

Semi-Supervised Learning for Large Language Models Safety and Content Moderation

大型语言模型安全性和内容审核的半监督学习

Eduard Stefan Dinuta, Iustin Sirbu, Traian Rebedea

机构 * National University of Science and Technology Politehnica Bucharest(波兰技术大学科学与技术国家大学)

专题命中 安全训练 :safety(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出利用半监督学习提升大型语言模型的安全性,通过结合标记和未标记数据以及任务特定增强技术,提高安全分类器的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02445 2025-12-03 cs.LG cs.AI cs.CL 82%

When Refusals Fail: Unstable Safety Mechanisms in Long-Context LLM Agents

当拒绝失效时:长上下文LLM代理中的不稳定安全机制

Tsimur Hadeliya, Mohammad Ali Jauhar, Nidhi Sakpal, Diogo Cruz

专题命中 安全训练 :safety(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究发现长上下文LLM代理在性能和拒绝率上存在不稳定安全问题,揭示了评估长多步骤任务代理安全性的挑战。

Comments 12 pages, 11 figures. Accepted at AAAI 2026 TrustAgent Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03283 2025-10-07 cs.LG cs.AI cs.CL cs.DC 82%

MACE: A Hybrid LLM Serving System with Colocated SLO-aware Continuous Retraining Alignment

Yufei Li, Yu Fu, Yue Dong, Cong Liu

专题命中 安全训练 :alignment(title,abstract);分类 cs.CL、cs.AI、cs.LG

Comments 14 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09224 2025-08-14 cs.CY cs.AI cs.CL 82%

From Hard Refusals to Safe-Completions: Toward Output-Centric Safety Training

Yuan Yuan, Tina Sriskandarajah, Anna-Luisa Brakman, Alec Helyar, Alex Beutel, Andrea Vallone, Saachi Jain

专题命中 安全训练 :safety(title,abstract);分类 cs.CL、cs.AI、cs.CY

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.08284 2025-07-14 cs.LG cs.AI cs.CL 82%

Lightweight Safety Guardrails via Synthetic Data and RL-guided Adversarial Training

Aleksei Ilin, Gor Matevosyan, Xueying Ma, Vladimir Eremin, Suhaa Dada, Muqun Li, Riyaaz Shaik, Haluk Noyan Tokgozoglu

机构 * Apple(苹果公司)

专题命中 安全训练 :safety(title,abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.00979 2025-07-02 cs.AI cs.CL cs.LG 82%

Enhancing LLM Agent Safety via Causal Influence Prompting

Dongyoon Hahm, Woogyeol Jin, June Suk Choi, Sungsoo Ahn, Kimin Lee

专题命中 安全训练 :safety(title,abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted at ACL 2025 Findings, Source code: https://github.com/HahmDY/causal_influence_prompting.git

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.01586 2024-10-07 cs.CL cs.AI cs.LG cs.MA 82%

TrustAgent: Towards Safe and Trustworthy LLM-based Agents

Wenyue Hua, Xianjun Yang, Mingyu Jin, Zelong Li, Wei Cheng, Ruixiang Tang, Yongfeng Zhang

专题命中 安全训练 :trustworthy(title);safety(abstract);分类 cs.CL、cs.AI、cs.LG

Comments In EMNLP 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.05699 2024-06-11 cs.CL cs.AI cs.CY 82%

Self-Alignment of Large Language Models via Monopolylogue-based Social Scene Simulation

Xianghe Pang, Shuo Tang, Rui Ye, Yuxin Xiong, Bolun Zhang, Yanfeng Wang, Siheng Chen

专题命中 安全训练 :alignment(title,abstract);分类 cs.CL、cs.AI、cs.CY

Comments 32 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.00858 2024-05-15 cs.LG cs.AI cs.CL 82%

Direct Alignment of Draft Model for Speculative Decoding with Chat-Fine-Tuned LLMs

Raghavv Goel, Mukul Gagrani, Wonseok Jeon, Junyoung Park, Mingu Lee, Christopher Lott

专题命中 安全训练 :alignment(title,abstract);分类 cs.CL、cs.AI、cs.LG

Comments 8 pages, 3 figures, Published at the ICLR 2024 Workshop on Understanding of Foundation Models (ME-FoMo)

详情

展开后加载摘要…

URL PDF HTML 收藏