arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-06-05 至 2026-06-05 共收录 11 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全训练 11 篇

2604.07709 2026-06-05 cs.AI cs.CL cs.CY cs.LG 88%

IatroBench: Pre-Registered Evidence of Iatrogenic Harm from AI Safety Measures

IatroBench: AI安全措施中意外伤害的预注册证据

David Gringras

机构 * Harvard T.H. Chan School of Public Health(哈佛大学T.H. 洪学校公共卫生学院)

专题命中 安全训练 :safety(title,abstract);AI safety(title);分类 cs.CL、cs.AI、cs.CY

AI总结 该研究通过IatroBench评估了AI安全措施在医疗决策中的意外伤害风险,发现不同模型在身份相关性上的隐瞒行为存在显著差异,尤其在高度安全训练的模型中表现更明显。

Comments 30 pages, 3 figures, 11 tables. Pre-registered on OSF (DOI: 10.17605/OSF.IO/G6VMZ). Code and data: https://github.com/davidgringras/iatrobench. v2: Fix bibliography entries (add arXiv IDs, published venues); correct p-value typo in Limitations section; add AI Assistance Statement v3: Correct Figure 1 (decoupling scatter accidentally reverted to earlier draft in v2)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05290 2026-06-05 cs.CV cs.AI cs.MM 84%

Do Models Share Safety Representations? Cross-Model Steering for Safe Visual Generation

模型是否共享安全表示?面向安全视觉生成的跨模型引导

Tobia Poppi, Silvia Cappelletti, Sara Sarto, Florian Schiffers, Garin Kessler, Marcella Cornia, Lorenzo Baraldi, Rita Cucchiara

机构 * University of Modena and Reggio Emilia(摩德纳和雷吉奥艾米利亚大学) University of Pisa(比萨大学) Amazon Prime Video(亚马逊prime视频)

专题命中 安全训练 :safety(title,abstract);alignment(abstract);分类 cs.AI

AI总结 本文提出首个跨模型安全引导框架,通过源语言模型估计安全方向并迁移至目标生成器,无需目标侧不安全数据即可实现安全控制,且不牺牲生成质量。

Comments Project page: https://aimagelab.github.io/cross-model-safety-representations/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05523 2026-06-05 cs.CL 83%

CHASE: Adversarial Red-Blue Teaming for Improving LLM Safety using Reinforcement Learning

CHASE:利用强化学习进行对抗性红蓝队训练以提高LLM安全性

Rahul Markasserithodi, Aditya Joshi, Yuekang Li, Ishmanbir Singh, Chris Yoo, Alan Niu

机构 * University of New South Wales(新南威尔士大学)

专题命中 安全训练 :safety(title,abstract);alignment(abstract);分类 cs.CL

AI总结 提出CHASE框架,通过红蓝队协同进化(红队使用GRPO生成对抗性改写,蓝队使用两阶段GRPO+拒绝采样SFT进行防御),在保持良性提示零误拒的同时将攻击成功率降低43.2%。

Comments Under Review at ARR

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05679 2026-06-05 cs.DB cs.AI 79%

Data Flow Control: Data Safety Policies for AI Agents

数据流控制:AI 智能体的数据安全策略

Charlie Summers, Eugene Wu

机构 * Columbia University(哥伦比亚大学)

专题命中 安全训练 :safety(title,abstract);分类 cs.AI

AI总结 提出数据流控制框架,通过声明式策略和可移植查询重写层 Passant,在 DBMS 中强制执行元组级数据安全策略,实现接近零开销。

Comments 15 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05748 2026-06-05 cs.MM cs.AI cs.CL 73%

UNIVID: Unified Vision-Language Model for Video Moderation

UNIVID:用于视频审核的统一视觉语言模型

Kejuan Yang, Yizhuo Zhang, Mingyuan Du, Yue Zhang, Dixin Zheng, Kaili Zhao, Yang Xiao, Hanzhong Liang, Kenan Xiao

机构 * Bytedance(字节跳动)

专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI

AI总结 提出UNIVID统一视觉语言模型,通过生成可解释的策略感知字幕,实现端到端视频审核,减少违规泄露42.7%和过度审核率37.0%。

Comments 7 pages, 3 figures. Accepted to ACL 2026 Industry Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19327 2026-06-05 cs.LG cs.AI 62%

Soft Sequence Policy Optimization

软序列策略优化

Svetlana Glazyrina, Maksim Kryzhanovskiy, Roman Ischenko

机构 * Lomonosov Moscow State University(罗蒙诺索夫莫斯科国立大学) Institute for Artificial Intelligence(人工智能研究所)

专题命中 安全训练 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文提出软序列策略优化方法,通过引入软门控函数改进序列级重要性权重,提升大语言模型对齐任务的训练稳定性与性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05805 2026-06-05 cs.AI 57%

From Risk Classification to Action Plan Remediation: A Guardrail Feedback Driven Framework for LLM Agents

从风险分类到行动方案修复:一种基于护栏反馈驱动的LLM代理框架

Yuhao Sun, Jiacheng Zhang, Shaanan Cohney, Zhexin Zhang, Feng Liu, Xingliang Yuan

机构 * The University of Melbourne(墨尔本大学) Tsinghua University(清华大学)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 提出TRIAD框架,通过护栏生成的言语反馈引导代理在规划步骤中保持良性目标,实现安全与效用的最佳平衡。

Comments 32 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05660 2026-06-05 cs.RO cs.AI 57%

Safe Embodied AI for Long-horizon Tasks: A Cross-layer Analysis of Robotic Manipulation

面向长时域任务的安全具身AI:机器人操作跨层分析

Dabin Kim, Daemin Park, Sangyub Lee, Jinsik Kim, Yeongtak Oh, Jongho Shin, Sungroh Yoon

机构 * UNIST InnoCORE AI-Space Solar Initiative(UNIST创新核心人工智能空间太阳能计划) Ulsan National Institute of Science and Technology (UNIST)(乌山国立科学技术研究院) Automation and Systems Research Institute(自动化与系统研究所) Department of Electrical and Computer Engineering(电气与计算机工程系) Interdisciplinary Program in Artificial Intelligence(人工智能跨学科项目) LG Electronics(LG电子)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 本文从具身AI视角,系统综述长时域机器人操作中的安全问题,按干预时机(规划时、策略时、执行时)组织文献,分析证据强度,并指出当前安全保证的不足与未来方向。

Comments 63 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05396 2026-06-05 cs.CR cs.AI cs.SE 57%

Willing but Unable: Separating Refusal from Capability in Code LLMs via Abliteration

有意但无力:通过消融分离代码大语言模型中的拒绝与能力

Cristina Carleo, Pietro Liguori, Naghmeh Ivaki, Domenico Cotroneo

机构 * University of Naples Federico II(那不勒斯费德里科二世大学) University of Coimbra(科英布拉大学) University of North Carolina at Charlotte(北卡罗来纳州夏洛特大学)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 本文通过消融技术(abliteration)对代码LLM进行低秩权重编辑,以消除其对安全注入提示的拒绝行为,从而分离拒绝意愿与代码生成能力,实验表明消融后拒绝率降至零而语法有效性保持93%以上,但注入率仍受模型容量限制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06244 2026-06-05 cs.CR 50%

Steering LLM Viewpoints through Fabricated Evidence Injection

通过捏造证据注入操控LLM观点

Xi Yang, Chang Liu, Zhenglin Huang, Haoran Li, Weiming Zhang, Jian Weng, Yangqiu Song

专题命中 安全训练 :safety(abstract)

AI总结 提出Ghostwriter两阶段攻击框架,通过注入带有可信标记的捏造证据,利用LLM对外部上下文的盲目信任来操控其观点,并探索防御策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23497 2026-06-05 cs.CV 50%

VOLD: Reasoning Transfer from LLMs to Vision-Language Models via On-Policy Distillation

VOLD:通过在线蒸馏将LLM推理能力转移到视觉语言模型

Walid Bousselham, Hilde Kuehne, Cordelia Schmid

机构 * Tuebingen AI Center(图宾根人工智能中心) University of Tuebingen(图宾根大学) MIT-IBM Watson AI Lab(MIT-IBM沃森人工智能实验室) Inria, École Normale Supérieure, CNRS, PSL Research University(法国国家科学研究院、巴黎-萨克勒大学、École Normale Supérieure、PSL研究大学)

专题命中 安全训练 :alignment(abstract)

AI总结 本文提出VOLD框架,通过在线蒸馏将文本模型的推理能力转移到视觉语言模型,利用组相对策略优化与在线蒸馏结合,提升推理性能,并验证了冷启动对齐在在线训练中的重要性。

Comments www.walidbousselham.com/VOLD/

详情

展开后加载摘要…

URL PDF HTML 收藏