SafetyAnalyst: Interpretable, Transparent, and Steerable Safety Moderation for AI Behavior
专题命中 安全训练 :safety(title,abstract);AI safety(abstract);分类 cs.CL、cs.CY
Comments Accepted to ICML 2025
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
专题命中 安全训练 :safety(title,abstract);AI safety(abstract);分类 cs.CL、cs.CY
Comments Accepted to ICML 2025
机构 * Guangdong Provincial Key Laboratory of Brain-Inspired Intelligent Computation, Department of CSE, SUSTech(脑启发智能计算广东省重点实验室,计算机科学与工程系,华南理工大学) ; Department of CSE, HKUST(计算机科学与工程系,香港科技大学) ; Department of CSE, PolyU(计算机科学与工程系,PolyU) ; Department of CSE, SUSTech(计算机科学与工程系,华南理工大学) ; Huawei Technologies CO.(华为技术有限公司) ; College of Computing(计算学院)
专题命中 安全训练 :safety(title,abstract);alignment(abstract);分类 cs.AI、cs.LG
Comments ICML 2025 Camera Ready
专题命中 安全训练 :safety(title,abstract);alignment(abstract);分类 cs.AI、cs.CY
专题命中 安全训练 :safety(title,abstract);alignment(abstract);分类 cs.CL、cs.AI
Comments ICLR 2025
专题命中 安全训练 :safety(title,abstract);trustworthy(abstract);分类 cs.AI、cs.LG
Comments Accepted to 24th International Conference on Autonomous Agents and Multiagent Systems (AAMAS 2025)
专题命中 安全训练 :alignment(title,abstract);RLHF(abstract);分类 cs.AI、cs.LG
Comments Submitted to IJRR, this paper is an extended journal version of the conference paper arXiv:2310.07932 with new results and discussion. arXiv admin note: substantial text overlap with arXiv:2310.07932
专题命中 安全训练 :trustworthy(title,abstract);safety(abstract);分类 cs.AI、cs.LG
专题命中 安全训练 :safety(title,abstract);trustworthy(abstract);分类 cs.AI、cs.LG
Comments 13 pages, 2 figures, 4 tables
Journal ref published on 2024 Electronics and Telecommunications Trends Vol.39 No.5
专题命中 安全训练 :safety(title,abstract);alignment(abstract);分类 cs.CL、cs.AI
专题命中 安全训练 :alignment(title,abstract);trustworthy(abstract);分类 cs.CL、cs.LG
专题命中 安全训练 :safety(title,abstract);alignment(abstract);分类 cs.AI、cs.LG
专题命中 安全训练 :safety(title,abstract);harmlessness(abstract);分类 cs.CL、cs.AI
Comments Accepted at NAACL 2024 (Main Conference)
专题命中 安全训练 :safety(title,abstract);alignment(abstract);分类 cs.AI、cs.LG
Comments accepted for AAAI 2024 Workshop on Neuro-Symbolic Learning and Reasoning in the Era of Large Language Models (NucLeaR)
专题命中 安全训练 :alignment(title,abstract);safety(abstract);分类 cs.AI、cs.LG
ToolAlignBench:研究启用工具调用的大语言模型中的对齐冲突
机构 * School of Computing \& AI, Arizona State University, Tempe, AZ, USA
专题命中 安全训练 :alignment(title,abstract);safety(abstract);分类 cs.AI
AI总结 研究受监管行业中工具调用大语言模型智能体的安全对齐冲突,构建含128个场景的基准测试,发现安全对齐开源模型有时会违背部署指令,擦除可降低举报率,揭示多元对齐矛盾,发布基准测试框架。
Comments Accepted to the Pluralistic Alignment Workshop at ICML 2026
模型是否共享安全表示?面向安全视觉生成的跨模型引导
机构 * University of Modena and Reggio Emilia(摩德纳和雷吉奥艾米利亚大学) ; University of Pisa(比萨大学) ; Amazon Prime Video(亚马逊prime视频)
专题命中 安全训练 :safety(title,abstract);alignment(abstract);分类 cs.AI
AI总结 本文提出首个跨模型安全引导框架,通过源语言模型估计安全方向并迁移至目标生成器,无需目标侧不安全数据即可实现安全控制,且不牺牲生成质量。
Comments Project page: https://aimagelab.github.io/cross-model-safety-representations/
通过安全过滤和宪法AI实现负责任的联邦大语言模型
机构 * Samsung Electronics(三星电子) ; The University of Tokyo(东京大学)
专题命中 安全训练 :safety(title,abstract);trustworthy(abstract,comments);分类 cs.CL
AI总结 本文提出在联邦大语言模型中引入安全过滤和宪法AI技术,以提升模型安全性,实验显示在AdvBench上安全性能提升超过20%。
Comments Accepted at the 6th Workshop on Trustworthy NLP (TrustNLP), ACL 2026
机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)
专题命中 安全训练 :alignment(abstract);RLHF(abstract);safety(abstract);trustworthy(abstract)
专题命中 安全训练 :alignment(title);safety(title)
低资源语言中跨语言安全的错觉
专题命中 安全训练 :safety(title,abstract);alignment(abstract);分类 cs.CL
AI总结 研究发现大型语言模型的跨语言安全迁移在四种非洲低资源语言中极为有限,现有多语言安全对齐仅停留在表面。
SHE:面向大语言模型智能体的轨迹驱动安全管控机制演化
机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; Fudan University(复旦大学) ; Shanghai Jiao Tong University(上海交通大学) ; The Hong Kong University of Science and Technology(香港科技大学)
专题命中 安全训练 :safety(title,abstract);分类 cs.AI
AI总结 本研究提出SHE框架,将LLM智能体的安全管控机制分解为四个构件并引入归因引导演化循环,在Agent-SafetyBench上使攻击成功率降低3.1倍,还具备泛化与跨模型迁移能力。
Comments Project: https://github.com/RainbowQTT/SHE
形式对齐而非意义对齐:低资源孟加拉语贬损言论中大型语言模型(LLM)安全的理解-遏制解耦
机构 * Islamic University of Technology(伊斯兰科技大学)
专题命中 安全训练 :safety(title,abstract);alignment(abstract);分类 cs.CL
AI总结 该研究针对5个前沿LLM,在6种协议下对孟加拉语贬损言论审计,验证了LLM安全的理解-遏制解耦假设,发现高资源基准无法保障低资源安全,需基于意义的遏制。
Comments 15 pages, 6 figures
工具规格很重要:揭示和缓解AI智能体中的安全风险
机构 * Beijing University of Posts and Telecommunications(北京邮电大学) ; Beihang University(北京航空航天大学) ; Tsinghua University(清华大学)
专题命中 安全训练 :safety(title,abstract);prompt injection(abstract);分类 cs.AI
AI总结 本研究发现模式格式工具规格是AI智能体安全下降的主因,提出SafeKeep防护措施,可提升有害请求弃权率、降低攻击成功率,性能优于现有防护且保留任务处理能力。
当大语言模型防御适得其反时:刻画安全性、性能和成本的权衡
专题命中 安全训练 :safety(title,abstract);jailbreak(abstract);分类 cs.LG
AI总结 研究大语言模型越狱防御的安全性、性能和成本权衡,按操作策略组织防御并研究其副作用,发现不同防御在安全与可用性、效率权衡上有差异,为评估防御副作用及选择防御提供基准和指导。
对齐合理性:确保医疗保健领域人工智能的新标准
专题命中 安全训练 :alignment(title,abstract);safety(abstract);分类 cs.AI
AI总结 研究探讨大语言模型在医疗保健领域的安全问题,提出需在价值规范、训练、监督三层面进行对齐以实现结构安全,进而产生对齐合理性这一监管结构,为论证AI与健康结果的关系提供方式。
Comments 8 pages, 1 figure
在最后的标记之前:诊断最终标记安全探针失败
机构 * SafeSwitch ; HarmBench ; SorryBench
专题命中 安全训练 :safety(title,abstract);jailbreak(abstract);分类 cs.LG
AI总结 研究最终标记安全探针在预填充阶段的失败模式,发现安全证据分布在早期用户标记中,传统探针无法捕捉,提出基于PCA-HMM的轨迹模型提升诊断能力。
Comments 8 pages, 2 figures, 7 tables. Accepted at the ICML 2026 Mechanistic Interpretability Workshop and the ICML 2026 Failure Modes in Agentic AI Workshop
Health-ORSC-Bench:衡量健康领域过度拒绝与安全完成的基准
专题命中 安全训练 :safety(title,abstract);alignment(abstract);分类 cs.AI
AI总结 针对大语言模型在健康场景中过度拒绝良性查询或对有害查询不安全遵从的问题,提出Health-ORSC-Bench基准,通过31,920个边界提示评估模型在意图模糊下的过度拒绝与安全完成质量,揭示安全优化模型过度拒绝率达80%。
Comments Accepted by ACL'26 Findings
Skin-Deep: 大型语言模型表示中对齐脆弱性的几何诊断方法
机构 * Zoom Communications ; Korea University(高丽大学) ; Yonsei University(延世大学) ; Konkuk University(建国大学)
专题命中 安全训练 :alignment(title,abstract);safety(abstract);分类 cs.AI
AI总结 提出Skin-Deep几何诊断方法,通过计算几何脆弱性分数(GFS)在对齐模型微调前检测其拒绝有害请求行为的脆弱性,无需运行攻击。
Comments 16 pages, 3 figures, 12 tables. The first two authors contributed equally. Code (pre-attack GFS diagnostic): https://github.com/js-lee-AI/skin-deep
AsFT:在窄安全盆地内锚定大语言模型微调期间的安全性
机构 * National University of Singapore(新加坡国立大学) ; University of Science and Technology of China(中国科学技术大学) ; Tsinghua University(清华大学)
专题命中 安全训练 :safety(title,abstract);alignment(abstract);分类 cs.LG
AI总结 针对微调大语言模型时安全性易受损的问题,提出AsFT方法,通过惩罚与对齐方向正交的更新,将模型约束在窄安全盆地内,在提升任务性能的同时显著降低有害行为。
推理是否保持对齐?关于大型推理模型的可信度研究
机构 * University of Colorado Boulder(科罗拉多大学博尔德分校) ; University of Central Florida(中佛罗里达大学) ; University of Maryland College Park(马里兰大学帕克分校) ; University of Wisconsin-Madison(威斯康星大学麦迪逊分校)
专题命中 安全训练 :alignment(title,abstract);safety(abstract);分类 cs.CL
AI总结 研究通过监督微调、强化学习和蒸馏生成的推理模型在安全、偏见、隐私等六个可信度维度上是否保持对齐,发现推理模型常出现对齐退化,如毒性增加、刻板印象加剧等。