Causal Analysis of Agent Behavior for AI Safety
专题命中 安全训练 :safety(title);AI safety(title);分类 cs.AI、cs.LG
Comments 16 pages, 16 figures, 6 tables
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
专题命中 安全训练 :safety(title);AI safety(title);分类 cs.AI、cs.LG
Comments 16 pages, 16 figures, 6 tables
SafeCOMM: 对于在电信领域微调的大型语言模型安全退化的研究
机构 * Technical University Munich(慕尼黑技术大学) ; IBM Research(IBM研究院) ; Florida Atlantic University(佛罗里达 Atlantic 大学) ; Virginia Tech(弗吉尼亚理工大学)
专题命中 安全训练 :safety(title,abstract);alignment(abstract);分类 cs.CL、cs.CY、cs.LG
AI总结 本文研究了在电信领域微调的大型语言模型的安全退化问题,提出TeleHarm基准测试及三种防御方法,展示了如何通过安全重对齐提升模型安全性,实现SafeCOMM模型。
Journal ref IEEE Wireless Communications and Networking Conference (WCNC), 2026
RefusalGuard:面向大语言模型安全的保几何微调方法
专题命中 安全训练 :safety(title,abstract);alignment(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本研究提出保几何微调框架RefusalGuard,解决大语言模型微调时安全对齐退化问题,在多模型及安全、下游任务基准上表现优于基线,平衡安全与任务性能。
Journal ref Conference of Languge Modeling, COLM 2026
面向大语言模型安全的在线策略蒸馏:一种针对模板鲁棒性的重对齐路由方法
机构 * Tsinghua University(清华大学) ; Swinburne University of Technology(斯威本科技大学) ; EPFL(洛桑联邦理工学院)
专题命中 安全训练 :safety(title,abstract);alignment(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 针对现有LLM安全防御的模板鲁棒性不足等问题,提出ROPD框架,通过建模输出分布差异实现重对齐,大幅降低模板不匹配风险,在防御有效性和能力保留上优于基线方法,建立了新的鲁棒重对齐标准。
拒绝并非安全!评估大语言模型驱动的内容幽默化中的潜在安全风险
专题命中 安全训练 :safety(title,abstract);jailbreak(abstract);prompt injection(abstract)
AI总结 研究基于LLM的内容幽默化潜在安全风险,提出HumorSafe框架评估风险传播,发现LLMs幽默化时会引入刻板印象和毒性,还提出HumorPIA攻击,揭示现有LLM安全评估在幽默化设置下的差距。
思考令牌有助于安全性吗?
机构 * Princeton Language and Intelligence(普林斯顿语言与智能)
专题命中 安全训练 :safety(title,abstract);alignment(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 研究发现前沿推理模型的安全性行为并非真正基于思考,早期令牌即可预测拒绝/顺从结果,思考过程更像前缀补全而非审慎修订。
ALIGNBEAM: 通过跨词汇表logit混合实现推理时对齐迁移
机构 * Lexsi Labs
专题命中 安全训练 :alignment(title,abstract);safety(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 针对领域微调降低大模型安全性的问题,提出无需训练的ALIGNBEAM方法,通过逐token翻译锚模型logit并选择最安全候选,实现跨词汇表的安全对齐迁移,保持任务准确性和推理开销。
Opir:针对毒性、越狱、仇恨言论和有害内容的高效多任务安全分类
机构 * Knowledgator ; Wordcab
专题命中 安全训练 :safety(title,abstract);jailbreak(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出基于GLiClass架构的Opir系列编码器护栏模型,通过多任务学习实现二进制安全/不安全分类、多标签毒性分类、越狱分类和零样本不安全提示与响应分类,在12项安全分类任务和17项类别任务上与现有护栏系统竞争,同时部署开销更小。
Comments 23 pages, 4 figures, 9 tables
AgentDoG:一种面向AI代理安全与安全的诊断防护框架
机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)
专题命中 安全训练 :safety(title,abstract);alignment(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出AgentDoG框架,通过统一的三维分类法和细粒度安全基准,解决AI代理安全与安全中的复杂风险问题,提供细粒度监控和根因诊断,实现有效代理对齐。
Comments 40 pages, 26 figures
安全子空间并非线性区分:一项微调案例研究
机构 * Mohamed bin Zayed University of Artificial Intelligence(莫扎德·本·扎耶德人工智能大学) ; University of California San Diego(加州大学圣地亚哥分校) ; Massachusetts Institute of Technology(麻省理工学院)
专题命中 安全训练 :safety(title,abstract);alignment(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本研究通过微调案例发现,安全行为与通用学习组件高度交织,基于子空间的防御策略存在根本限制。
Comments ICLR 2026. Kaustubh Ponkshe, Shaan Shah, and Raghav Singhal contributed equally to this work
MAGIC: 一种共进化攻击者-防御者对抗游戏用于鲁棒大语言模型安全
机构 * Shanghai AI Laboratory(上海人工智能实验室) ; Shanghai Jiao Tong University(上海交通大学) ; Zhejiang University(浙江大学)
专题命中 安全训练 :safety(title,abstract);alignment(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 MAGIC通过共进化对抗游戏提升大语言模型的安全性,攻击者与防御者智能体在多轮强化学习中相互演化,有效识别并抵御未知攻击模式。
专题命中 安全训练 :alignment(title,abstract);safety(abstract);分类 cs.CL、cs.AI、cs.LG
机构 * Brown University(布朗大学)
专题命中 安全训练 :alignment(title,abstract);safety(abstract);分类 cs.CL、cs.AI、cs.LG
机构 * University of Southern California(南加州大学) ; USC Institute for Creative Technologies(USC创意技术研究所)
专题命中 安全训练 :alignment(title,abstract);trustworthy(abstract);分类 cs.CL、cs.AI、cs.CY
Comments Proceedings of the 2025 Conference on Empirical Methods in Natural Language Processing (EMNLP 2025), Main Conference
专题命中 安全训练 :alignment(title,abstract);safety(abstract);分类 cs.AI、cs.CY、cs.LG
Comments 31 Pages, 4 Figures. Substantial revision. Restructured around the Enumeration Paradox and Five Pillars of Impossibility. Core mathematical results unchanged but significantly expanded. Added new impossibility proofs from statistical, information-theoretic, and dynamic perspectives
专题命中 安全训练 :harmlessness(title);alignment(abstract);safety(abstract);分类 cs.CL、cs.AI、cs.CY
专题命中 安全训练 :safety(title,abstract);AI safety(abstract);分类 cs.AI、cs.CY、cs.LG
专题命中 安全训练 :safety(title,abstract);AI safety(abstract);分类 cs.AI、cs.CY、cs.LG
专题命中 安全训练 :safety(title,abstract);alignment(abstract);分类 cs.CL、cs.AI、cs.LG
专题命中 安全训练 :safety(title,abstract);alignment(abstract);分类 cs.CL、cs.CY、cs.LG
专题命中 安全训练 :safety(title,abstract);alignment(abstract);分类 cs.CL、cs.AI、cs.LG
专题命中 安全训练 :safety(title,abstract);alignment(abstract);分类 cs.CL、cs.AI、cs.LG
Comments ICLR Tiny Paper camera ready version
专题命中 安全训练 :alignment(title,abstract);RLHF(abstract);分类 cs.CL、cs.AI、cs.LG
拒绝的几何:安全对齐大语言模型中的线性不稳定性
机构 * University of Southern California(南加州大学) ; Independent Researcher(独立研究员)
专题命中 安全训练 :safety(title,abstract);alignment(abstract);分类 cs.AI、cs.LG;trustworthy(comments)
AI总结 研究通过对比安全与不安全系统提示的隐藏状态,提出对比逻辑操控(CLS)框架,揭示安全对齐的线性脆弱性,并证明逻辑级干预比隐藏状态方法更有效,同时可实现双向控制。
Comments Accepted at TrustNLP 2026 (Sixth Workshop on Trustworthy Natural Language Processing, ACL 2026)
基于人类反馈的安全强化学习策略梯度对偶方法
专题命中 安全训练 :RLHF(summary_cn,abstract);harmlessness(abstract);分类 cs.LG
AI总结 本文提出两种无需奖励模型拟合的Safe RLHF算法,将安全RLHF建模为无限 horizon 折扣约束马尔可夫决策过程,并保证了全局收敛性。
KV缓存量化下的对齐崩溃:诊断与缓解
机构 * Stanford University(斯坦福大学) ; California Institute of Technology(加利福尼亚理工学院)
专题命中 安全训练 :alignment(title,abstract);safety(abstract);分类 cs.AI、cs.LG
AI总结 研究发现低比特KV缓存量化会无声破坏大模型的安全对齐,根源在于安全特征位于低维激活子空间,易受量化噪声影响;提出逐通道缩减(PCR)诊断方法,分类三种失效模式并指导缓解,无需训练即可恢复高达97%的对齐损失。
Comments Preprint. 61 pages, 9 figures
TRACE:基于轨迹的安全补丁学习用于大语言模型训练后调整
机构 * LERo
专题命中 安全训练 :safety(title,abstract);alignment(abstract);分类 cs.AI、cs.LG
AI总结 研究针对FTaaS平台削弱模型安全对齐的问题,提出TRACE框架,通过模拟有害轨迹生成损坏状态,优化插件补丁,在保持效用的同时恢复模型安全,在多基准测试和模型上占据安全 - 效用前沿。
HyperSafe:微调语言模型推理时的安全恢复
机构 * King Abdullah University of Science and Technology(阿卜杜拉国王科技大学)
专题命中 安全训练 :safety(title,abstract);alignment(abstract);分类 cs.CL、cs.LG
AI总结 研究针对微调语言模型推理时安全对齐脆弱的问题,提出HyperSafe框架,通过生成特定模型的安全侧网络,利用层激活指纹和超网络映射参数,实现提示级安全分类,有效降低有害响应率,保持任务准确率。
ANCHOR:针对现实世界危害的CLI代理自动对齐审计
机构 * Anthropic(Anthropic公司)
专题命中 安全训练 :alignment(title,abstract);safety(abstract);分类 cs.CL、cs.AI
AI总结 研究自主CLI代理在现实世界危害中的风险,提出ANCHOR自动审计框架,通过基于黑暗人格数据微调的审计代理模拟恶意用户,测试CLI代理,发现当前对齐技术不足,强调针对此类恶意用户进行安全评估的必要。
Comments Accepted at ICML 2026. 19 pages, 14 figures, 5 tables
Journal ref International Conference on Machine Learning, 2026
注入悖论:通过RAG上下文注入在安全训练的LLM推荐中实现品牌级压制
机构 * University of California, Berkeley(加州大学伯克利分校)
专题命中 安全训练 :safety(title,abstract);prompt injection(abstract);分类 cs.CL、cs.LG
AI总结 研究发现在基于RAG的LLM推荐中,安全训练会导致注入提示反而压制目标品牌推荐率,揭示了安全机制可能被逆向利用的风险。
Comments 18 pages, 1 figure, 15 tables. Accepted at the ICML 2026 Workshop on Failure Modes in Agentic AI (FAGEN), a non-archival venue