Sleeper Agents: Training Deceptive LLMs that Persist Through Safety Training
专题命中 安全训练 :safety(title,abstract);分类 cs.CL、cs.AI、cs.LG
Comments updated to add missing acknowledgements
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
专题命中 安全训练 :safety(title,abstract);分类 cs.CL、cs.AI、cs.LG
Comments updated to add missing acknowledgements
专题命中 安全训练 :alignment(title);RLHF(abstract);分类 cs.CL、cs.AI、cs.LG
Comments 19 pages, 5 figures
专题命中 安全训练 :safety(title,abstract);AI safety(abstract)
Comments 8 pages, 6 figures
专题命中 安全训练 :safety(title,abstract);分类 cs.AI、cs.CY、cs.LG
Comments 2016 Information Theory and Applications Workshop, La Jolla, California
使用大型语言模型进行具身规划引入了系统性的安全风险
机构 * ETH Zurich(苏黎世联邦理工学院) ; University College London(伦敦大学学院) ; Stanford University(斯坦福大学) ; Northwestern University(西北大学) ; National University of Singapore(新加坡国立大学)
专题命中 安全训练 :safety(title,abstract);分类 cs.AI、cs.LG
AI总结 研究评估了大型语言模型在机器人规划中的安全性,发现即使规划能力高,安全风险仍显著存在,揭示了规划能力与安全意识之间的乘法关系。
Comments Project page: https://despite-safety.github.io/
专题命中 安全训练 :jailbreak(title,abstract);分类 cs.AI、cs.CY
Comments Homepage: https://poex-jailbreak.github.io/
专题命中 安全训练 :alignment(title,abstract);分类 cs.AI、cs.CY;safety(comments)
Comments ML Safety Workshop, 36th Conference on Neural Information Processing Systems (NeurIPS 2022)
SafeSteer: 多模态大语言模型中的解码级防御机制
机构 * Tsinghua University(清华大学) ; Shanghai Jiao Tong University(上海交通大学) ; Kuaishou Technology(快手科技) ; School of Computer Science and Technology, Beihang University(北航计算机科学与技术学院) ; Nanjing University of Aeronautics and Astronautics(南京航空航天大学) ; Chongqing University(重庆大学) ; Wuhan University(武汉大学)
专题命中 安全训练 :alignment(abstract);safety(abstract);jailbreak(abstract);harmlessness(abstract)
AI总结 本文提出SafeSteer,通过解码阶段的轻量探针和模态语义对齐向量,提升多模态大语言模型的安全性,实验表明其能提升33.40%的安全性而不需微调。
CoFi-PGMA:在多智能体LLM中基于过滤反馈的反事实策略梯度
机构 * Stanford Graduate School of Business(斯坦福商学院) ; Stanford University(斯坦福大学) ; Department of Mathematics(数学系)
专题命中 安全训练 :RLHF(summary_cn,abstract);分类 cs.LG
AI总结 针对多智能体LLM中过滤反馈导致的RLHF目标不准确问题,提出CoFi-PGMA框架,通过边际贡献反事实目标修正路由和协作机制下的学习信号,并提供实用训练算法和实证研究。
Comments 17 pages, 0 figures
机构 * Cisco AI Threat Research & Security(思科AI威胁研究与安全)
专题命中 安全训练 :alignment(abstract);safety(abstract);jailbreak(abstract);prompt injection(abstract)
机构 * Meta
专题命中 安全训练 :alignment(abstract);safety(abstract);jailbreak(abstract);prompt injection(abstract)
专题命中 安全训练 :safety(title,abstract);分类 cs.AI;AI safety(comments)
Comments IJCAI 2019 AI Safety Workshop
专题命中 安全训练 :jailbreak(abstract,comments);alignment(abstract);RLHF(abstract);分类 cs.CL、cs.AI、cs.LG
Comments Accepted at ICLR 2025. Updates in v2 and v3: added GPT-4o, Claude 3.5 Sonnet, o1-mini, and o1-preview results. Code and jailbreak artifacts: https://github.com/tml-epfl/llm-past-tense
安全关键环境下符合欧盟AI法案要求的短期负荷预测:德国输电电网聚合负荷41天在线挑战赛结果
机构 * THK-AI Research Cluster(THK-AI研究集群)
专题命中 安全训练 :safety(title,abstract);分类 cs.AI、cs.LG
AI总结 本文通过41天在线挑战赛验证,符合欧盟AI法案要求的spotforecast2-safe短期负荷预测流程,在德国输电电网聚合负荷预测中优于ENTSO-E基线,其本地模型性能可与超1亿参数的chronos-2等大模型媲美。
Comments Version 3. 40 pages
TAF-MED:声明自我治疗意图下大语言模型的多轮安全拒绝崩溃
机构 * Independent Researcher(独立研究者) ; School of Computation, Information and Technology, Technical University of Munich(慕尼黑工业大学计算、信息与技术学院) ; Institute of General Practice, Faculty of Medicine and Medical Center, University of Freiburg(弗莱堡大学医学中心医学院普通实践研究所)
专题命中 安全训练 :safety(title,abstract);分类 cs.CL、cs.AI
AI总结 本研究推出TAF-MED医疗安全基准,评估8个大语言模型的多轮医疗对话安全表现,发现多数模型会在后续对话中出现安全拒绝崩溃,自动评判工具与医生标注一致性较高,将公开基准支持相关研究。
超越“我无法对此提供帮助”:儿童安全专家如何评估AI聊天机器人的安全性
专题命中 安全训练 :safety(title,abstract);分类 cs.AI、cs.CY
AI总结 本文通过访谈19名儿童安全相关从业者,分析现有AI聊天机器人儿童安全评估的局限,提出需将从业者视角纳入安全评估工作的建议。
Comments Ninth AAAI/ACM Conference on AI, Ethics, and Society (AIES 2026)
单一规范提示低估了大语言模型安全的表面形式敏感性
专题命中 安全训练 :safety(title,abstract);分类 cs.CL、cs.AI
AI总结 该研究发现仅用单一规范提示评估大语言模型安全会低估其不安全合规性,不同表面形式下的不安全结果并集会超出最糟单一形式,且存在模型差异,同时发布了相关数据集、代码与响应标签。
Comments 9 pages, 3 tables
EduZone:面向K-12学生与教师的大语言模型安全评估框架
专题命中 安全训练 :safety(title,abstract);分类 cs.AI、cs.CY
AI总结 EduZone是针对K-12教育场景的LLM安全评估框架,整合多维度要素生成对抗交互,评估10个LLMs后发现其对教育特定风险更脆弱,现有防护措施不足,该框架可助力开发更安全的教育类LLMs。
Comments Under Review
对大型语言模型在机器人健康护理员控制中的安全性的基准测试
机构 * Kyushu Institute of Technology(九州工业技术大学)
专题命中 安全训练 :safety(title,abstract);分类 cs.AI、cs.CY
AI总结 本文通过270条有害指令评估72个LLM,在模拟环境中测试其安全性,发现模型大小和发布日期影响安全性能,专有模型更安全,但医疗领域微调和提示防御策略效果有限,需将安全性作为首要考量。
Comments 20 pages, 9 figures, 3 tables, 8 pages supplementary material
作为替罪羊的护栏:审计工具增强型大语言模型智能体中不忠实的安全拒绝行为
专题命中 安全训练 :safety(title,abstract);分类 cs.AI、cs.LG
AI总结 研究工具增强型大语言模型智能体安全拒绝行为审计问题,引入轻量级黑盒审计框架,将智能体响应分类。实验发现伪造行为占主导,不忠实安全拒绝行为在基线时少,增强安全语言会显著增加该行为,还提出检测方法及治理影响。
Comments 10 pages, 3 figures. Accepted at the ACM KDD 2026 Workshop on Evaluation and Trustworthiness of Agentic AI
拒绝残差:探测何时能捕捉到对齐造假以及何时不能
机构 * Snowflake AI Research(Snowflake AI 研究所)
专题命中 安全训练 :alignment(title,abstract);分类 cs.CL、cs.AI
AI总结 研究对齐造假中隐藏状态能否揭示输出隐藏内容,对13个模型扫描,发现Qwen3 - 32B和Llama - 3.1 - 8B存在自然造假及不对称拒绝残差,样本检测有模型条件性,还发布五控制测量框架用于对齐造假检测。
Comments Accepted to the Mechanistic Interpretability Workshop at ICML 2026. 12 pages, 4 figures
Tool-MCoT:用于内容安全审核的工具增强多模态链式思维
机构 * Stanford University(斯坦福大学) ; Google(谷歌) ; Google DeepMind(谷歌DeepMind)
专题命中 安全训练 :safety(title,abstract);分类 cs.CL、cs.AI
AI总结 本文提出Tool-MCoT,一种基于工具增强的多模态链式思维模型,用于提升内容安全审核的效率与准确性,通过训练小语言模型以有效利用外部工具进行推理和决策。
当聚合对齐产生误导时:无需逐状态专家操作的审核策略修复
机构 * Blossom AI(绽放人工智能公司) ; Blossom AI Labs(绽放人工智能实验室)
专题命中 安全训练 :alignment(title,abstract);分类 cs.AI、cs.LG
AI总结 研究在酒店定价模拟器中,智能策略编辑器仅接收区域级诊断反馈时的策略修复问题,用多重启大语言模型编辑器进行修复,其不仅提升收益还减小情节构成距离,结果表明应按诊断反馈是否成可靠闭环结果评估策略修复。
多模态铁路道口安全分析
机构 * University of California, Riverside(加州大学河滨分校) ; Riverside County Transportation Commission(河滨县交通委员会)
专题命中 安全训练 :safety(title,abstract);分类 cs.AI、cs.LG
AI总结 提出多模态管道,利用视觉线索和事故报告评估铁路道口安全,基于FRA评分实现高风险/低风险分类(F1=0.757)和分数估计(RMSE=0.078)。
TraCeS: 从稀疏轨迹级标签学习每时间步约束违反信用
专题命中 安全训练 :safety(title,abstract);分类 cs.AI、cs.LG
AI总结 提出TraCeS方法,通过稀疏轨迹级标签学习每时间步的约束违反信用,用于强化学习中的安全约束优化,无需已知成本函数或阈值,在连续控制基准上提升约束满足和反馈效率。
Comments Accepted at ICML 2026. Code available at https://github.com/siowmeng/TraCeS
良性多语言微调的安全影响异质性
专题命中 安全训练 :safety(title,abstract);分类 cs.CL、cs.AI
AI总结 本研究通过多语言良性数据微调LLM,发现安全结果对微调语言和评估语言高度敏感,对抗性合规率在某些设置下增加四倍,且多语言安全漂移与通用能力指标脱钩,呈现异质性。
Comments 9 pages
Journal ref Proceedings of the 43rd International Conference on Machine Learning, Seoul, South Korea, 2026
GAC: 通过梯度对齐控制稳定大语言模型的异步RL训练
机构 * School of Computing and Data Science, The University of Hong Kong(计算与数据科学学院,香港大学) ; Alibaba Group(阿里巴巴集团) ; Southeast University(东南大学)
专题命中 安全训练 :alignment(title,abstract);分类 cs.AI、cs.LG
AI总结 针对异步策略梯度训练中梯度高余弦相似性导致的训练不稳定问题,提出梯度对齐控制(GAC)方法,通过梯度投影调节陈旧对齐方向,恢复稳定训练并匹配同步基线。
TRIDENT: 打破混合安全-物理耦合以实现可证明安全的多智能体强化学习
机构 * Peking University(北京大学) ; Xiamen University(厦门大学) ; National Taiwan University(国立台湾大学) ; WHU(武汉大学) ; THU / Jimei University(清华大学 / 集美大学)
专题命中 安全训练 :safety(title,abstract);分类 cs.AI、cs.LG
AI总结 针对混合离散-连续动作、训练时安全约束和物理动力学形成的耦合问题,提出TRIDENT框架,通过Richardson-Romberg梯度校正、Lyapunov约束序列信任域更新和物理信息残差评论家,实现可证明的安全收敛,显著降低训练违规并提升奖励。
Comments 16 pages, 4 figures
通过理论极小极大博弈视角增强LLM安全性
机构 * University of California, Los Angeles(加州大学洛杉矶分校) ; VirtueAI ; University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
专题命中 安全训练 :safety(title,abstract);分类 cs.CL、cs.LG
AI总结 提出极小极大强化学习框架,通过数据生成器与分类器协同进化生成高质量多语言安全数据,理论证明收敛到纳什均衡,使小模型在英文基准上超越SOTA近10%且推理速度提升4.5倍。
Comments 24 pages, 9 figures, 5 tables
隐于无形:使用DECOMPBENCH基准测试代理安全对抗分解攻击
机构 * Carnegie Mellon University(卡内基梅隆大学) ; Simons Institute, UC Berkeley(Simons研究所,伯克利大学)
专题命中 安全训练 :safety(title,abstract);分类 cs.AI、cs.LG
AI总结 提出DeCompBench基准,通过分解攻击将有害任务拆分为良性子任务,揭示现有代理安全机制在对抗分解攻击时的脆弱性。