arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 3266 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全训练 3266 篇

2606.20898 2026-06-23 cs.IR cs.AI cs.CL cs.CY 新提交 67%

The Token Tax of Epistemic Accuracy: Comparing RAG and Long-Context Architectures for Document-Grounded Generative AI Applications

认知准确性的Token税:比较RAG与长上下文架构在文档基础生成式AI应用中的表现

Austin Hamilton, Ryan Singh, Michael Wise, Ibrahim Yousif, Arthur Carvalho, Zhe Shan, Mohammad Mayyas, Lora A. Cavuoto, Fadel M. Megahed

机构 * Miami University(迈阿密大学) University at Buffalo(布法罗大学)

专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 研究比较RAG与长上下文提示两种架构在文档基础生成式AI中的认知准确性与成本权衡,发现长上下文虽准确率更高(73.1% vs 65.4%),但Token成本增加26倍。

Comments 10 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17633 2026-06-15 cs.SD cs.CR 版本更新 67%

SARSteer: Safeguarding Large Audio-Language Models via Safe-Ablated Refusal Steering

SARSteer: 通过安全消融拒绝引导保护大型音频语言模型

Weilin Lin, Jianze Li, Hui Xiong, Li Liu

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 安全训练 :alignment(abstract);safety(abstract)

AI总结 提出SARSteer,首个针对大型音频语言模型的推理时防御框架,通过文本衍生的拒绝引导和分解安全空间消融,有效提升有害查询拒绝率并减少良性查询的过度拒绝。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17659 2026-06-03 cs.RO cs.CV 67%

Plan-R1: Safe and Feasible Trajectory Planning as Language Modeling

Plan-R1:安全且可行的轨迹规划作为语言建模

Xiaolong Tang, Meina Kan, Shiguang Shan, Xilin Chen

机构 * Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 安全训练 :alignment(abstract);safety(abstract)

AI总结 提出Plan-R1两阶段轨迹规划框架,通过原则对齐与行为学习解耦,结合规则奖励和方差解耦GRPO,显著提升自动驾驶规划的安全性和可行性。

Comments Accepted by ICLR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10688 2026-06-02 cs.LG cs.AI cs.CL 67%

SCOPE: Signal-Calibrated On-Policy Distillation Enhancement with Dual-Path Adaptive Weighting

SCOPE: 信号校准的在线策略蒸馏增强与双路径自适应加权

Binbin Zheng, Xing Ma, Yiheng Liang, Jingqing Ruan, Xiaoliang Fu, Kepeng Lin, Benchang Zhu, Ke Zeng, Xunliang Cai

机构 * University of Science and Technology of China(中国科学技术大学) Meituan LongCat Interaction Team(美团 LongCat 交互团队) Nanjing University(南京大学) Fudan University(复旦大学) Huazhong University of Science and Technology(华中科技大学)

专题命中 安全训练 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对在线策略强化学习中奖励稀疏导致的信用分配难题,提出SCOPE框架,通过双路径自适应加权机制分别处理正确与错误轨迹,实现信号校准的蒸馏增强,在六个推理基准上平均提升11.42%的Avg@32和7.30%的Pass@32。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.16174 2026-06-02 cs.LG cs.AI cs.CL cs.CR 67%

Efficient LLM Moderation with Multi-Layer Latent Prototypes

基于多层潜在原型的高效LLM审核

Maciej Chrabąszcz, Filip Szatkowski, Bartosz Wójcik, Jan Dubiński, Tomasz Trzciński, Sebastian Cygert

机构 * University of Warsaw(华沙大学)

专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出多层原型审核器(MLPM),利用多层中间表示的原型实现轻量、高效且可定制的输入审核,在多个基准上达到最优性能,并可与输出审核结合提升响应安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29068 2026-05-29 cs.AI cs.CL cs.CR cs.LG 67%

Robust and Efficient Guardrails with Latent Reasoning

具有潜在推理的鲁棒高效防护栏

Siddharth Sai, Xiaofei Wen, Muhao Chen

机构 * University of California, Davis(加州大学戴维斯分校)

专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出COLAGUARD模型,通过阶段式训练将多步安全推理转移到连续潜在空间,在保持高安全性能的同时实现12.9倍加速和22.4倍令牌减少。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03430 2026-05-29 cs.MA cs.NI 67%

Scaling Multi-agent Systems: A Smart Middleware for Improving Agent Interactions

扩展多智能体系统:一种用于改善智能体交互的智能中间件

Charles Fleming, Guillaume De Saint Marc, Ramana Kompella, Peter Bosch, Vijoy Pandey

专题命中 安全训练 :alignment(abstract);safety(abstract)

AI总结 提出认知织物节点(CFN)中间件,通过强化学习和优化算法动态管理智能体间通信,在HotPotQA和MuSiQue数据集上性能提升超过10%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27494 2026-05-28 cs.CR cs.AI cs.CL cs.IR cs.LG 67%

Grounded Cache Routing for Retrieval-Augmented Generation: When Is It Safe to Reuse an Answer?

基于证据的缓存路由用于检索增强生成:何时可以安全地重用答案?

Syed Huma Shah

专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出GroundedCache,一种通过四个廉价门控(查询相似性、检索证据重叠、源版本有效性和词汇支持)验证缓存答案安全性的路由方法,显著降低不安全服务率。

Comments 19 pages, 9 figures, 10 tables. Code: https://github.com/syedhumarahim/grounded-cache-router

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27168 2026-05-27 cs.CL cs.AI cs.CY 67%

Grounding Text Embeddings in Stakeholder Associations

将文本嵌入与利益相关者关联对齐

Jonathan Rystrøm, Sofie Burgos-Thorsen, Zihao Fu, Johan Irving Søltoft, Kenneth C. Enevoldsen, Chris Russell

机构 * University of Oxford(牛津大学) Institute for Wicked Problems(复杂问题研究所) The Chinese University of Hong Kong(香港中文大学) Danish Technical University(丹麦技术大学) Aarhus University(奥胡斯大学)

专题命中 安全训练 :alignment(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 提出利益相关者对齐练习方法,通过评估嵌入模型与人类专家的语义距离一致性,发现神经文本嵌入在丹麦政策案例中可靠性显著低于专家(差距19-26个百分点),且该差距在美国联邦AI用例中复现(16个百分点)。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25454 2026-05-26 cs.HC cs.AI cs.CL cs.CY cs.SI 67%

AI Content Moderation in Therapy Conversations

AI在治疗对话中的内容审核

Jiwon Kim, Claire Wang, Taeung Yoon, Sabelle Huang, Koustuv Saha

专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 研究审计三种主流内容审核系统(OpenAI、Meta、Google)在真实治疗对话中的标记行为,揭示其限制LLM作为治疗师的潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24216 2026-05-26 cs.LG cs.AI cs.CL cs.CR 67%

Agent-ToM: Learning to Monitor Autonomous LLM Agents via Theory-of-Mind Reasoning

Agent-ToM: 通过心智理论推理学习监控自主LLM智能体

Nesreen K. Ahmed, Nima Nafisi

机构 * Cisco Outshift(思科Outshift)

专题命中 安全训练 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对自主LLM智能体的隐蔽恶意行为监控难题,提出基于心智理论推理的Agent-ToM框架,通过信念推断、意图假设与验证实现结构化轨迹分析,在监控基准上取得优于集成方法的性能。

Comments 23 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23196 2026-05-25 cs.CR 67%

Prompt Overflow: What the Guardrail Inspects Is Not What the Model Infers

提示溢出:护栏检查的内容并非模型推理的内容

Yuanbo Zhou, Changjia Zhu, Junyu Wang, Xu He, Yan Zhai, Kun Sun, Mingkui Wei, Junjie Xiong

专题命中 安全训练 :safety(abstract);prompt injection(abstract)

AI总结 本文提出提示溢出攻击,利用护栏模型有限检查窗口与下游大语言模型更大推理窗口之间的不匹配,通过将恶意指令碎片化并插入良性填充内容到超长提示中,使每个检查片段看似无害,但完整上下文仍可被LLM执行。

Comments 18 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20351 2026-05-21 cs.CR 67%

Refusal Evaluation in Coding LLMs and Code Agents: A Systematic Review of Thirteen Malicious-Code Prompt Corpora (2023-2025)

对编码LLM和代码代理的拒绝评估:十三个恶意代码提示语料库的系统综述(2023-2025)

Richard J. Young, Gregory D. Moody

专题命中 安全训练 :jailbreak(abstract,abstract_cn)

AI总结 本文系统综述了十三个恶意代码提示语料库,分析了其构建方法、提示构造分类、可重复性和许可条款,并指出了方法学上的三个主要缺口。

Comments 30 pages, 6 figures, 2 tables. PRISMA-style systematic review covering thirteen publicly released refusal corpora (AdvBench, CyberSecEval family, RMCBench, RedCode, MCGMark, JailbreakBench, CySecBench, MalwareBench, CIRCLE, MOCHA, ASTRA, Scam2Prompt, JAWS-Bench)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14723 2026-05-15 cs.AI cs.CL cs.LG 67%

Agentifying Patient Dynamics within LLMs through Interacting with Clinical World Model

通过与临床世界模型交互实现患者动态的智能体化

Minghao Wu, Yuting Yan, Zhenyang Cai, Ke Ji, Chuangsen Fang, Ziying Sheng, Xidong Wang, Rongsheng Wang, Hejia Zhang, Shuang Li, Benyou Wang, Hongyuan Zha

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出SepsisAgent,通过临床世界模型模拟患者对液体-血管加压药干预的响应,采用提出-模拟-细化流程进行脓毒症治疗推荐,优于传统RL和LLM基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08592 2026-05-12 cs.CL cs.AI cs.LG 67%

Less Diverse, Less Safe: The Indirect But Pervasive Risk of Test-Time Scaling in Large Language Models

多样性越低,安全性越差:大规模语言模型测试时缩放的间接但广泛的风险

Shahriar Kabir Nahin, Hadi Askari, Muhao Chen, Anshuman Chhabra

机构 * Bellini College of AI, Cybersecurity, and Computing(人工智能、网络安全与计算学院) University of South Florida, Tampa, Florida, USA(佛罗里达州塔帕斯大学) University of California, Davis, California, USA(加州大学戴维斯分校)

专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文揭示了测试时缩放(TTS)中多样性降低导致安全风险增加的问题,提出RefDiv协议用于检测TTS管道中的漏洞,并发现现有安全防护措施对此类风险效果有限。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27045 2026-05-01 cs.LG cs.AI cs.CL 67%

Detecting Clinical Discrepancies in Health Coaching Agents: A Dual-Stream Memory and Reconciliation Architecture

在健康教练代理中检测临床差异:一种双流记忆与协调架构

Samuel L Pugh, Eric Yang, Alexander Muir Sutherland, Alessandra Breschi

机构 * Verily Health Inc(Verily健康公司)

专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出双流记忆与协调架构,用于检测健康教练代理中的临床差异,通过验证患者报告与临床记录以确保安全部署。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18731 2026-05-01 cs.CL cs.AI cs.LG 67%

Mitigating Lost in Multi-turn Conversation via Curriculum RL with Verifiable Accuracy and Abstention Rewards

通过可验证准确性和回避奖励的课程强化学习缓解多轮对话中的迷失问题

Ming Li, Pei Chen, Zhenhao Zhang, Tao Yang, Xinyang Zhang, Han Li, Tianyu Cao, Ming Zeng, Zhuofeng Wu, Meng Jiang, Huasheng Li, Lihong Li, Bing Yin

机构 * University of Maryland(马里兰大学) Amazon(亚马逊)

专题命中 安全训练 :trustworthy(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出RLAAR框架,通过可验证准确性和回避奖励的课程强化学习,减少多轮对话中因提前回答导致的性能下降,提升模型可靠性。

Comments ACL2026, camera-ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08377 2026-04-28 cs.LG cs.AI cs.CL 67%

Reinforcement Learning with Backtracking Feedback

具有回溯反馈的强化学习

Bilgehan Sel, Vaishakh Keshava, Phillip Wallis, Lukas Rutishauser, Ming Jin, Dingcheng Li

机构 * Google(谷歌) Google DeepMind(谷歌DeepMind) Virginia Tech(弗吉尼亚理工大学)

专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出RLBF框架,通过强化学习阶段使模型动态纠正生成错误,结合改进的SFT数据生成策略,提升LLM在对抗攻击和内在错误中的安全性。

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16042 2026-04-21 cs.CL cs.AI cs.LG 67%

Towards Intrinsic Interpretability of Large Language Models:A Survey of Design Principles and Architectures

面向大语言模型内在可解释性的探索:设计原则与架构的综述

Yutong Gao, Qinglin Meng, Yuan Zhou, Liangming Pan

机构 * MOE Key Lab of Computational Linguistics, Peking University(计算语言学MOE实验室,北京大学) Beijing Academy of Artificial Intelligence, Beijing, China(北京人工智能研究院,北京,中国) Nanjing University of Science and Technology(南京理工大学) Purdue University(普渡大学)

专题命中 安全训练 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文综述了大语言模型内在可解释性的发展,分类现有方法为五种设计范式,并讨论开放挑战与未来研究方向。

Comments Accepted to the Main Conference of ACL 2026. 14 pages, 4 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14142 2026-04-16 cs.LG cs.AI cs.CL 67%

From $P(y|x)$ to $P(y)$: Investigating Reinforcement Learning in Pre-train Space

从P(y|x)到P(y):在预训练空间中研究强化学习

Yuqiao Tan, Minzheng Wang, Bo Liu, Zichen Liu, Tian Liang, Shizhu He, Jun Zhao, Kang Liu

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学) National University of Singapore(新加坡国立大学) Tencent AI Lab(腾讯AI实验室)

专题命中 安全训练 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出PreRL和DSRL方法,通过优化预训练空间中的边际分布P(y),提升LLM推理能力,并通过NSR机制增强推理效果,实验表明DSRL在推理任务中表现优异。

Comments Preprint. Our code is available at https://github.com/Trae1ounG/Pretrain_Space_RLVR

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13016 2026-04-16 cs.LG cs.AI cs.CL 67%

Rethinking On-Policy Distillation of Large Language Models: Phenomenology, Mechanism, and Recipe

重新思考大型语言模型的在线策略蒸馏:现象、机制和配方

Yaxuan Li, Yuxin Zuo, Bingxiang He, Jinqian Zhang, Chaojun Xiao, Cheng Qian, Tianyu Yu, Huan-ang Gao, Wenkai Yang, Zhiyuan Liu, Ning Ding

机构 * Tsinghua University(清华大学) ShanghaiTech University(上海交通大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Renmin University of China(中国人民大学)

专题命中 安全训练 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文系统研究了在线策略蒸馏的动态和机制,发现成功关键在于师生思维模式兼容及教师提供新能力,提出两种恢复失败蒸馏的策略,并指出密集奖励的表面优势背后存在代价。

Comments 30 pages, 23 figures. Code: https://github.com/thunlp/OPD

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08524 2026-04-10 cs.LG cs.AI cs.CL 67%

What Drives Representation Steering? A Mechanistic Case Study on Steering Refusal

是什么驱动了表示引导?对引导拒绝的机制性案例研究

Stephen Cheng, Sarah Wiegreffe, Dinesh Manocha

机构 * University of Maryland, College Park(马里兰大学帕克分校)

专题命中 安全训练 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究通过机制性案例分析,探讨引导向量如何通过注意力机制影响模型输出,揭示引导向量主要作用于OV电路而非QK电路,并发现引导向量可被稀疏化而不影响性能。

Comments 9 pages + appendix, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05125 2026-04-08 cs.IR cs.AI cs.CL cs.LG 67%

Offline RL for Adaptive Policy Retrieval in Prior Authorization

离线强化学习在先决授权政策适应性检索中的应用

Ruslan Sharifullin, Maxim Gorshkov, Hannah Clay

机构 * Stanford University(斯坦福大学)

专题命中 安全训练 :DPO(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出了一种基于离线强化学习的适应性政策检索方法,通过将检索过程建模为马尔可夫决策过程,提升了检索效率和准确性。

Comments 9 pages, 7 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21343 2026-04-07 cs.CL cs.AI cs.LG 67%

Self-Improving Pretraining: using post-trained models to pretrain better models

自我改进预训练:利用后训练模型来预训练更好的模型

Ellen Xiaoqing Tan, Jack Lanchantin, Shehzaad Dhuliawala, Danwei Li, Thao Nguyen, Jing Xu, Ping Yu, Ilia Kulikov, Sainbayar Sukhbaatar, Jason Weston, Xian Li, Olga Golovneva

机构 * FAIR at Meta(Meta FAIR)

专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出一种新的预训练和中训练方法,通过利用已有的强后训练模型来重写预训练数据并判断策略模型的 rollout,从而在早期训练中引入安全、事实性、生成质量和推理能力等关键行为,提升模型整体性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22367 2026-04-06 cs.CL cs.AI cs.CY 67%

What Is The Political Content in LLMs' Pre- and Post-Training Data?

大语言模型预训练和后训练数据中的政治内容是什么?

Tanise Ceron, Dmitry Nikolaev, Dominik Stammbach, Debora Nozza

机构 * Bocconi University(博科尼大学) University of Manchester(曼彻斯特大学) Princeton University(普林斯顿大学)

专题命中 安全训练 :alignment(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 研究探讨了大语言模型训练数据中的政治倾向,发现预训练数据偏向左翼内容,且政治立场与模型行为相关,强调数据组成对模型行为的关键作用。

Comments 10 pages, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00627 2026-04-02 cs.CR 67%

When Safe Models Merge into Danger: Exploiting Latent Vulnerabilities in LLM Fusion

当安全模型融合进入危险:在LLM融合中利用潜在漏洞

Jiaqing Li, Zhibo Zhang, Shide Zhou, Yuxi Li, Tianlong Yu, Kailong Wang

专题命中 安全训练 :alignment(abstract);safety(abstract)

AI总结 研究揭示模型融合引入的新攻击面,提出TrojanMerge框架通过约束优化问题攻击安全对齐,实验显示融合模型产生高危害响应,源模型保持安全。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29982 2026-04-01 cs.GT 67%

Performative Scenario Optimization

表现性场景优化

Quanyan Zhu, Zhengye Han

专题命中 安全训练 :safety(abstract);AI safety(abstract)

AI总结 本文提出了一种表现性场景优化框架,用于决策依赖的约束问题,通过反馈循环考虑决策对数据生成过程的影响,证明了其存在性并展示了在AI安全应用中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29232 2026-04-01 cs.CL cs.AI cs.LG 67%

Long-Document QA with Chain-of-Structured-Thought and Fine-Tuned SLMs

长文档问答与结构化思维链及微调大语言模型

Zhuowen Liang, Xiaotian Lin, Zhengxuan Zhang, Yuyu Luo, Haixun Wang, Nan Tang

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) EvenUp, USA(美国EvenUp公司)

专题命中 安全训练 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出LiteCoST框架,通过结构化思维链和微调小语言模型,实现高精度低延迟的长文档问答,采用双支柱方法提升准确性和效率。

Comments 26 pages, 17 figures, 10 tables. Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28807 2026-04-01 cs.CR 67%

SafeClaw-R: Towards Safe and Secure Multi-Agent Personal Assistants

SafeClaw-R:迈向安全且安全的多智能体个人助理

Haoyu Wang, Zibo Xiao, Yedi Zhang, Christopher M. Poskitt, Jun Sun

专题命中 安全训练 :safety(abstract);prompt injection(abstract)

AI总结 本文提出SafeClaw-R框架,通过在执行图层面强制安全不变量,提升多智能体系统在安全性和隐私保护方面的性能,实验表明其在多个领域均表现出色。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27412 2026-03-31 cs.LG cs.AI cs.CL 67%

The Geometry of Harmful Intent: Training-Free Anomaly Detection via Angular Deviation in LLM Residual Streams

有害意图的几何学:通过残差流中的角度偏差实现无训练异常检测

Isaac Llorente-Saguer

机构 * Independent Researcher(独立研究者)

专题命中 安全训练 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出LatentBiopsy方法,通过分析大语言模型残差流激活的几何特性,无需训练即可检测有害提示。该方法基于残差流激活的主成分分析和角度偏差,实现高精度的异常检测,具有低延迟和强鲁棒性。

Comments 20 pages, 10 figures, 3 tables. Training-free harmful-prompt detector via angular deviation in LLM residual streams. Evaluated on six Qwen variants (base / instruct / abliterated). Achieves AUROC over 0.937 (harmful-vs-normative) and 1.000 (harmful-vs-benign-aggressive) with no harmful training data

详情

展开后加载摘要…

URL PDF HTML 收藏