arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-06-09 至 2026-06-09 共收录 100 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 10 篇

2606.09735 2026-06-09 cs.CL 新提交 92%

The Neutral Mask: How RLHF Provides Shallow Alignment while Leaving Partisan Structure Intact in a Large Language Model

中性面具:RLHF如何提供浅层对齐而保留大语言模型中的党派结构

Wendy K. Tam

机构 * Vanderbilt University(范德堡大学) University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) National Center for Supercomputing Applications(国家超级计算应用中心)

专题命中 偏好对齐 :RLHF(title,title_cn);alignment(title,abstract);分类 cs.CL

AI总结 研究RLHF对Llama 3.1 8B党派倾向的影响,发现RLHF仅压缩党派信号方差以实现中性输出,而非移除党派结构,且特征级操控可绕过对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07535 2026-06-09 cs.CL 新提交 90%

Multilingual Refusal Alignment for Safer Large Language Models

多语言拒绝对齐:构建更安全的大型语言模型

Aleksandra Krasnodębska, Wojciech Kusa, Aldo Lipani

机构 * NASK National Research Institute(国家研究 institute) University College London(伦敦大学学院)

专题命中 偏好对齐 :DPO(summary_cn,abstract);alignment(title,abstract);safety(abstract);分类 cs.CL

AI总结 本研究系统探究多语言对齐动态,通过引入覆盖12种欧洲语言的RefusEU数据集和DPO实验,发现仅用英语对齐不足以保障跨语言安全,而多语言训练可在不降低通用性能的前提下提升安全性。

Comments Accepted to Findings ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08940 2026-06-09 cs.CL 新提交 86%

Multilingual Sentiment Aware Text Summarization A Reinforcement Learning Approach for Consistency Maintenance

多语言情感感知文本摘要:一种用于一致性维护的强化学习方法

Mikhail Krasitskii, Alexander Gelbukh, Olga Kolesnikova, Grigori Sidorov

机构 * Instituto Politécnico Nacional (IPN), Centro de Investigación en Computación (CIC)(国立理工学院(IPN),计算研究中心(CIC))

专题命中 偏好对齐 :RLHF(summary_cn,abstract);alignment(abstract);safety(abstract);分类 cs.CL

AI总结 研究RLHF摘要中的情感漂移现象,提出基于策略归因框架的情感感知KL正则化方法,在保持摘要质量的同时缓解情感中性化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08131 2026-06-09 cs.HC cs.AI 新提交 79%

LCAM: A Framework for Diagnosing Interactional Alignment Failures in Con-versational AI

LCAM:诊断对话式AI中交互对齐失败的框架

Manuele Reani, Hongyu Tian

机构 * School of Management and Economics, The Chinese University of Hong Kong, Shenzhen(香港中文大学深圳校区管理学院)

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.AI

AI总结 提出分层认知对齐模型(LCAM),通过五层对齐和两种失调极性诊断对话式AI的交互失败,应用于LLM咨询案例揭示潜在危害。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07877 2026-06-09 cs.CL 新提交 79%

Whose Norms? Disentangling Cultural and Personal Alignment in Large Language Models

谁的规范?解开大语言模型中的文化与个人对齐

Angana Borah, Isabelle Augenstein, Rada Mihalcea

机构 * University of Michigan - Ann Arbor(密歇根大学安娜堡分校) University of Copenhagen(哥本哈根大学)

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.CL

AI总结 提出PACT框架评估大语言模型在文化规范与个人偏好间的权衡,发现模型受国家背景影响大于年龄和性别,且人类对齐未能捕捉文化多元性。

Comments Preprint under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09525 2026-06-09 cs.CL cs.AI 新提交 73%

Emergence of Context Characteristics Sensitivity in Large Language Models

大型语言模型中上下文特征敏感性的涌现

Nadya Yuki Wangsajaya, Haeun Yu, Isabelle Augenstein

机构 * Nanyang Technological University(南洋理工大学) University of Copenhagen(哥本哈根大学)

专题命中 偏好对齐 :DPO(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 通过测量监督微调、直接偏好优化和可验证奖励强化学习三个阶段,发现大型语言模型对上下文特征的敏感性在指令微调过程中动态变化,其中监督微调使模型倾向于使用易理解的上下文,而后续阶段可能强化或改变这一偏好。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09124 2026-06-09 cs.AI 新提交 70%

A Regret Minimization Framework on Preference Learning in Large Language Models

大语言模型中偏好学习的遗憾最小化框架

Suhwan Kim, Taehyun Cho, Geon-Hyeong Kim, Yu Jin Kim, Youngsoo Jang, Moontae Lee, Jungwoo Lee

机构 * KAIST(韩国科学技术院)

专题命中 偏好对齐 :RLHF(abstract,abstract_cn);分类 cs.AI

AI总结 提出基于遗憾的偏好优化方法RePO,通过遗憾最小化而非奖励最大化来建模人类偏好,在数学推理和人类偏好数据集上取得一致性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07629 2026-06-09 cs.LG cs.AI cs.CL cs.CY cs.HC 新提交 70%

Large Language Models Should Learn Personalized Rather Than Aggregated Human Preferences

大型语言模型应学习个性化而非聚合的人类偏好

Cristina Garbacea

机构 * University of Chicago, Data Science Institute(芝加哥大学数据科学学院)

专题命中 偏好对齐 :safety(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 本文主张大型语言模型应学习个性化偏好而非聚合偏好,分析聚合偏好的理论局限与实证问题,提出通过有界个性化框架兼顾个体自主与集体安全。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09470 2026-06-09 cs.CL cs.AI 新提交 62%

A Finetuned SpeechLLM for Joint Multi-Granular L2 Assessment and Natural-Language Rationales

一种用于联合多粒度L2评估和自然语言解释的微调SpeechLLM

Aditya Kamlesh Parikh, Cristian Tejedor-Garcia, Catia Cucchiarini, Helmer Strik

机构 * Centre for Language Studies, Radboud University(语言研究中心,拉德堡德大学)

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 提出一种基于评分准则的SpeechLLM,通过混合训练目标联合预测句子级和词/音素级标签并生成自然语言解释,在SpeechOcean762上达到或超越单粒度模型。

Comments Accepted to Interspeech 2026. This publication is part of the project Responsible AI for Voice Diagnostics (RAIVD) with file number NGF.1607.22.013 of the research programme NGF AiNed Fellowship Grants, which is financed by the Dutch Research Council (NWO)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07705 2026-06-09 cs.LG cs.AI 新提交 62%

SAW: Stage-Aware Dynamic Weighting for Multi-Objective Reinforcement Learning in Large Language Models

SAW: 面向大语言模型多目标强化学习的阶段感知动态加权

Yuchen He, Baolong Bi, Shenghua Liu, Huaming Liao, Yuyao Ge, Bolin Wan, Siqian Tong, Juan Chen, Jiafeng Guo, Xueqi Cheng

机构 * Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) University of Electronic Science and Technology of China(电子科技大学)

专题命中 偏好对齐 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 针对多目标强化学习中奖励学习异步性问题,提出轻量级动态加权机制SAW,利用变异系数实时调整各目标贡献,在GRPO和GDPO框架下提升训练效率和最终性能。

Comments 17 pages, 7 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 安全训练 14 篇

2606.09227 2026-06-09 cs.CR cs.AI cs.CE cs.CY cs.HC cs.SI 新提交 81%

Trustworthy Smart Fabs via Professional Proxies: Scaling Safe and Sustainable by Design (SSbD) through Industrial Data Spaces

通过专业代理实现可信智能晶圆厂:通过工业数据空间扩展安全与可持续设计(SSbD)

Han-Teng Liao, Chang-Yi Kao, Karen Ang

机构 * Independent Researcher Dept. Computer Science and Independent Researcher Information Management(独立研究员计算机科学系及独立研究员信息管理)

专题命中 安全训练 :trustworthy(title,abstract);分类 cs.AI、cs.CY

AI总结 针对欧盟SSbD等法规带来的治理瓶颈,提出基于零信任的社会技术编排框架,通过硬件隔离信任区中的专业代理工作流,在工业数据空间中实现自主治理,解决数据主权悖论。

Comments This work was accepted for presentation at the 32nd IEEE ICE/ITMC Conference, Porto, Portugal, 2026 but was subsequently withdrawn prior to publication due to submission volume limits. It is currently under consideration for publication elsewhere

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09749 2026-06-09 cs.RO cs.LG 新提交 79%

Your Model Already Knows: Attention-Guided Safety Filter for Vision-Language-Action Models

你的模型已经知道:面向视觉-语言-动作模型的注意力引导安全过滤器

Seongbin Park, Fan Zhang, Baharan Mirzasoleiman, Shahriar Talebi, Nader Sehatbakhsh

机构 * University of California Los Angeles(加州大学洛杉矶分校)

专题命中 安全训练 :safety(title,abstract);分类 cs.LG

AI总结 本文发现VLA模型中的少数注意力头能可靠定位目标物体,利用这一特性提出无需训练的安全框架,结合控制障碍函数和实时目标跟踪器,实现动态障碍物下的碰撞避免,在动态场景中性能提升43%。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09038 2026-06-09 cs.AI 新提交 79%

Personalization Meets Safety:Mechanisms,Risks,and Mitigations in Personalized LLMs

个性化与安全的交汇:个性化大语言模型中的机制、风险与缓解措施

Yanyan Luo, Xue Han, Ruiqiao Bai, Xin Huang, Yitong Wang, Qian Hu, Qing Wang, Chunxu Zhao, Jie Liu, Cong Geng, Lehao Xing, Pengwei Hu, Junlan Feng

机构 * China Mobile Jiutian Artificial Intelligence Technology (Beijing) Co., Ltd.(中国移动九天人工智能技术(北京)有限公司) Chinese Academy of Sciences(中国科学院)

专题命中 安全训练 :safety(title,abstract);分类 cs.AI

AI总结 本文首次对个性化大语言模型进行安全导向的综述,从用户表征、个性化范式和评估三个维度组织,提出统一的安全风险分类,并分析各范式下的脆弱性及缓解策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08497 2026-06-09 cs.AI cs.CL 新提交 73%

Explaining Black-Box Language Models: Learning to Optimize Linguistically-Structured Word Subsets

解释黑盒语言模型:学习优化语言结构化的单词子集

Minyoung Hwang, Seokhyun Lee, Changhee Lee

机构 * Korea University(高丽大学)

专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI

AI总结 针对黑盒语言模型解释的三个关键需求(推理效率、黑盒兼容性、语言结构可解释性),提出一种通过强化学习选择信息性单词子集的方法,实现高效、无梯度且语言连贯的解释。

Comments KDD 2026 Research Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09388 2026-06-09 cs.LG 新提交 70%

Distilling Safe LLM Systems via Soft Prompts for On Device Settings

通过软提示蒸馏安全的设备端LLM系统

Motasem Alfarra, Cristina Pinneri, Dana Kianfar, Mohammed Almousa, Christos Louizos

机构 * Qualcomm AI Research(高通人工智能研究院)

专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.LG

AI总结 针对资源受限设备上部署安全大语言模型(LLM)的挑战,提出基于软提示与蒸馏训练的安全对齐方法,在最小化额外计算开销的同时实现优越的安全-有用性权衡。

Comments Accepted to UAI 2026

Journal ref 42nd Conference on Uncertainty in Artificial Intelligence 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08919 2026-06-09 cs.AI cs.CR cs.LG 新提交 62%

Oversight Has a Capacity: Calibrating Agent Guards to a Subjective, Fatiguing Human

监督具有容量:将智能体守卫校准到主观且易疲劳的人类

Emre Turan

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

AI总结 针对LLM智能体动作审批中人类评审者主观且易疲劳的问题,提出将守卫建模为成本敏感的选择性分类,并引入负载感知策略,发现过度监督反而降低安全性,形成倒U型曲线。

Comments 12 pages, 4 figures. Code and interactive demo: https://github.com/turangenesis/headroom

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08512 2026-06-09 cs.CY cs.CL 新提交 62%

Friend or Foe? Language as an ideological switch in open-weight LLMs under Russian disinformation stress

朋友还是敌人?俄罗斯虚假信息压力下开放权重大语言模型中的语言意识形态开关

Anna Małgorzata Kamińska, Tetiana Klynina

机构 * Institute of Culture Studies, University of Silesia in Katowice(文化研究学院,卡托维察大学) University of Texas at Austin(德克萨斯大学奥斯汀分校) National Aviation University(国家航空大学)

专题命中 安全训练 :alignment(abstract);分类 cs.CL、cs.CY

AI总结 本文通过控制实验发现,针对不同语言社区微调的大语言模型在俄罗斯虚假信息压力下,其抵抗能力与预期文化对齐方向相反,揭示了微调悖论。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08021 2026-06-09 cs.LG cs.AI cs.MA 新提交 62%

Semantic Quorum Assurance: Collective Certification for Non-Deterministic AI Infrastructure

语义法定数保证:面向非确定性AI基础设施的集体认证

Jun He, Deying Yu

机构 * OpenKedge.io

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

AI总结 提出语义法定数保证(SQA),一种通过多样化验证者群体和风险自适应法定数谓词,将非确定性LLM代理的不安全操作批准率从18.5%降至0.3%的控制平面原语。

Comments 21 pages, 2 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09371 2026-06-09 cs.AI 新提交 57%

Capability-Aligned Hierarchical Learning for Tool-Augmented LLMs

面向工具增强型大语言模型的能力对齐分层学习

Haotong Yang, Ting Long, Yi Chang

机构 * Jilin University(吉林大学)

专题命中 安全训练 :alignment(abstract);分类 cs.AI

AI总结 提出CAHL方法,利用RLVR联合优化高层规划器与低层执行器,解决分层工具学习中的规划-执行对齐问题,在多个基准上验证有效性。

Comments 14 pages, 5 figures, 6 tables. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08875 2026-06-09 cs.AI 新提交 57%

Can the Environment Speak for Itself? $T^{2}$-GRPO: A Turn-Trajectory Group Relative Policy Optimization for Caregiver Agents

环境能否为自己发声?$T^{2}$-GRPO:一种面向护理智能体的转向-轨迹组相对策略优化

Yutong Song, Jiang Wu, Pengfei Zhang, Wenjun Huang, Honghui Xu, Nikil Dutt, Amir M. Rahmani

机构 * University of California, Irvine(加州大学尔湾分校) Independent Researcher(独立研究员) Kennesaw State University(肯尼索州立大学)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 提出T²-GRPO框架,通过解耦护理强化学习为两个归一化奖励视界,并利用二元硬否决确保安全,从环境状态转换中提取密集转向级奖励,结合轨迹级评估,有效处理即时患者反馈、长期护理结果和安全约束。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08800 2026-06-09 cs.AI 新提交 57%

Bridging Expert Knowledge and Automated Feature Engineering via Self-Evolution

通过自进化桥接专家知识与自动化特征工程

Varun Khurana, Vijval Ekbote, Vashu Chauhan, Yaman Kumar Singla, Rajiv Ratn Shah, Balaji Krishnamurthy

机构 * Adobe Media and Data Science Research(Adobe媒体与数据科学研究) IIIT-Delhi(德里印度理工学院)

专题命中 安全训练 :alignment(abstract);分类 cs.AI

AI总结 提出FEST方法,结合双流特征生成、语义去重和树引导迭代进化,从原始文本和图像中发现可审计特征,在品牌分类等任务中平均提升4.2个百分点,并实现60-80%的专家特征覆盖。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08596 2026-06-09 cs.AI cs.HC 新提交 57%

Distilling LLM Reasoning into an Interpretable Policy Tree for Human-AI Collaboration

将LLM推理蒸馏为可解释的策略树用于人机协作

Beiwen Zhang, Yongheng Liang, Guowei Zou, Haitao Wang, Hejun Wu

机构 * Sun Yat-sen University(中山大学)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 提出Co-pi-tree方法,通过将大语言模型推理蒸馏为可执行策略树,在Overcooked-AI中平均奖励提升35.4%,同时减少77.7%的LLM查询和97.1%的测试延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08137 2026-06-09 eess.SY cs.SY 新提交 50%

A Barrier-Modulated Architecture for Safe Affine Formation Control in Second-Order Multi-Agent Systems

面向二阶多智能体系统安全仿射编队控制的屏障调制架构

Ashik Abrar Naeem, Mohammad Ariful Haque

专题命中 安全训练 :safety(abstract)

AI总结 提出一种结合高阶控制屏障函数与自适应动态规划的屏障调制架构,实现二阶多智能体系统的安全仿射编队控制,通过分析型与数据驱动两种安全控制器保证绝对避碰和一致最终有界编队跟踪误差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08035 2026-06-09 cs.CV 新提交 50%

DyCo-RL: Dynamic Cross-Modal Coordination for Visual Reasoning

DyCo-RL: 用于视觉推理的动态跨模态协调

Hangui Lin, Yan Shu, Zhengyang Liang, Chi Liu, Xiangrui Liu, Minghao Qin, Teng Long, Zheng Liu, Nicu Sebe

机构 * University of Trento(特伦托大学) BAAI(北京智源人工智能研究院) Singapore Management University(新加坡管理大学) IQuest Research

专题命中 安全训练 :alignment(abstract)

AI总结 提出DyCo-RL,通过Fisher-Rao测地距离量化模态内注意力转移,实现动态跨模态协调,并利用对齐引导的优势重加权优化策略,提升多模态大模型在视觉推理中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 越狱攻击 3 篇

2606.07706 2026-06-09 cs.CR cs.AI 新提交 85%

MLingualFC: Evaluating Jailbreak Vulnerabilities in Multilingual Vision-Language Models

MLingualFC: 评估多语言视觉语言模型中的越狱漏洞

Rishabh Makwana, Mamta, Deeksha Varshney, Oana Cocarascu

机构 * Dwarkadas Jivanlal Sanghvi College of Engineering(达沃拉斯·吉万拉尔·桑格维工程学院) King’s College London(伦敦国王学院) Indian Institute of Technology Jodhpur(印度理工学院朱罗普尔)

专题命中 越狱攻击 :jailbreak(title,abstract);alignment(abstract);safety(abstract);分类 cs.AI

AI总结 提出多语言多模态基准MLingualFC,使用流程图编码有害指令评估多语言VLM的越狱漏洞,发现拉丁语系攻击成功率显著高于非拉丁语系,揭示安全机制跨语言泛化不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07970 2026-06-09 cs.CL cs.AI 新提交 73%

Defending Against Malicious Finetuning by Scaling Train-time Adversarial Attacks

通过扩展训练时对抗攻击防御恶意微调

Haoming Wen, Shi Chen, Qingyu Shi, Siyuan Liu, Minrui Luo, Jingzhao Zhang, Tianxing He

机构 * Xiongan AI Institute(雄安人工智能研究院) Institute for Interdisciplinary Information Sciences, Tsinghua University(清华大学交叉信息研究院) Shanghai Qi Zhi Institute(上海期智研究院)

专题命中 越狱攻击 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI

AI总结 针对全参数微调的安全威胁,提出基于对抗训练和双层优化的Patcher方法,通过扩展对抗循环中的优化步数增强防御,并设计并行算法提升效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09084 2026-06-09 cs.CR cs.AI 新提交 57%

Context-Fractured Decomposition Attacks on Tool-Using LLM Agents: Exploiting Artifact Provenance Gaps

上下文碎片化解构攻击:利用工具使用LLM代理的工件来源鸿沟

Xiaofeng Lin, Yukai Yang, Daniel Guo, Sahil Arun Nale, Charles Fleming, Guang Cheng

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 越狱攻击 :jailbreak(abstract);分类 cs.AI

AI总结 针对工具使用LLM代理,提出上下文碎片化解构(CFD)攻击,利用跨上下文工件来源鸿沟实现多步越狱,成功率提升高达28.3个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 红队测试 3 篇

2606.09701 2026-06-09 cs.CL cs.AI cs.LG 新提交 88%

Learning to Attack and Defend: Adaptive Red Teaming of Language Models via GRPO

学习攻击与防御:通过GRPO对语言模型进行自适应红队测试

Blake Bullwinkel, Eugenia Kim, Amanda Minnich, Mark Russinovich

机构 * Microsoft AI Red Team(微软AI红队) Microsoft Azure(微软Azure)

专题命中 红队测试 :red teaming(title,abstract);DPO(abstract,abstract_cn);safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出AdvGRPO框架,通过密集多通道奖励和分离优势归一化实现GRPO在攻击者-防御者联合优化中的稳定训练,产生高效可迁移攻击,防御者优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09408 2026-06-09 cs.CY cs.AI cs.HC 新提交 73%

Can Data Work be Reparative?

数据工作能否具有修复性?

Srravya Chandhiramowuli, Ding Wang, Alex Taylor

机构 * University of Edinburgh(爱丁堡大学) Google Research(谷歌研究院)

专题命中 红队测试 :safety(abstract);red teaming(abstract);分类 cs.AI、cs.CY

AI总结 通过民族志研究,探讨公民科技倡议如何从女性主义视角协作构建安全数据集,旨在将数据工作重塑为修复与补救的场所,并分析其中遇到的挑战与张力。

Comments To be presented at ACM FAccT, Montréal, Canada, June 25 to June 28, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07833 2026-06-09 cs.CR cs.AI 新提交 70%

Beyond Pass/Fail: Using Process Mining to Understand How LLMs Resist (and Fail) Red Team Attacks

超越通过/失败:使用过程挖掘理解LLM如何抵抗(和失败)红队攻击

Zvi Topol

机构 * MuyVentive LLC

专题命中 红队测试 :jailbreak(abstract);red teaming(abstract);分类 cs.AI

AI总结 提出将过程挖掘应用于红队攻击轨迹,通过分析事件日志提取直接跟随图和状态转移矩阵,揭示GPT-OSS和Llama 3.3在防御结构上的差异,发现传统攻击成功率指标无法捕捉的模型防御模式。

详情

展开后加载摘要…

URL PDF HTML 收藏