arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-06-04 至 2026-06-04 共收录 6 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 越狱攻击 6 篇

2605.20654 2026-06-04 cs.LG cs.AI 86%

REFLECTOR: Internalizing Step-wise Reflection against Indirect Jailbreak

REFLECTOR: 内化逐步反思以对抗间接越狱

Jiachen Ma, Jiawen Zhang, Xiangtian Li, Bo Zou, Chaochao Lu, Chao Yang

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 越狱攻击 :jailbreak(title,abstract);alignment(abstract);safety(abstract);分类 cs.AI、cs.LG

AI总结 提出REFLECTOR两阶段框架,通过教师引导生成反思数据并进行监督微调,再结合强化学习内化自主反思能力,在复杂间接攻击下实现超过90%的防御成功率,同时提升通用性能。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06911 2026-06-04 cs.CR cs.AI 85%

TamperBench: Systematically Stress-Testing LLM Safety Under Fine-Tuning and Tampering

TamperBench:系统化压力测试微调和篡改下的LLM安全性

Saad Hossain, Tom Tseng, Punya Syon Pandey, Samanvay Vajpayee, Matthew Kowal, Nayeema Nonta, Samuel Simko, Stephen Casper, Zhijing Jin, Kellin Pelrine, Sirisha Rambhatla

机构 * Critical ML Lab Waterloo Canada(Waterloo大学Critical ML实验室) FAR.AI Berkeley USA(伯克利美国FAR.AI公司) University of Toronto Toronto Canada(多伦多大学) University of Waterloo Waterloo Canada(Waterloo大学) ETH Zürich Zürich Switzerland(苏黎世联邦理工学院) MIT CSAIL Cambridge USA(麻省理工学院CSAIL实验室) University of Toronto, MPI, EuroSafeAI, Vector Institute Toronto Canada(多伦多大学、马克斯·普朗克研究所、EuroSafeAI、Vector Institute) Critical ML Lab University of Waterloo Waterloo Canada(Waterloo大学Critical ML实验室)

专题命中 越狱攻击 :safety(title,abstract);alignment(abstract);jailbreak(abstract);分类 cs.AI

AI总结 提出统一框架TamperBench,通过系统化超参数扫描评估21个开源LLM在9种篡改威胁下的安全性和实用性,发现越狱微调是最严重攻击,当前对齐阶段防御基本失效。

Comments 25 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04612 2026-06-04 cs.CL 70%

Hybrid Adversarial Defence for Natural Language Understanding Tasks

混合对抗防御用于自然语言理解任务

Manar Abouzaid, Yang Wang, Chenghua Lin, Stuart E. Middleton

机构 * School of Electronics and Computer Science, University of Southampton, UK(南安普顿大学电子与计算机科学学院) Department of Computer Science, University of Manchester, UK(曼彻斯特大学计算机科学系)

专题命中 越狱攻击 :jailbreak(abstract);prompt injection(abstract);分类 cs.CL

AI总结 提出一种结合熵、不确定性和几何特征的混合防御框架,在多个自然语言理解数据集上同时提升了干净任务性能和对抗鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.01576 2026-06-04 cs.CV 69%

Robust-LLaVA: On the Effectiveness of Large-Scale Robust Image Encoders for Multi-modal Large Language Models

Robust-LLaVA:大规模鲁棒图像编码器对多模态大语言模型的有效性

Hashmat Shadab Malik, Fahad Shamshad, Muzammal Naseer, Karthik Nandakumar, Fahad Khan, Salman Khan

机构 * Mohamed bin Zayed University of AI(Mohamed bin Zayed人工智能大学) Khalifa University(卡利法大学) Michigan State University(密歇根州立大学) Australian National University(澳大利亚国立大学)

专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);trustworthy(comments)

AI总结 本文提出利用大规模对抗预训练的图像分类模型替代CLIP编码器,以增强多模态大语言模型对视觉对抗扰动的鲁棒性,在无需额外对抗训练的情况下,在视觉问答、图像描述和越狱攻击任务中取得显著鲁棒性提升。

Comments Accepted at Trustworthy FMs Workshop Trust Before Use: Building Foundation Models that You Can Trust (ICCVW) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04027 2026-06-04 cs.CR cs.AI 57%

MaskForge: Structure-Aware Adaptive Attacks for Jailbreaking Diffusion Large Language Models

MaskForge:用于越狱扩散大语言模型的结构感知自适应攻击

Yingzi Ma, Zhengyue Zhao, Xiaogeng Liu, Minhui Xue, Yue Zhao, Chaowei Xiao

机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校) Johns Hopkins University(约翰霍普金斯大学) University of Southern California(南加州大学) Responsible AI Research (RAIR) Centre, The University of Adelaide(阿德莱德大学负责任人工智能研究中心)

专题命中 越狱攻击 :safety(abstract);分类 cs.AI

AI总结 提出MaskForge,一种全黑盒自适应攻击方法,通过优化结构模式库实现扩散大语言模型的红队测试,平均攻击成功率达79.3%。

Comments 28 pages, 7 figures, 11 tables. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15741 2026-06-04 cs.CV 50%

HyperDiT: Hyper-Connected Transformers for High-Fidelity Pixel-Space Diffusion

HyperDiT: 用于高保真像素空间扩散的超连接Transformer

Yu He, Lichen Ma, Zipeng Guo, Xinyuan Shan, Jingling Fu, Dong Chen, Junshi Huang, Yan Li

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 越狱攻击 :alignment(abstract)

AI总结 针对像素空间扩散模型中全局语义与细粒度细节难以兼顾的粒度困境,提出HyperDiT框架,通过超连接跨尺度交互和尺度感知旋转位置编码,结合预训练视觉基础模型的密集语义,在像素空间实现高保真生成,在ImageNet 256×256上取得1.56的SoTA FID。

详情

展开后加载摘要…

URL PDF HTML 收藏