arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-08-06 至 2026-08-06 共收录 5 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 越狱攻击 5 篇

2608.04034 2026-08-06 cs.CR 新提交 82%

A Multimodal Automatic Redteaming Evaluation based on Atomic Jailbreak Strategy Decoupling and Combination

基于原子越狱策略解耦与组合的多模态自动红队评估

Shiji Zhao, Yuxuan Zhou, Chen Xiong, Dongxian Wu, Yang Bai, Xun Chen

专题命中 越狱攻击 :jailbreak(title,abstract);safety(abstract)

AI总结 针对现有多模态越狱攻击的两大挑战,本文提出HACA方法,构建多模态原子越狱策略空间,对5种主流MLLMs平均攻击成功率达95.48%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02422 2026-08-06 cs.CR cs.AI 版本更新 70%

Dynamic Jailbreaking Attack

动态目标攻击

Kedong Xiu, Yunhan Yang, Churui Zeng, Tianhang Zheng, Xinzhe Huang, Di Wang, Puning Zhao, Zhan Qin, Kui Ren

机构 * The State Key Laboratory of Blockchain and Data Security, Zhejiang University(区块链与数据安全国家重点实验室,浙江大学) Hangzhou High-Tech Zone (Binjiang) Institute of Blockchain and Data Security(杭州高新技术区(滨江)区块链与数据安全研究院) Nanyang Technological University(南洋理工大学) King Abdullah University of Science and Technology(国王阿卜杜勒阿齐兹科技大学) SUN YAT-SEN UNIVERSITY(孙中山大学)

专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);分类 cs.AI

AI总结 动态目标攻击通过利用目标模型自身响应作为自适应目标,提高了对抗攻击的成功率和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.15560 2026-08-06 cs.CR cs.AI cs.LG 交叉投稿 62%

Temporal Context Awareness: A Defense Framework Against Multi-turn Manipulation Attacks on Large Language Models

时序上下文感知:一种针对大型语言模型多轮操纵攻击的防御框架

Prashant Kulkarni, Assaf Namer

专题命中 越狱攻击 :safety(abstract);分类 cs.AI、cs.LG

AI总结 针对LLMs易受多轮操纵攻击的问题,本文提出TCA框架,通过分析语义漂移等实现防御,初步评估显示其能识别传统方法遗漏的微妙操纵模式,为对话式AI系统提供安全保障。

Comments 6 pages, 2 figures, IEEE CAI

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04322 2026-08-06 cs.CL 新提交 57%

DataRx: Missingness-Aware Sampling for Safer Large Language Model Task-Specific Fine-Tuning

DataRx:面向更安全的大语言模型任务特定微调的缺失感知采样方法

Junbo Zhang, Qianli Zhou, Xinyang Deng, Wen Jiang

机构 * Northwestern Polytechnical University(西北工业大学)

专题命中 越狱攻击 :safety(abstract);分类 cs.CL

AI总结 本文提出DataRx缺失感知采样方法,通过高维隐表示量化安全信号差距,仅用1% BeaverTails安全样本,即可大幅降低Llama3-8B-Instruct的攻击成功率,还可与现有安全数据合成方法结合提升防御效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04469 2026-08-06 cs.CR cs.MA 版本更新 50%

Cross-Layer Semantic Flow Reconstruction for Attack Detection in Agentic Systems

超越输入防护:为执行感知攻击检测重建跨代理语义流

Qizhi Cai, Yangyang Wei, Zhipeng Chen, Shouling Ji, Zhenyuan Li

专题命中 越狱攻击 :prompt injection(abstract)

AI总结 SysName通过重建跨代理语义流,实现执行感知的攻击检测,有效识别多种复合攻击向量,提升多代理系统安全性。

Comments 16 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏