arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-04-20 至 2026-04-20 共收录 2 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 越狱攻击 2 篇

2604.15725 2026-04-20 cs.LG cs.AI 86%

Reasoning-targeted Jailbreak Attacks on Large Reasoning Models via Semantic Triggers and Psychological Framing

通过语义触发和心理框架针对大推理模型的推理定向劫持攻击

Zehao Wang, Lanjun Wang

机构 * College of Intelligence and Computing(智能与计算学院) School of New Media and Communication(新媒体与传播学院) Shanghai Key Laboratory of Data Science(上海数据科学 key laboratory)

专题命中 越狱攻击 :jailbreak(title,abstract);alignment(abstract);safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出PRJA框架,通过语义触发选择模块和心理指令生成模块,解决大推理模型推理过程中的安全问题,实验显示在五个问答数据集上攻击成功率达83.6%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24672 2026-04-20 cs.CL 85%

TRIDENT: Enhancing Large Language Model Safety with Tri-Dimensional Diversified Red-Teaming Data Synthesis

TRIDENT:通过三维多样化红队数据合成增强大语言模型安全性

Xiaorui Wu, Xiaofeng Mao, Fei Li, Xin Zhang, Xuanhong Li, Chong Teng, Donghong Ji, Zhuang Li

机构 * Key Laboratory of Aerospace Information Security and Trusted Computing, Ministry of Education, School of Cyber Science and Engineering, Wuhan University(航空信息安全与可信计算重点实验室,教育部,网络安全工程学院,武汉大学) Ant Group(蚂蚁集团) Ant International(蚂蚁国际) School of Computing Technologies, Royal Melbourne Institute of Technology(计算技术学院,皇家墨尔本理工学院)

专题命中 越狱攻击 :safety(title,abstract);alignment(abstract);jailbreak(abstract);分类 cs.CL

AI总结 TRIDENT通过三维分析框架和自动化流水线生成涵盖词汇多样性、恶意意图和突破战术的多样化数据,提升大语言模型安全性,实验显示在有害内容评分和攻击成功率上有显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏