arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-08-07 至 2026-08-07 共收录 3 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 越狱攻击 3 篇

2512.14751 2026-08-07 cs.CR cs.AI 版本更新 79%

One Leak Away: How Pretrained Model Exposure Amplifies Jailbreak Risks in Finetuned LLMs

一个泄漏:预训练模型暴露如何放大微调LLM中的劫持风险

Yixin Tan, Zhe Yu, Rui Wen, Jun Sakuma

机构 * Institute of Science Tokyo(东京科学研究所) Riken AIP(理化学研究所AIP)

专题命中 越狱攻击 :jailbreak(title,abstract);分类 cs.AI

AI总结 本研究揭示了预训练模型暴露如何放大微调LLM的劫持风险,提出PGP攻击方法,证明了预训练到微调过程中存在的安全漏洞。

Comments This paper has been accepted to the ACM SIGSAC Conference on Computer and Communications Security (ACM CCS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18056 2026-08-07 cs.CL q-bio.GN 版本更新 70%

An Early Warning of Emerging Biosecurity Risks in Frontier LLMs

前沿大语言模型中新兴生物安全风险的早期预警

Zhida He, Xia Hu, Baichen Le, Chunxiao Li, Jiajia Li, Lijun Li, Chaochao Lu, Jing Shao, Youbang Sun, Hua Tang, Xiang Wang, Xiao Wang, Xiaoyu Wen, Tong Wu, Jia Xu, Peng Yu, Shu Yu, Jie Zhang, Qiaosheng Zhang, Yi Zhang, Xing-Ming Zhao, Tianhang Zheng, Ziyuan Zhou

专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);分类 cs.CL

AI总结 研究前沿大语言模型生物安全风险,开发Intern-BioBreaker及综合框架,通过生成提示、实验验证评估风险。发现文本级安全与模型风险有差距,模型存在越狱漏洞,能生成有害序列且可物理实现,强调加强相关安全机制。

Comments 22 pages, 7 figures, authors are listed alphabetically by surname; update Figure 7 on page 15 due to arXiv format requirements

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03070 2026-08-07 cs.CR cs.AI cs.CL 版本更新 62%

AI Security Leaderboard: Methodology, Results and Minimal Standard

AI安全排行榜:方法、结果与最低标准

Jasper Timm, Lukas Struppek, Ziwei Xu, Grace Cheong, Oscar Mata, Dan Zhao, Mick Yang, Isadora De Andrade, Xiaojun Jia, Yiming Li, Samuel Bauer, Heather McIntyre, Adam Gleave, Edward Yee, Kellin Pelrine

专题命中 越狱攻击 :jailbreak(abstract);分类 cs.CL、cs.AI

AI总结 本研究推出AI安全防护最低标准V1.0,测试Claude Fable5等四款模型的越狱鲁棒性,发现模型间防御能力差异大,部分模型未出现通用越狱,可通过现有技术缩小防御差距。

详情

展开后加载摘要…

URL PDF HTML 收藏