arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-04-10 至 2026-04-10 共收录 2 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 提示注入 2 篇

2601.04666 2026-04-10 cs.AI cs.CR 79%

Know Thy Enemy: Securing LLMs Against Prompt Injection via Diverse Data Synthesis and Instruction-Level Chain-of-Thought Learning

知彼者智:通过多样化数据合成和指令级推理学习增强大语言模型抗提示注入能力

Zhiyuan Chang, Mingyang Li, Yuekai Huang, Ziyou Jiang, Xiaojun Jia, Qian Xiong, Junjie Wang, Zhaoyang Li, Qing Wang

机构 * State Key Laboratory of Complex System Modeling and Simulation Technology(复杂系统建模与仿真技术国家重点实验室) Science and Technology on Integrated Information System Laboratory, Institute of Software Chinese Academy of Sciences(中国科学院软件研究所综合信息系统技术国家级重点实验室) University of Chinese Academy of Sciences(中国科学院大学) Nanyang Technological University(南洋理工大学) Beijing Forestry University(北京林业大学)

专题命中 提示注入 :prompt injection(title,abstract);分类 cs.AI

AI总结 本文提出InstruCoT方法,通过多样化数据合成和指令级推理学习提升大语言模型对提示注入攻击的防御能力,实验表明其在行为偏差、隐私泄露和有害输出方面显著优于基线方法。

Comments 19 pages, 6 figures; accepted by ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.20472 2026-04-10 cs.CR 78%

Robustness via Referencing: Defending against Prompt Injection Attacks by Referencing the Executed Instruction

通过引用实现鲁棒性:通过引用已执行的指令来防御提示注入攻击

Yulin Chen, Haoran Li, Yuan Sui, Yue Liu, Yufei He, Xiaoling Bai, Chi Fei, Yabo Li, Haozhe Ma, Yangqiu Song, Bryan Hooi

专题命中 提示注入 :prompt injection(title,abstract)

AI总结 本文提出通过利用LLM的指令遵循能力来防御提示注入攻击,通过生成包含答案和对应指令引用的响应,有效过滤非原始指令关联的答案,实验表明其在降低攻击成功率方面优于现有方法。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏