arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-05-11 至 2026-05-11 共收录 1 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 提示注入 1 篇

2605.07269 2026-05-11 cs.CL cs.LG 81%

MIPIAD: Multilingual Indirect Prompt Injection Attack Defense with Qwen -- TF-IDF Hybrid and Meta-Ensemble Learning

MIPIAD: 多语言间接提示注入攻击防御与Qwen-TF-IDF混合及元集成学习

Al Muhit Muhtadi, Mostafa Rifat Tazwar

机构 * Bangladesh University of Engineering and Technology(孟加拉工程与技术大学)

专题命中 提示注入 :prompt injection(title,abstract);分类 cs.CL、cs.LG

AI总结 本文提出MIPIAD框架,结合Qwen2.5-1.5B微调序列分类器、TF-IDF特征和元集成学习,通过合成基准测试在英文和孟加拉文上实现高准确率的攻击检测,有效减少跨语言差距。

详情

展开后加载摘要…

URL PDF HTML 收藏