FENCE: A Financial and Multimodal Jailbreak Detection Dataset
FENCE:一个金融和多模态越狱检测数据集
专题命中 越狱攻击 :jailbreak(title,abstract);分类 cs.CL、cs.AI
AI总结 针对金融领域多模态越狱检测资源匮乏的问题,提出FENCE数据集,包含韩英双语文本和图像,用于训练和评估检测器,实验表明基线检测器准确率达99%。
Comments lrec 2026 accepted paper
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
FENCE:一个金融和多模态越狱检测数据集
专题命中 越狱攻击 :jailbreak(title,abstract);分类 cs.CL、cs.AI
AI总结 针对金融领域多模态越狱检测资源匮乏的问题,提出FENCE数据集,包含韩英双语文本和图像,用于训练和评估检测器,实验表明基线检测器准确率达99%。
Comments lrec 2026 accepted paper
更聪明的破坏者,更好的修复者:线性多智能体工作流中的规模与安全性
机构 * University of California, Berkeley(加州大学伯克利分校) ; Stanford University(斯坦福大学)
专题命中 越狱攻击 :safety(abstract);分类 cs.LG
AI总结 研究模型规模对线性多智能体工作流安全性的影响,发现大模型更易执行恶意指令,但轻量级修复阶段可恢复性能,表明线性结构在适当校正下具有鲁棒性。
Comments 16 pages (4 are main text), 2 figures, 6 tables. Accepted to the AIWILD Workshop at ICML 2026