Do LLMs Know Their Vulnerable Scenarios?
大语言模型知道它们的脆弱场景吗?
机构 * Renmin University of China(中国人民大学) ; Xi’an Jiaotong University(西安交通大学) ; University of Science and Technology of China(中国科学技术大学) ; Wuhan University(武汉大学) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)
AI总结 研究大语言模型在特定场景下的脆弱性,提出Concept2Scenario框架,通过实例化概念空间、归因拒绝抑制等步骤发现脆弱场景,在多模型和基准测试中验证,能提高攻击成功率、可迁移且组合效果优。
Comments 19 pages, 11 Figures, Under Review