SHE: Trajectory-driven Safety Harness Evolution for LLM Agents
SHE:面向大语言模型智能体的轨迹驱动安全管控机制演化
机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; Fudan University(复旦大学) ; Shanghai Jiao Tong University(上海交通大学) ; The Hong Kong University of Science and Technology(香港科技大学)
AI总结 本研究提出SHE框架,将LLM智能体的安全管控机制分解为四个构件并引入归因引导演化循环,在Agent-SafetyBench上使攻击成功率降低3.1倍,还具备泛化与跨模型迁移能力。
Comments Project: https://github.com/RainbowQTT/SHE