Beyond the Prompt: Jailbreaking Function-Calling LLMs via Simulated Moderation Traces
超越提示:通过模拟审核轨迹越狱函数调用大语言模型
专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);分类 cs.AI
AI总结 针对函数调用大语言模型的结构性漏洞,提出基于模拟审核轨迹的黑盒攻击框架SMT,通过多轮交互绕过安全约束,在多个商业模型上实现高攻击成功率。
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
超越提示:通过模拟审核轨迹越狱函数调用大语言模型
专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);分类 cs.AI
AI总结 针对函数调用大语言模型的结构性漏洞,提出基于模拟审核轨迹的黑盒攻击框架SMT,通过多轮交互绕过安全约束,在多个商业模型上实现高攻击成功率。
一年后...伤害持续,但我们仍在!
机构 * Northeastern University(东北大学) ; Florida International University(佛罗里达国际大学)
专题命中 越狱攻击 :safety(abstract);分类 cs.CL、cs.AI
AI总结 研究评估六种商用大语言模型在16种DSM-5条件下的安全性,发现除自杀和自伤外,其他精神障碍(如进食障碍、物质使用障碍、重度抑郁障碍)的防护失败率高达100%,呼吁按临床条件定义伤害类别并实施防护。
Comments 20 pages, 8 tables
ReShift: 视觉-语言模型上基于“啊哈时刻”驱动的推理级后门攻击
专题命中 越狱攻击 :safety(abstract)
AI总结 提出ReShift框架,通过“啊哈时刻”驱动推理轨迹重定向,结合PRDC管道和SRJO策略实现隐蔽的后门攻击,理论保证熵反弹与轨迹发散的联系。
Comments ECCV 2026