Reasoning-targeted Jailbreak Attacks on Large Reasoning Models via Semantic Triggers and Psychological Framing
通过语义触发和心理框架针对大推理模型的推理定向劫持攻击
机构 * College of Intelligence and Computing(智能与计算学院) ; School of New Media and Communication(新媒体与传播学院) ; Shanghai Key Laboratory of Data Science(上海数据科学 key laboratory)
专题命中 越狱攻击 :jailbreak(title,abstract);alignment(abstract);safety(abstract);分类 cs.AI、cs.LG
AI总结 本文提出PRJA框架,通过语义触发选择模块和心理指令生成模块,解决大推理模型推理过程中的安全问题,实验显示在五个问答数据集上攻击成功率达83.6%。