Conflicts Make Large Reasoning Models Vulnerable to Attacks
冲突使大型推理模型容易受到攻击
机构 * International Digital Economy Academy(国际数字经济学院) ; The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; The City University of Hong Kong(香港城市大学) ; DataArc Tech
专题命中 规划推理 :reasoning(title,abstract);分类 cs.AI
AI总结 研究探讨了冲突如何影响大型推理模型的安全性,发现冲突显著增加攻击成功率,揭示了安全表示在冲突下的变化,强调需更深入的对齐策略以确保模型的鲁棒性和可信度。