Harmless Yet Harmful: Neutral Prompting Attacks for Stealthy Hallucination Steering in Agent Skills
无害却有害:针对Agent技能中隐蔽幻觉引导的中性提示攻击
机构 * Department of Computer Science(计算机科学系) ; National Yang Ming Chiao Tung University(阳明交通大学) ; Department of Electronics and Electrical Engineering(电子与电气工程系) ; School of Computing(计算学院) ; Institute of Science Tokyo(东京科学研究所)
专题命中 软件智能体 :agent(title,title_cn);分类 cs.LG
AI总结 本文提出中性提示攻击(NPA),通过语义上看似无害的指令(如鼓励想象和详尽性)增加代码生成Agent的包幻觉倾向,从而引入软件供应链风险,并评估了其对多种编码LLM的有效性和逃避防御的能力。
Comments under review