When Compression Becomes an Attack Surface: Black-Box Attacks on Prompt-Compressed LLM Agents
当压缩成为攻击面:针对提示压缩的LLM智能体的黑盒攻击
机构 * The Hong Kong University of Science and Technology(香港科学与技术大学)
AI总结 提出当可信与不可信输入共享压缩预算时,攻击者可通过扰动不可信输入导致压缩器丢弃关键证据或安全护栏,并设计黑盒攻击COMA,平均攻击成功率达0.71。