Route to Rome Attack: Directing LLM Routers to Expensive Models via Adversarial Suffix Optimization
通往罗马的攻击:通过对抗性后缀优化引导LLM路由器选择昂贵模型
机构 * Key Laboratory of Symbolic Computation and Knowledge Engineering, MoE, Jilin University(符号计算与知识工程重点实验室,MoE,吉林大学) ; The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))
AI总结 本文提出R$^2$A方法,通过对抗性后缀优化误导黑盒LLM路由器选择昂贵模型,解决现有攻击在黑盒场景下的不足。
Journal ref ACL 2026 Main Conference