Metis: Learning to Jailbreak LLMs via Self-Evolving Metacognitive Policy Optimization
Metis: 通过自进化元认知策略优化学习 jailbreak LLMs
机构 * University of Science and Technology of China(中国科学技术大学) ; Institute of Artificial Intelligence (TeleAI), China Telecom(人工智能研究院(TeleAI),中国电信)
专题命中 越狱攻击 :jailbreak(title,title_cn);alignment(abstract);safety(abstract);red teaming(abstract)
AI总结 本文提出Metis框架,通过将jailbreaking重新表述为对抗性部分可观测马尔可夫决策过程中的推理时间策略优化,以提高对抗性测试的效率和效果,同时通过结构化反馈和透明推理轨迹提升可解释性,实验表明Metis在多种模型上均表现出更高的攻击成功率和更低的token成本。
Comments Accepted to the 43rd International Conference on Machine Learning (ICML 2026)