Distilling Knowledge from Large Language Models into Lightweight Reinforcement Learning Agents for Autonomous Cyber Operations
将大型语言模型中的知识蒸馏为用于自主网络操作的轻量级强化学习智能体
机构 * Royal Military College of Canada(加拿大皇家军事学院) ; Defence Research and Development Canada(加拿大国防研究与发展部) ; Polytechnique Montreal(蒙特利尔理工学院)
专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(summary_cn,abstract);分类 cs.LG
AI总结 该研究针对自主网络操作中强化学习智能体训练不稳定的问题,通过提示工程证明80亿参数网络安全LLM性能优于基线RL智能体,再经在线策略蒸馏将其防御知识迁移至仅64910参数的轻量级RL智能体,为前沿网络安全模型的实用化提供了可行方案。