Minerva: Reinforcement Learning with Verifiable Rewards for Cyber Threat Intelligence LLMs
Minerva: 为网络威胁情报LLM采用可验证奖励的强化学习
机构 * Rochester Institute of Technology(罗切斯特理工学院) ; University of Texas at El Paso(德克萨斯大学埃尔帕索分校) ; Florida Atlantic University(佛罗里达Atlantic大学)
专题命中 指令微调 :LLM(title_cn);SFT(abstract,abstract_cn);large language model(abstract);language model(abstract)
AI总结 本文提出Minerva,一种统一的数据集和训练流程,用于多类网络威胁情报子任务,通过任务特定验证器评分结构化输出。MinervaRL通过轻量自训练机制生成额外验证轨迹并反向蒸馏至模型,提升性能。