CyberThreat-Eval: Can Large Language Models Automate Real-World Threat Research?
CyberThreat-Eval: 大型语言模型能否自动化现实中的威胁研究?
机构 * Microsoft Research(微软研究院) ; Microsoft(微软)
AI总结 CyberThreat-Eval通过专家标注的基准测试评估大型语言模型在威胁情报工作流程中的实际表现,揭示其在复杂细节处理和信息区分上的不足。
Comments Accepted at TMLR
Journal ref Transactions on Machine Learning Research (2025), ISSN 2835-8856