CyberGym: Evaluating AI Agents' Real-World Cybersecurity Capabilities at Scale
CyberGym:大规模评估AI代理的真实世界网络安全能力
机构 * UC Berkeley(加州大学伯克利分校)
AI总结 CyberGym通过大规模基准测试评估AI代理的网络安全能力,发现其在漏洞复现任务中表现有限,同时发现34个零日漏洞和18个历史未完成补丁,凸显其作为网络安全评估和实际影响平台的价值。
作者
AI / Security
CyberGym:大规模评估AI代理的真实世界网络安全能力
机构 * UC Berkeley(加州大学伯克利分校)
AI总结 CyberGym通过大规模基准测试评估AI代理的网络安全能力,发现其在漏洞复现任务中表现有限,同时发现34个零日漏洞和18个历史未完成补丁,凸显其作为网络安全评估和实际影响平台的价值。