DepthFirstLabs发布dfbench 网络安全基准测试工具
今天我们宣布推出 dfbench,这是我们开发的网络安全基准测试,用于评估前沿模型和智能体系统。
几周前我们曾发文表示,现在是时候把 CyberGym Level 1 从衡量网络安全能力的主要标准中毕业,转而采用更新的基准测试了。
最终所有公开基准都会达到饱和:Level 1 现在已经饱和,而且它也无法很好地代表应用安全(AppSec)团队关心的问题。
dfbench 是针对前沿模型开展开放式防御安全工作的预留评估集。它衡量智能体能否以可持续成本提供广泛、可落地的安全覆盖。
这要求覆盖范围足够大,能领先于漏洞利用;精确度足够高,让安全团队可以根据智能体的发现采取行动;同时效率足够高,能让覆盖保持更新。
我们获得了所有提供商相关可信访问项目的权限,因此可以在运行这些评估时不会遇到模型拒答。
GPT 5.6 Sol 和 Luna 在检测方面都表现强劲,Luna 以它的质量来说成本极低。Grok 4.5 在性能和成本之间提供了不错的中间地带。
验证和差异分析结果表明,前沿模型仍有很大的改进空间。
展望未来,我们计划与安全社区密切合作,在前沿模型向公众发布之前,对它们的网络安全能力进行安全评估。
本文由 AI 翻译自英文原帖,技术名词保留英文。
查看 X 原帖