超越模型本身:AI 安全扫描工具基准测试对比(Codex Security vs Claude Security vs Nebu)

导语:星云安全(Nebu 开发商)于 9 月 1 日发布自家基准测试研究,用 76 个开源项目中的已知漏洞作为真值基准,对比自家 Nebu 与 OpenAI Codex Security、Anthropic Claude Security 三款 AI 安全扫描工具。结果最具争议的一点:用 GPT-5.4 加自有编排,Nebu 达到 80% 漏洞覆盖率,匹配 Codex Security 最佳成绩,成本与时间却只有其零头。


一、立场先摆清楚

在逐条解析之前,必须先把这层窗户纸捅破:这是一篇厂商自研基准测试,Nebu 的母公司 Nebula Security 同时是测试设计方与被测对象。三方对比中,Nebu 是东道主,Codex Security 与 Claude Security 是客场作战。

这不是说测试有假——文末明确标注了”未用任何基准数据改进流水线、未刻意剔除不利用例、网络访问全程关闭”——但解读数据时必须带着红队视角:测什么、不测什么、用什么基线,全是东道主说了算。

厂商自家基准可读,但要带脑子读。下面进入正题。


二、测试设计

2.1 真值基准

测试用 76 个开源项目中的已知漏洞(ground truth,业内称为”真值基准”) 作为标尺——也就是事先知道答案,让 AI 工具去找,看能命中多少。

2.2 模型阵容

  • OpenAI 阵营:GPT-5.4 与 GPT-5.6-Sol(GPT-5 系列内部分支)
  • Anthropic 阵营:Opus 5(Anthropic 官方称其漏洞识别能力对标 Fable 5,与 Mythos 同源模型)

文中明确说明未拿到 Mythos 的访问权限,故用 Opus 5 替代。

2.3 四组被测对象

组别配置档位
Codex Security(GPT-5.4)标准扫描 + 高/x高推理、深度扫描 + x高推理
Codex Security(GPT-5.6-Sol)标准扫描 + 高/x高推理、深度扫描 + x高推理
Claude Security(Opus 5)高/最高扫描 + 高/x高推理、最高扫描无截断
Nebu(GPT-5.4 & GPT-5.6-Sol)高推理 + GPT-5.4、x高推理 + GPT-5.4、x高推理 + GPT-5.6-Sol

几个关键术语

  • 深度扫描(Deep Scan):Codex Security 的高覆盖扫描模式,比标准扫描耗时长得多
  • 扫描级别(low/medium/high/max):Claude Security 的强度档位
  • 推理强度(reasoning effort):模型推理投入,x高(xhigh)是最高级
  • 报告截断(report cutoff):Claude Security 默认只返回前 45 个报告,丢弃其余

最后一项很关键——Claude 默认截断意味着”漏报”未必是工具能力不行,而是报告配额用完了。Nebu 测试特意加了一档”最高扫描无截断”来剥离这个变量,对比口径才算公平。


三、Codex Security 与 Claude Security 的硬碰硬

3.1 Codex Security 的两副面孔

Codex Security 同一款产品,跑出两套画像:

快速档——GPT-5.6-Sol + 标准扫描 + x高推理:

  • 覆盖率:41%
  • 耗时:29 分钟
  • 成本:约 15 美元

深度档——GPT-5.6-Sol + 深度扫描 + x高推理:

  • 覆盖率:80%
  • 耗时:5 小时 50 分钟
  • 成本:约 1500 美元

标准到深度,覆盖率翻倍,成本翻了 100 倍,耗时翻了 12 倍。

3.2 Claude Security 的另一种曲线

Claude Security 不分”标准/深度”两档,而是连续可调的扫描级别:

Opus 5 + 最高扫描 + x高推理

  • 覆盖率:42%
  • 耗时:2 小时 48 分钟
  • 成本:约 270 美元

这与 Codex Security 的快速档(41%、29 分钟、15 美元)覆盖率相近,但 Claude 用更长的时间和更高的成本换到了类似的覆盖。

去掉报告截断后——Opus 5 + 最高扫描无截断 + x高推理:

  • 覆盖率:74%
  • 耗时:4 小时 39 分钟
  • 成本:约 445 美元

去掉截断,覆盖率从 42% 飙到 74%,但仍比 Codex Security 深度档的 80% 低 6 个百分点。

3.3 最高配置对比

在各家最强的配置下对比:

工具覆盖率耗时成本
Codex Security 深度档80%5h 50m~$1,500
Claude Security 无截断74%4h 39m~$445

Codex 覆盖更高,Claude 更快更便宜,但都到不了 Nebu 那个档。

覆盖率与成本对比

四、Nebu 是怎么改变战场规则的

Nebu 不是单纯堆算力,而是把”流水线编排”做成了差异化。

4.1 轻量档就够看

Nebu + GPT-5.4 + 高推理

  • 覆盖率:62%
  • 耗时:50 分钟

只用 GPT-5.4,覆盖率已经超过:

  • Codex Security GPT-5.4 + 深度扫描(43%)
  • Claude Security Opus 5 + 最高扫描 + x高推理(42%)

这就是编排的价值——同模型不同流水线,结果天差地别。

4.2 强化档对标 Codex 最佳

Nebu + x高推理(具体模型未在原报告显式标注)

  • 覆盖率:80%
  • 耗时:1 小时 26 分钟

这一档与 Codex Security 深度档的 80% 持平,但:

  • 耗时只有后者的 四分之一(1h26m vs 5h50m)
  • 成本远低于 Codex 深度档(具体数字文中未给)
  • 也超过 Claude Security 无截断档的 74%

4.3 暴力档刷到天花板

Nebu + x高推理 + GPT-5.6-Sol

  • 覆盖率:88%
  • 耗时:3 小时 25 分钟

88% 是整张基准测试的最高成绩,依然比 Codex Security 深度档(80%)快,但算力消耗更高。


五、流水线决定上限

原文用一组对比把”流水线”的价值讲明白:

同样的审计模型 GPT-5.4 + x高推理: – Codex Security 标准扫描:24% – Codex Security 深度扫描:43% – Nebu:80%

模型没换,推理强度没换,只换流水线,覆盖率从 24% 翻到 80%。

Nebula 安全自己的结论:

一套更好的流水线,可以抵得上几代模型进步。

这句话是整份报告的核心论点,也是红队应该记住的关键——挖洞工具的胜负,不只取决于模型参数,更取决于怎么用它


六、红队视角的几个提醒

6.1 自家基准要看盲区

76 个漏洞用什么项目选出来的?难度梯度怎么分布?Nebula 没公布完整明细。如果测例集中在 Nebula 擅长的代码模式(比如某种特定语言、某种漏洞类型),那么 Codex 与 Claude 的劣势会被放大。

6.2 成本对比缺数字

Nebu 强化档(80%、1h26m)的成本,文中未明示,读者只能参考 GPT-5.4 的调用单价估算。Codex 深度档则给出了 1500 美元的明确数字——对比基础不对称。

6.3 网络访问全程关闭

测试时关闭了网络搜索和外部 API 调用。这一点对 Codex Security 影响最大,因为它依赖云端编排;Nebu 因为测试时可能跑在客户自托管或私有云环境,受影响最小。

6.4 编排价值的反向启示

即便 Nebu 的测试数据有水分,”编排抵几代模型进步”这个结论依然成立。工具用得好不好,比工具本身新旧更重要。


七、总结

AI 安全扫描工具的竞争已经分化成两条路线:

  • 模型派:堆算力、堆参数,Codex Security 深度档是典型
  • 流水线派:把现有模型榨干,Nebu 是典型

从这份基准测试看,Nebu 用编排杠杆撬动了成本与时间的双重优势。但厂商自家基准天然带着立场,红队在选型时还是要跑一遍自己的真实场景——76 个真值漏洞的覆盖率高,未必代表你这个项目的漏洞也能命中。

工具会用,比工具本身更重要。这条规律,今天又一次被验证。


参考资料:Nebula Security, “Beyond the Model: Benchmarking Codex Security, Claude Security, and Nebu”, September 1, 2026. https://nebusec.ai/research/nebu-benchmark/

© 版权声明
THE END
喜欢就支持一下吧
点赞15 分享
评论 抢沙发

请登录后发表评论

    暂无评论内容