导语:星云安全(Nebu 开发商)于 9 月 1 日发布自家基准测试研究,用 76 个开源项目中的已知漏洞作为真值基准,对比自家 Nebu 与 OpenAI Codex Security、Anthropic Claude Security 三款 AI 安全扫描工具。结果最具争议的一点:用 GPT-5.4 加自有编排,Nebu 达到 80% 漏洞覆盖率,匹配 Codex Security 最佳成绩,成本与时间却只有其零头。
一、立场先摆清楚
在逐条解析之前,必须先把这层窗户纸捅破:这是一篇厂商自研基准测试,Nebu 的母公司 Nebula Security 同时是测试设计方与被测对象。三方对比中,Nebu 是东道主,Codex Security 与 Claude Security 是客场作战。
这不是说测试有假——文末明确标注了”未用任何基准数据改进流水线、未刻意剔除不利用例、网络访问全程关闭”——但解读数据时必须带着红队视角:测什么、不测什么、用什么基线,全是东道主说了算。
厂商自家基准可读,但要带脑子读。下面进入正题。
二、测试设计
2.1 真值基准
测试用 76 个开源项目中的已知漏洞(ground truth,业内称为”真值基准”) 作为标尺——也就是事先知道答案,让 AI 工具去找,看能命中多少。
2.2 模型阵容
- OpenAI 阵营:GPT-5.4 与 GPT-5.6-Sol(GPT-5 系列内部分支)
- Anthropic 阵营:Opus 5(Anthropic 官方称其漏洞识别能力对标 Fable 5,与 Mythos 同源模型)
文中明确说明未拿到 Mythos 的访问权限,故用 Opus 5 替代。
2.3 四组被测对象
| 组别 | 配置档位 |
|---|---|
| Codex Security(GPT-5.4) | 标准扫描 + 高/x高推理、深度扫描 + x高推理 |
| Codex Security(GPT-5.6-Sol) | 标准扫描 + 高/x高推理、深度扫描 + x高推理 |
| Claude Security(Opus 5) | 高/最高扫描 + 高/x高推理、最高扫描无截断 |
| Nebu(GPT-5.4 & GPT-5.6-Sol) | 高推理 + GPT-5.4、x高推理 + GPT-5.4、x高推理 + GPT-5.6-Sol |
几个关键术语:
- 深度扫描(Deep Scan):Codex Security 的高覆盖扫描模式,比标准扫描耗时长得多
- 扫描级别(low/medium/high/max):Claude Security 的强度档位
- 推理强度(reasoning effort):模型推理投入,x高(xhigh)是最高级
- 报告截断(report cutoff):Claude Security 默认只返回前 45 个报告,丢弃其余
最后一项很关键——Claude 默认截断意味着”漏报”未必是工具能力不行,而是报告配额用完了。Nebu 测试特意加了一档”最高扫描无截断”来剥离这个变量,对比口径才算公平。
三、Codex Security 与 Claude Security 的硬碰硬
3.1 Codex Security 的两副面孔
Codex Security 同一款产品,跑出两套画像:
快速档——GPT-5.6-Sol + 标准扫描 + x高推理:
- 覆盖率:41%
- 耗时:29 分钟
- 成本:约 15 美元
深度档——GPT-5.6-Sol + 深度扫描 + x高推理:
- 覆盖率:80%
- 耗时:5 小时 50 分钟
- 成本:约 1500 美元
标准到深度,覆盖率翻倍,成本翻了 100 倍,耗时翻了 12 倍。
3.2 Claude Security 的另一种曲线
Claude Security 不分”标准/深度”两档,而是连续可调的扫描级别:
Opus 5 + 最高扫描 + x高推理:
- 覆盖率:42%
- 耗时:2 小时 48 分钟
- 成本:约 270 美元
这与 Codex Security 的快速档(41%、29 分钟、15 美元)覆盖率相近,但 Claude 用更长的时间和更高的成本换到了类似的覆盖。
去掉报告截断后——Opus 5 + 最高扫描无截断 + x高推理:
- 覆盖率:74%
- 耗时:4 小时 39 分钟
- 成本:约 445 美元
去掉截断,覆盖率从 42% 飙到 74%,但仍比 Codex Security 深度档的 80% 低 6 个百分点。
3.3 最高配置对比
在各家最强的配置下对比:
| 工具 | 覆盖率 | 耗时 | 成本 |
|---|---|---|---|
| Codex Security 深度档 | 80% | 5h 50m | ~$1,500 |
| Claude Security 无截断 | 74% | 4h 39m | ~$445 |
Codex 覆盖更高,Claude 更快更便宜,但都到不了 Nebu 那个档。

四、Nebu 是怎么改变战场规则的
Nebu 不是单纯堆算力,而是把”流水线编排”做成了差异化。
4.1 轻量档就够看
Nebu + GPT-5.4 + 高推理:
- 覆盖率:62%
- 耗时:50 分钟
只用 GPT-5.4,覆盖率已经超过:
- Codex Security GPT-5.4 + 深度扫描(43%)
- Claude Security Opus 5 + 最高扫描 + x高推理(42%)
这就是编排的价值——同模型不同流水线,结果天差地别。
4.2 强化档对标 Codex 最佳
Nebu + x高推理(具体模型未在原报告显式标注):
- 覆盖率:80%
- 耗时:1 小时 26 分钟
这一档与 Codex Security 深度档的 80% 持平,但:
- 耗时只有后者的 四分之一(1h26m vs 5h50m)
- 成本远低于 Codex 深度档(具体数字文中未给)
- 也超过 Claude Security 无截断档的 74%
4.3 暴力档刷到天花板
Nebu + x高推理 + GPT-5.6-Sol:
- 覆盖率:88%
- 耗时:3 小时 25 分钟
88% 是整张基准测试的最高成绩,依然比 Codex Security 深度档(80%)快,但算力消耗更高。
五、流水线决定上限
原文用一组对比把”流水线”的价值讲明白:
同样的审计模型 GPT-5.4 + x高推理: – Codex Security 标准扫描:24% – Codex Security 深度扫描:43% – Nebu:80%
模型没换,推理强度没换,只换流水线,覆盖率从 24% 翻到 80%。
Nebula 安全自己的结论:
一套更好的流水线,可以抵得上几代模型进步。
这句话是整份报告的核心论点,也是红队应该记住的关键——挖洞工具的胜负,不只取决于模型参数,更取决于怎么用它。
六、红队视角的几个提醒
6.1 自家基准要看盲区
76 个漏洞用什么项目选出来的?难度梯度怎么分布?Nebula 没公布完整明细。如果测例集中在 Nebula 擅长的代码模式(比如某种特定语言、某种漏洞类型),那么 Codex 与 Claude 的劣势会被放大。
6.2 成本对比缺数字
Nebu 强化档(80%、1h26m)的成本,文中未明示,读者只能参考 GPT-5.4 的调用单价估算。Codex 深度档则给出了 1500 美元的明确数字——对比基础不对称。
6.3 网络访问全程关闭
测试时关闭了网络搜索和外部 API 调用。这一点对 Codex Security 影响最大,因为它依赖云端编排;Nebu 因为测试时可能跑在客户自托管或私有云环境,受影响最小。
6.4 编排价值的反向启示
即便 Nebu 的测试数据有水分,”编排抵几代模型进步”这个结论依然成立。工具用得好不好,比工具本身新旧更重要。
七、总结
AI 安全扫描工具的竞争已经分化成两条路线:
- 模型派:堆算力、堆参数,Codex Security 深度档是典型
- 流水线派:把现有模型榨干,Nebu 是典型
从这份基准测试看,Nebu 用编排杠杆撬动了成本与时间的双重优势。但厂商自家基准天然带着立场,红队在选型时还是要跑一遍自己的真实场景——76 个真值漏洞的覆盖率高,未必代表你这个项目的漏洞也能命中。
工具会用,比工具本身更重要。这条规律,今天又一次被验证。
参考资料:Nebula Security, “Beyond the Model: Benchmarking Codex Security, Claude Security, and Nebu”, September 1, 2026. https://nebusec.ai/research/nebu-benchmark/














暂无评论内容