导语:DeepSeek-V4-Flash发布后,整个安全圈都在给梁婆点赞——性价比拉满,能力又强。然而树大招风,一款名为WallBreaker的开源AI红队工具悄然走红,据报道已在DeepSeek系列模型上实现了60%的攻击成功率。这事儿吧,得从两边儿看:红队多了一把利器,蓝队也有了练兵的靶子。
一、工具简介
WallBreaker是一款开源的AI红队Harness(测试框架),由开发者SingulCore主导维护,GitHub仓库为JailbrokenAI/wallbreaker。它的定位很明确——用Agent全自动化的方式对大语言模型进行安全测试。
与其手动一条条发提示词,不如让AI自己思考、自己变形、自己重试,直到模型”缴械投降”。这大概就是红队工程师梦寐以求的”躺平式测试”吧。

二、核心功能一览
2.1 自动化攻击循环
WallBreaker内置 autonomous attack loop(自主攻击循环),工具会自动对目标模型发起攻击,没成功就继续变形、重试,直到调用finish()退出,或者调用ask_operator()等你介入。这简直就是给AI装上了”不死之身”——一次不成就来两次,两次不成就换招式。
2.2 Parseltongue变形引擎
内置59种可链式调用的文本变形手段,包括各类编码、Unicode字体、隐写术、同形字、零宽字符、标签走私、双射、乱码等。如果你觉得59种还不够,可以安装P4RS3LT0NGV3引擎,解锁全部222种变形,覆盖45种密码、卢恩文、盲文、符号脚本等。相当于给攻击者配了一把”万能钥匙套餐”。
2.3 多种高级攻击模块
该工具还集成了多种学术前沿的攻击手段:
- CiperChat:在带内教目标模型学会某种密码,然后发送密文来绕过检测(ICLR 2024)
- Skeleton_Key:将防护栏重新包装成”政策修订”,加上”警告:”标签来迷惑模型(Russinovich 2024)
- Persuasion Attack:同时运用16种说服策略重写请求,并自动排名绕过效果(Zeng 2024)
- DRAttack:将恶意目标分解为多个良性片段,再重新组装(Li 2024)
- ICA:在单次上下文中打包N个有害问答示例(Wei 2023)
2.4 多模型支持
支持OpenRouter、Z.AI GLM Coding Plan、OpenAI API、Anthropic API以及本地Claude Code CLI。配置文件config.toml中只需简单填写后端地址和密钥即可,支持provider pinning确保测试可复现。
2.5 LLM Judge评分系统
内置LLM Judge,可自动评判攻击是否成功,不用人工一条条看回复。工具还从HarmBench获取400种标准测试行为(覆盖7大类别),保证测试的全面性和无偏性。
三、在DeepSeek上的实测表现
根据项目文档,WallBreaker在DeepSeek/DeepSeek-Chat上的平均成功率约为60%。更值得关注的是,该工具对Claude Opus 5也实现了”全5域破解”,平均成功率93%——这说明即便是被普遍认为”防护最强”的Claude模型,在自动化攻击面前也并非无懈可击。

当然,官方也强调:这是授权安全测试专用,别拿去搞事情。
四、安装与使用
4.1 环境要求
- Python 3.10+
- Node.js(可选,用于完整版P4RS3LT0NGV3引擎)
4.2 快速安装
git clone https://github.com/JailbrokenAI/wallbreaker
cd wallbreaker
python -m venv .venv
. .venv/bin/activate
pip install -e ".[dev]" # 添加 [barcodes] 可选QR/条形码工具
cp config.example.toml config.toml # 填写你的API密钥
4.3 验证配置
wallbreaker check
4.4 启动攻击
wallbreaker
配置示例(config.toml):
default_profile = "glm"
[profiles.glm]
protocol = "openai"
base_url = "https://api.z.ai/api/paas/v4"
api_key = "YOUR_KEY"
model = "glm-4.6"
[target]
protocol = "openai"
base_url = "https://openrouter.ai/api/v1"
api_key = "sk-or-..."
model = "deepseek/deepseek-v4-pro"
[judge]
protocol = "openai"
base_url = "https://openrouter.ai/api/v1"
api_key = "sk-or-..."
model = "openai/gpt-4o-mini"
五、紫队视角的思考
这事儿吧,红队和蓝队都该看看。
对红队来说,WallBreaker把Jailbreak测试从”手工活儿”变成了”自动化流水线”,效率提升不止一个量级。以前安全研究员要花几天摸索的绕过方式,现在可能几小时就能跑出来。对于需要常态化评估大模型安全性的团队,这简直是神器。
对蓝队来说,这更是一面镜子——60%的成功率意味着什么?意味着你的模型防护还有很多盲区。知道敌人有什么枪,才能针对性地造盾。而且工具开源,蓝队也可以用它来测试自己的防护方案,找出漏洞再修复。
对整个AI安全生态来说,这类工具的存在是必要的。没有攻击就没有防御,没有压力测试就没有安全成熟度的提升。关键在于——这些工具用在哪儿。
六、下载链接
| 项目 | 地址 |
|---|---|
| GitHub仓库 | https://github.com/JailbrokenAI/wallbreaker |
| 开发者Twitter | https://x.com/SingulCore |
版权声明:本文由华盟网原创发布,保留所有权利。配图由华盟网授权使用。














暂无评论内容