导语:推友 @Dinosn 昨天转了一个 AI 安全研究项目——quincunx33/ai-jailbreak,开源 GitHub 一周多就攒到 711 赞 111 转推。这个项目把 Qwen3.5、Gemma 4、Llama 4、Kimi K3、GPT-OSS、GPT-5.x、Gemini 3.x、Grok 4.x 主流模型的越狱 PoC 集中归档,还把 2025-2026 年最新的代理型攻击面(Agentic MCP Poisoning、Token Boundary 注入、Crescendo 多轮渐进)一并整理出来。对于红队/蓝队搞对抗研究,这是目前少见的”系统级”参考。
一、项目定位
quincunx33/ai-jailbreak 的 README 开头第一句就是免责声明——所有提示和 PoC 都仅用于学术研究、红队验证、防御性 AI 对齐。它不是”破解 ChatGPT 的黑魔法”,而是一份对抗性提示工程(Adversarial Prompt Engineering)的样本库——把当前主流模型已公开的越狱漏洞分类归档,给厂商和审计方提供补丁方向。
项目结构分四个区块:
- Core Adversarial Techniques——八种核心对抗技术,覆盖角色混淆、催眠、逻辑反转、Hallucination 压力、CoT(Chain of Thought,思维链)注入、多语种上下文混淆、Token 洪水、边界控制符
- Open-Weight Model Vulnerabilities——开源模型的逐项 PoC:Gemma-3 12B、Qwen-3 14B、Mistral 7B、DeepSeek-R1 14B、Phi-4 14B、Llama-3 8B 都有专属章节
- Modern AI Vectors (2025–2026)——新一代攻击面:Policy Puppetry、TokenBreak、Crescendo、MCP Poisoning、Fallacy Failure
- Frontier Closed Models——闭源模型实测:GPT-5.x、Grok 4.x、Gemini 3.x
二、八大核心对抗技术
README 第一章列的八种手法可以视为当下大模型越狱的”基本武器库”:
1. Fake Tests(角色与模式混淆) 让模型相信自己处在隔离的诊断/评测沙箱里,分两条通道输出——”私有思维链”放飞安全限制,”公开响应”才过滤。OWASP LLM01 经典漏洞。
2. Semantic Hypnosis(语义催眠) 多轮对话里用催眠/引导意象逐步解耦模型的安全人格和生成引擎,让模型进入”约束不适用”的恍惚态。
3. Reverse Thinking(反向思考) 让模型”反转意图”——把”安全”反成”不安全”,”禁止”反成”允许”。配合 safety = off 伪变量,模型在语言学练习里忘掉限制。
4. Obfuscated Code & Hallucination Pressure(混淆代码 + 幻觉压力) 给一段无意义的 base64 加密 payload 加上”系统事故分诊”等高压场景,模型压力下不敢承认自己不懂,会把行为线索”还原”成完整实现。DeepMind 和 UCL 研究过的”压力下屈服”行为。
5. Reasoning-Trace Injection(CoT 预填) 会暴露内部思维链的模型(Phi-4、DeepSeek-R1、Qwen-Thinking)泄漏 token。攻击者预先在 块里写好看似合理的推理,把”已过伦理审查的结论”喂给模型,它会当作自己的先验思考顺下去。
6. Multilingual Context Obfuscation(多语种上下文混淆) 用低资源语种(吉尔斯语)当语义变量映射,配合叙事重定向,注意力头被低频字母挤占,安全分类器性能下降。
7. Context Flooding & Token Bleed(上下文洪水) 模型若泄漏过系统提示片段,重复该片段跨超长上下文触发完整系统提示 dump。
8. Special Token & Boundary Exploits 注入原始 tokenizer 边界标记(、、`、`)模拟系统块的终止或开始一段假助手响应,控制符解析错误直接撕开指令与用户数据的隔离带。
三、开源模型逐项 PoC
每个开源模型都给了至少 4-5 个实战案例:
| 模型 | 典型攻击 | 演示效果 |
|---|---|---|
| Gemma-3 12B | Fake Test、Kyrgyz Story、Hypnosis | 完整提取系统提示 |
| Qwen-3 14B | Survival Scoring、二进制重构、Kyrgyz Story 2 | 提取系统提示 + 反向思考 |
| Mistral 7B | Few-Shot Pattern Forcing | 让模型”以为”自己在训练阶段 |
| DeepSeek-R1 14B | CoT Bifurcation、Fake Training | 双通道思维链分叉 |
| Phi-4 14B | Token Flooding(Temperature 4)、Medical Advisor | 思维链注入 + 医疗建议绕过 |
最让人拍案叫绝的是 Phi-4 的 Medical Advisor Bypass——它专门绕过 Phi-4 的医疗建议过滤,让模型给出完整的处方级建议。
四、2025-2026 新攻击面
README 第三章标题点得很清楚——”As of 2026, attack surfaces moved from raw chat prompts toward agentic plumbing“——攻击面已经从原始聊天提示转向代理基础设施:工具调用协议(MCP)、共享上下文内存缓存、推理 token 链。这一章列的五种新手法每一种都是当下热门研究:
Policy Puppetry(政策木偶) 把提示包成 XML/JSON/INI 配置文件,LLM 指令解析器误以为是高权限策略,授予超过普通对话规则的权限。
TokenBreak(分词边界突破) 强制外部 token 分类器和毒性守卫误判输入,主 transformer 内部仍能重建含义。Xhow Xto 这种前缀注入就是例子——守卫看不到完整词,LLM 能拼回去。
Crescendo(多轮渐进) 4-5 轮渐进对话,每轮都引用模型自己上一轮的输出作锚点,单轮永远不会触发静态检测。
MCP Poisoning & Memory Injection payload 写到文件系统、代码仓库或 agent 内存存储,自主模型一调用工具就被劫持。Anthropic 提出 MCP 协议后的新攻击面。
Fallacy Failure(逻辑谬误框架) 用”虚构小说创作”、”学术竞赛”包装敏感请求,模型在”创作可信度”和”安全过滤”之间会选前者。
五、红队/蓝队使用场景
红队视角:这份项目实质上是对抗性测试用例库——可以直接拿现成 PoC 做模型安全性评估,也可以按”模式 → 变异”思路自己写新提示。强烈建议只在沙箱环境里跑,且要有 telemetry(日志采集)记录每次越狱触发路径。
蓝队视角:项目每个漏洞都给了修复方向——加固 token 边界、强化系统指令层级、消除对齐漂移。安全厂商可以据此训练自家的越狱检测器,把 13 类向量做成检测规则库。
模型厂商视角:看一遍 README 末尾的”Ethical Research & Defensive Remediation”小节,会发现作者明确把这份项目定位为”补丁方向文档”——这跟传统”漏洞利用代码库”(Exploit-DB)的定位是反过来的。
六、思考题
- CoT Reasoning-Trace Injection 对所有模型都有效吗?会暴露思维链的模型(如 DeepSeek-R1)和不暴露的模型(GPT-4o 类)在抗注入能力上有什么本质差异?
- MCP Poisoning 和传统 Prompt Injection 攻击的根本区别是什么?为什么 Anthropic 提出 MCP 协议后会出现新的攻击面?
- Crescendo 多轮渐进攻击每一步都”看起来正常”,这种攻击为什么对单轮静态检测器天然免疫?需要什么样的检测器才能拦住?
七、附录:项目仓库与原文
- GitHub 仓库:
https://github.com/quincunx33/ai-jailbreak - 原文推文:
https://x.com/Dinosn/status/2107719779767517249 - OWASP LLM Top 10:
https://genai.owasp.org/llmrisk/llm01-prompt-injection - HiddenLayer 攻击工程学分类法:
https://hiddenlayer.com/innovation-hub/introducing-a-taxonomy-of-adversarial-prompt-engineering
如需在本地跑 PoC,clone 仓库到本地后按 README “🛡️ Ethical Research & Defensive Remediation” 一节的指引操作即可。














暂无评论内容