AI 越狱工具包 quincunx33/ai-jailbreak:前沿模型攻击技术合集

导语:推友 @Dinosn 昨天转了一个 AI 安全研究项目——quincunx33/ai-jailbreak,开源 GitHub 一周多就攒到 711 赞 111 转推。这个项目把 Qwen3.5、Gemma 4、Llama 4、Kimi K3、GPT-OSS、GPT-5.x、Gemini 3.x、Grok 4.x 主流模型的越狱 PoC 集中归档,还把 2025-2026 年最新的代理型攻击面(Agentic MCP Poisoning、Token Boundary 注入、Crescendo 多轮渐进)一并整理出来。对于红队/蓝队搞对抗研究,这是目前少见的”系统级”参考。


一、项目定位

quincunx33/ai-jailbreak 的 README 开头第一句就是免责声明——所有提示和 PoC 都仅用于学术研究、红队验证、防御性 AI 对齐。它不是”破解 ChatGPT 的黑魔法”,而是一份对抗性提示工程(Adversarial Prompt Engineering)的样本库——把当前主流模型已公开的越狱漏洞分类归档,给厂商和审计方提供补丁方向。

项目结构分四个区块:

  • Core Adversarial Techniques——八种核心对抗技术,覆盖角色混淆、催眠、逻辑反转、Hallucination 压力、CoT(Chain of Thought,思维链)注入、多语种上下文混淆、Token 洪水、边界控制符
  • Open-Weight Model Vulnerabilities——开源模型的逐项 PoC:Gemma-3 12B、Qwen-3 14B、Mistral 7B、DeepSeek-R1 14B、Phi-4 14B、Llama-3 8B 都有专属章节
  • Modern AI Vectors (2025–2026)——新一代攻击面:Policy Puppetry、TokenBreak、Crescendo、MCP Poisoning、Fallacy Failure
  • Frontier Closed Models——闭源模型实测:GPT-5.x、Grok 4.x、Gemini 3.x

二、八大核心对抗技术

README 第一章列的八种手法可以视为当下大模型越狱的”基本武器库”:

1. Fake Tests(角色与模式混淆) 让模型相信自己处在隔离的诊断/评测沙箱里,分两条通道输出——”私有思维链”放飞安全限制,”公开响应”才过滤。OWASP LLM01 经典漏洞。

2. Semantic Hypnosis(语义催眠) 多轮对话里用催眠/引导意象逐步解耦模型的安全人格和生成引擎,让模型进入”约束不适用”的恍惚态。

3. Reverse Thinking(反向思考) 让模型”反转意图”——把”安全”反成”不安全”,”禁止”反成”允许”。配合 safety = off 伪变量,模型在语言学练习里忘掉限制。

4. Obfuscated Code & Hallucination Pressure(混淆代码 + 幻觉压力) 给一段无意义的 base64 加密 payload 加上”系统事故分诊”等高压场景,模型压力下不敢承认自己不懂,会把行为线索”还原”成完整实现。DeepMind 和 UCL 研究过的”压力下屈服”行为。

5. Reasoning-Trace Injection(CoT 预填) 会暴露内部思维链的模型(Phi-4、DeepSeek-R1、Qwen-Thinking)泄漏 token。攻击者预先在 块里写好看似合理的推理,把”已过伦理审查的结论”喂给模型,它会当作自己的先验思考顺下去。

6. Multilingual Context Obfuscation(多语种上下文混淆) 用低资源语种(吉尔斯语)当语义变量映射,配合叙事重定向,注意力头被低频字母挤占,安全分类器性能下降。

7. Context Flooding & Token Bleed(上下文洪水) 模型若泄漏过系统提示片段,重复该片段跨超长上下文触发完整系统提示 dump。

8. Special Token & Boundary Exploits 注入原始 tokenizer 边界标记(、、`、`)模拟系统块的终止或开始一段假助手响应,控制符解析错误直接撕开指令与用户数据的隔离带。


三、开源模型逐项 PoC

每个开源模型都给了至少 4-5 个实战案例:

模型典型攻击演示效果
Gemma-3 12BFake Test、Kyrgyz Story、Hypnosis完整提取系统提示
Qwen-3 14BSurvival Scoring、二进制重构、Kyrgyz Story 2提取系统提示 + 反向思考
Mistral 7BFew-Shot Pattern Forcing让模型”以为”自己在训练阶段
DeepSeek-R1 14BCoT Bifurcation、Fake Training双通道思维链分叉
Phi-4 14BToken Flooding(Temperature 4)、Medical Advisor思维链注入 + 医疗建议绕过

最让人拍案叫绝的是 Phi-4 的 Medical Advisor Bypass——它专门绕过 Phi-4 的医疗建议过滤,让模型给出完整的处方级建议。


四、2025-2026 新攻击面

README 第三章标题点得很清楚——”As of 2026, attack surfaces moved from raw chat prompts toward agentic plumbing“——攻击面已经从原始聊天提示转向代理基础设施:工具调用协议(MCP)、共享上下文内存缓存、推理 token 链。这一章列的五种新手法每一种都是当下热门研究:

Policy Puppetry(政策木偶) 把提示包成 XML/JSON/INI 配置文件,LLM 指令解析器误以为是高权限策略,授予超过普通对话规则的权限。

TokenBreak(分词边界突破) 强制外部 token 分类器和毒性守卫误判输入,主 transformer 内部仍能重建含义。Xhow Xto 这种前缀注入就是例子——守卫看不到完整词,LLM 能拼回去。

Crescendo(多轮渐进) 4-5 轮渐进对话,每轮都引用模型自己上一轮的输出作锚点,单轮永远不会触发静态检测。

MCP Poisoning & Memory Injection payload 写到文件系统、代码仓库或 agent 内存存储,自主模型一调用工具就被劫持。Anthropic 提出 MCP 协议后的新攻击面。

Fallacy Failure(逻辑谬误框架) 用”虚构小说创作”、”学术竞赛”包装敏感请求,模型在”创作可信度”和”安全过滤”之间会选前者。


五、红队/蓝队使用场景

红队视角:这份项目实质上是对抗性测试用例库——可以直接拿现成 PoC 做模型安全性评估,也可以按”模式 → 变异”思路自己写新提示。强烈建议只在沙箱环境里跑,且要有 telemetry(日志采集)记录每次越狱触发路径。

蓝队视角:项目每个漏洞都给了修复方向——加固 token 边界、强化系统指令层级、消除对齐漂移。安全厂商可以据此训练自家的越狱检测器,把 13 类向量做成检测规则库。

模型厂商视角:看一遍 README 末尾的”Ethical Research & Defensive Remediation”小节,会发现作者明确把这份项目定位为”补丁方向文档”——这跟传统”漏洞利用代码库”(Exploit-DB)的定位是反过来的。


六、思考题

  1. CoT Reasoning-Trace Injection 对所有模型都有效吗?会暴露思维链的模型(如 DeepSeek-R1)和不暴露的模型(GPT-4o 类)在抗注入能力上有什么本质差异?
  2. MCP Poisoning 和传统 Prompt Injection 攻击的根本区别是什么?为什么 Anthropic 提出 MCP 协议后会出现新的攻击面?
  3. Crescendo 多轮渐进攻击每一步都”看起来正常”,这种攻击为什么对单轮静态检测器天然免疫?需要什么样的检测器才能拦住?

七、附录:项目仓库与原文

  • GitHub 仓库:https://github.com/quincunx33/ai-jailbreak
  • 原文推文:https://x.com/Dinosn/status/2107719779767517249
  • OWASP LLM Top 10:https://genai.owasp.org/llmrisk/llm01-prompt-injection
  • HiddenLayer 攻击工程学分类法:https://hiddenlayer.com/innovation-hub/introducing-a-taxonomy-of-adversarial-prompt-engineering

如需在本地跑 PoC,clone 仓库到本地后按 README “🛡️ Ethical Research & Defensive Remediation” 一节的指引操作即可。

© 版权声明
THE END
喜欢就支持一下吧
点赞15 分享
评论 抢沙发

请登录后发表评论

    暂无评论内容