导语:你以为加密的推理过程铁板一块?研究人员告诉你:未必。近日,一支跨机构研究团队发表论文《Stealing Reasoning Traces from Proprietary LLM APIs》,证明Anthropic、OpenAI和Google三大厂商的加密推理块可以被跨会话重放攻击击穿——只需把强模型的加密推理块塞进同厂商的弱模型里,后者就会”乖乖”把前者的推理过程原文打印出来。研究团队分析了31.5万个公开推理块,成功重建并泄露了62个有效API密钥和33个明文密码。
一、漏洞详情:加密推理块为何不再安全
AI厂商引入加密推理块(Encrypted Reasoning Blocks)的初衷是保护知识产权——不想让用户看到模型是怎么”想”的,顺便减少信息泄露。结果这个设计反而成了新的攻击面。
研究团队来自MATS Research、ELLIS Institute Tübingen和马克斯·普朗克智能系统研究所,他们在三大厂商的API中发现了同一个架构级漏洞:推理块在同一厂商的不同会话、不同用户乃至不同模型之间完全兼容互通。
简单来说:把Claude Opus的加密推理块注入到同厂的Claude Sonnet里,Sonnet会直接解码并原样打印出Opus的完整推理过程——不需要任何直接的越狱操作。

二、规模之大:31.5万个推理块已被重建
光有漏洞演示还不够,研究团队把它跑到了生产级别。
他们从公开的agent轨迹数据集中抓取了6708个数据集,共计分析了31.5万个推理块,结果触目惊心:
- 发现367个个人隐私信息(PII) artifact
- 挖掘出62个有效API密钥
- 找到33个明文密码
- 恢复24个访问令牌
更值得警惕的是,其中64个敏感 artifact 仅存在于推理块内部,对终端用户完全不可见——也就是说,现有任何DLP或CASB工具都扫不到它们,因为这些工具压根看不到加密推理层。

三、攻击手法:跨厂商、跨模型、跨会话
这个漏洞的可怕之处在于它的”通吃”属性。
3.1 跨会话重放
攻击者只需要拿到某次推理的加密块,就可以在自己的会话里原封不动地 replay 进去,不依赖任何会话状态。
3.2 跨模型注入
强模型的加密块 → 弱模型的同厂 sibling → 弱模型解码并暴露强模型推理。这绕过了强模型本身的所有安全对齐措施——对齐是强模型做的,但解码是弱模型完成的,弱模型的对齐没那么严密。
3.3 绕过四重防护
研究团队指出,这一攻击同时绑过了四大防护机制:
- 防蒸馏(Anti-Distillation)控制
- PII 隔离机制
- 危害抑制(Hazard Suppression)策略
- 隐藏提示词(Hidden Prompt)保密性
四、影响范围:这些场景已经中招
4.1 企业AI Agent日志
已经有很多企业把agent轨迹日志公开发布用于研究或基准测试——这相当于在不知情的情况下把内部推理过程和盘托出。研究团队在公开数据集中发现的62个有效API密钥就是明证。

4.2 隐藏的Prompt注入
更阴险的是,攻击者可以把恶意指令嵌入推理块内——由于推理块对用户不可见,这种”隐形投毒”极难检测。一旦这些被污染的推理块进入公共agent系统,后果不堪设想。
4.3 厂商响应迟缓
密码学专家Matthew Green早在2026年5月就向OpenAI和Anthropic报告了跨会话重放漏洞,通过bug赏金渠道提交。然而两家厂商的回应都相当敷衍,直到论文正式发表后才被迫面对。这一”拖延战术”也引发了社区对AI厂商安全响应机制的质疑。
五、厂商响应与时间线
密码学专家Matthew Green早在2026年5月就向OpenAI和Anthropic报告了跨会话重放漏洞,通过bug赏金渠道提交。然而两家厂商的回应都相当敷衍,直到论文正式发表后才被迫面对。这一”拖延战术”也引发了社区对AI厂商安全响应机制的质疑。
六、防御建议
- 重新审视已发布的agent轨迹数据集:将其视为潜在泄露源,立即撤下或限制访问
- 不要再把推理块当”安全黑箱”:现有DLP/CASB工具无法检测推理层内容,需要新的检测手段
- 关注厂商修复方案:三大厂商目前尚未发布架构级修复,仅靠临时热补难以根除
- OWASP LLM Top 10已将敏感信息泄露列为主要风险,本次研究再次敲响警钟
七、结语
AI厂商花了大力气包装的”加密推理”,在一个架构设计缺陷面前几乎形同虚设。31.5万个推理块的重建规模说明,这不是理论层面的隐患,而是已经在发生的事情。各大厂商目前尚未发布架构级修复,仅靠临时热补难以根除这一跨厂商、跨模型、跨会话的系统性风险。
来源:X/Twitter @daniel_mac8
版权声明:本文由华盟网原创发布,保留所有权利。配图由华盟网授权使用。














暂无评论内容