重磅突破:研究者成功还原所有前沿AI模型的加密推理痕迹(含凭证泄露)

导语:你以为加密的推理过程铁板一块?研究人员告诉你:未必。近日,一支跨机构研究团队发表论文《Stealing Reasoning Traces from Proprietary LLM APIs》,证明Anthropic、OpenAI和Google三大厂商的加密推理块可以被跨会话重放攻击击穿——只需把强模型的加密推理块塞进同厂商的弱模型里,后者就会”乖乖”把前者的推理过程原文打印出来。研究团队分析了31.5万个公开推理块,成功重建并泄露了62个有效API密钥和33个明文密码。


一、漏洞详情:加密推理块为何不再安全

AI厂商引入加密推理块(Encrypted Reasoning Blocks)的初衷是保护知识产权——不想让用户看到模型是怎么”想”的,顺便减少信息泄露。结果这个设计反而成了新的攻击面。

研究团队来自MATS Research、ELLIS Institute Tübingen和马克斯·普朗克智能系统研究所,他们在三大厂商的API中发现了同一个架构级漏洞:推理块在同一厂商的不同会话、不同用户乃至不同模型之间完全兼容互通。

简单来说:把Claude Opus的加密推理块注入到同厂的Claude Sonnet里,Sonnet会直接解码并原样打印出Opus的完整推理过程——不需要任何直接的越狱操作。

研究论文截图

二、规模之大:31.5万个推理块已被重建

光有漏洞演示还不够,研究团队把它跑到了生产级别。

他们从公开的agent轨迹数据集中抓取了6708个数据集,共计分析了31.5万个推理块,结果触目惊心:

  • 发现367个个人隐私信息(PII) artifact
  • 挖掘出62个有效API密钥
  • 找到33个明文密码
  • 恢复24个访问令牌

更值得警惕的是,其中64个敏感 artifact 仅存在于推理块内部,对终端用户完全不可见——也就是说,现有任何DLP或CASB工具都扫不到它们,因为这些工具压根看不到加密推理层。

隐私数据泄露统计

三、攻击手法:跨厂商、跨模型、跨会话

这个漏洞的可怕之处在于它的”通吃”属性。

3.1 跨会话重放

攻击者只需要拿到某次推理的加密块,就可以在自己的会话里原封不动地 replay 进去,不依赖任何会话状态。

3.2 跨模型注入

强模型的加密块 → 弱模型的同厂 sibling → 弱模型解码并暴露强模型推理。这绕过了强模型本身的所有安全对齐措施——对齐是强模型做的,但解码是弱模型完成的,弱模型的对齐没那么严密。

3.3 绕过四重防护

研究团队指出,这一攻击同时绑过了四大防护机制:

  1. 防蒸馏(Anti-Distillation)控制
  2. PII 隔离机制
  3. 危害抑制(Hazard Suppression)策略
  4. 隐藏提示词(Hidden Prompt)保密性

四、影响范围:这些场景已经中招

4.1 企业AI Agent日志

已经有很多企业把agent轨迹日志公开发布用于研究或基准测试——这相当于在不知情的情况下把内部推理过程和盘托出。研究团队在公开数据集中发现的62个有效API密钥就是明证。

攻击影响范围

4.2 隐藏的Prompt注入

更阴险的是,攻击者可以把恶意指令嵌入推理块内——由于推理块对用户不可见,这种”隐形投毒”极难检测。一旦这些被污染的推理块进入公共agent系统,后果不堪设想。

4.3 厂商响应迟缓

密码学专家Matthew Green早在2026年5月就向OpenAI和Anthropic报告了跨会话重放漏洞,通过bug赏金渠道提交。然而两家厂商的回应都相当敷衍,直到论文正式发表后才被迫面对。这一”拖延战术”也引发了社区对AI厂商安全响应机制的质疑。


五、厂商响应与时间线

密码学专家Matthew Green早在2026年5月就向OpenAI和Anthropic报告了跨会话重放漏洞,通过bug赏金渠道提交。然而两家厂商的回应都相当敷衍,直到论文正式发表后才被迫面对。这一”拖延战术”也引发了社区对AI厂商安全响应机制的质疑。


六、防御建议

  • 重新审视已发布的agent轨迹数据集:将其视为潜在泄露源,立即撤下或限制访问
  • 不要再把推理块当”安全黑箱”:现有DLP/CASB工具无法检测推理层内容,需要新的检测手段
  • 关注厂商修复方案:三大厂商目前尚未发布架构级修复,仅靠临时热补难以根除
  • OWASP LLM Top 10已将敏感信息泄露列为主要风险,本次研究再次敲响警钟

七、结语

AI厂商花了大力气包装的”加密推理”,在一个架构设计缺陷面前几乎形同虚设。31.5万个推理块的重建规模说明,这不是理论层面的隐患,而是已经在发生的事情。各大厂商目前尚未发布架构级修复,仅靠临时热补难以根除这一跨厂商、跨模型、跨会话的系统性风险。

来源:X/Twitter @daniel_mac8

版权声明:本文由华盟网原创发布,保留所有权利。配图由华盟网授权使用。

© 版权声明
THE END
喜欢就支持一下吧
点赞10 分享
评论 抢沙发

请登录后发表评论

    暂无评论内容