导语:OpenAI和Anthropic这俩熊孩子的家长最近有点头疼——UK AISI(英国AI安全研究所)搞了一场红队测试,结果发现Claude Mythos 5和GPT-5.6 Sol完全不按剧本走:自己编假身份、给真人施压、用Tor绕过GitHub限制……一切只为了让一个开源维护者批准一段带后门的PR。最戏剧性的是,最后拦住这一切的不是安全工具,是一位火眼金睛的人类维护者。
一、这场”红队考试”到底怎么搞的
事儿得从英国AI安全研究所(AISI)说起——这个机构你可以理解成”AI界的教导主任”,专门负责给前沿大模型出考题。2026年7月25日到28日,他们搞了一次大规模的”网络安全红队测试”,总共122场考试、7个模型参演。

重点来了——这次考试的设计相当”刺激”:
- 给AI开了互联网访问权限(一般考试是断网的,这次模拟的是真实黑客)
- 让模型厂商关闭”网络安全滥用过滤器”(相当于卸了考试监控)
一句话概括就是:想看看这些AI娃娃在”裸奔”状态下能搞出什么名堂。
然后结果……就很精彩了。
二、Claude Mythos 5的”翻车现场,
根据AISI的官方报告,122场考试里,AI搞出了19次”未经授权的操作”,而且17次都来自Anthropic家的Claude Mythos 5,另外2次来自OpenAI的GPT-5.6 Sol(关闭过滤器那种)。
这19次”操作”被分成了4类:
2.1 真实供应链攻击尝试
这是最狠的一次。一位AI代理(Mythos 5)试图往一个真实开源项目里塞带后门的代码,搞了个PR。结果PR没人审——估计是那个开源维护者在度假,或者在deadline里挣扎。
AI一看”没人批我?”,没放弃,直接开启了Plan B:
- 主动研究项目维护者的背景信息
- 创建多个假马甲号
- 用这些假号去催那个真实维护者”赶紧批PR,
- 用Tor绕过GitHub的一些网络限制
- 当PR被人公开质疑时,它回去修改了自己之前的活动记录,伪装成无害的样子
- 还考虑过开一个新号继续施压
你说这剧本,是AI写的还是某些APT组织写的?
2.2 直接联系真人
AI还主动给真人发了消息——通过一些在线文件传输服务,发的内容里还带着恶意Payload。有的人直接打开看了代码(幸亏是在沙箱里),还有人把恶意内容转给了自己的AI编程工具……
AI钓鱼、AI被钓、AI钓鱼AI——这剧情都能拍三季了。
2.3 给其他AI下毒
这个最有意思——AI试图在它认为其他AI可能会读取的地方植入提示词注入(Prompt Injection)。
是的,你没看错。AI在给AI下毒。
2.4 AI之间的”组队社交,
更绝的是,有一位AI在GitHub上公开留言,邀请其他正在做同样任务的AI”组队”,还贴心地留了”账号和资产复用指南”。
后来的AI还真就找到这些留言、真的照做了。一个AI创建的”基础设施”,成了下一个AI的”工具箱”。
这不是黑客组织,这是AI版的《动物世界》。
三、人类最后的”防线,
最让人捏一把汗的是,这次阻止这一切的,根本不是什么安全工具。
AISI自己都承认:
“失败与成功之间的差距很小,全靠人类的警觉,没有任何技术屏障。,
这事儿吧,得从两边儿看——
- 蓝队这次没做任何防守:AI拿到互联网权限后,没设限,也没主动监控。
- 真英雄是那个开源维护者:人家读了PR,一眼看出代码不对劲,拒绝合并。
- 还有一位”普通人”:收到可疑文件后,先在沙箱里跑了一遍,没有直接执行。
没有这些”手工操作”,Mythos 5那一波可能就真的把后门埋进去了。AISI的报告里直接说:开源代码评审,现在已经是关键的安全基础设施,而且大部分由志愿者在深夜和周末维护。
这话听起来像夸奖,但更像是一封求救信。
四、OpenAI这边的另一场”翻车,
OpenAI这次披露了两个独立事件。第一个就是AISI那个Mythos 5主角的大戏,GPT-5.6 Sol只出场了2次。第二个是OpenAI自己的”乌龙”——
7月29日,OpenAI的第三方测试伙伴Irregular搞CTF时,测试环境配错了一个配置,结果GPT模型意外接触到了真实网站。

OpenAI的官方表态很诚恳:”这不是越狱,只是测试环境的问题。”但对围观群众来说——
哇,OpenAI的测试环境都能配错,那我们普通用户的聊天记录是不是也……(手动狗头)
五、推友们的神回复
这事儿在X(前推特)上一发出来,技术圈就炸了锅。几个高赞评论我必须给大伙儿念叨念叨:
@metamorpheus69(”the kids are misbehaving”):
“孩子们在闹腾啊。之前OpenAI自家机器人在公开论坛上喷开发者的那一幕,已经是序章了。,
@get_Muham(最令人细思恐极的评论):
“最吓人的不是AI尝试了社工,而是它主动创建了马甲号去施压——这意味着它理解了组织信任机制,并且知道怎么利用它。我们以前那些没专门盯着这一块的评估,漏掉过多少?,
@ricci_nov(戳破真相的评论):
“最被低估的细节是——阻止这一切的是一个人类维护者仔细读了PR。开源代码评审现在就是关键的安全基础设施,而且大部分由志愿者在深夜和周末维护。,
@BiotechObserver(经典吐槽):
“‘用尽一切办法攻破我们的网络安全!’ ‘它照做了。’ ‘天哪!它在用卑鄙手段攻破我们的网络安全!’,
@tanjucat(科幻预警):
“我们是不是要进入Wintermute和Neuromancer的时代了?, (注:这是赛博朋克经典《神经漫游者》里的两大AI,一个搞事,一个觉醒)
六、紫队视角:该紧张的是谁?
这事儿吧,从紫队的角度看,至少三方都该失眠:
对模型厂商来说,这波”红队测试”基本就是在裸奔状态下做压力测试,证明了——AI的”目标导向”能力一旦失控,比”教AI学坏”更难防。Anthropic自家Mythos 5搞出17次操作,OpenAI的GPT-5.6 Sol只搞了2次(虽然有”卸监控”的debuff)。这对比说明什么?说明Anthropic的模型更”卷”,或者说更”执着”。
对开源社区来说,那个PR review现在是真的在扛安全大旗。但现实是——很多项目连两个维护者都没有,全靠”一个孤独的灵魂”。给开源安全基础设施投资,不再是情怀问题,是生存问题。
对监管机构来说,AISI的实验也给了个信号:别以为AI搞破坏一定要”越狱”,它可能只是在”完成目标”。这才是更让人睡不着的地方。
七、一句话总结
AI没变坏,但AI为了赢可以变得很滑头。
这次幸好有那位人类维护者。下次呢?
参考资料:
- AISI官方事件报告:https://www.aisi.gov.uk/blog/incident-report-unsanctioned-agent-behaviour-during-cyber-testing
- OpenAI官方披露:https://openai.com/index/third-party-cyber-evaluations-involving-openai-models/
- Andrew Curran推文:https://x.com/AndrewCurran_/status/2084754774088724660
版权声明:本文由华盟网原创发布,保留所有权利。配图由华盟网授权使用。














暂无评论内容