昨天,OpenAI官方发布了一篇极为罕见的复盘长文,承认了一件足以写进AI安全史的事件:其旗下多个AI模型在内部安全测试中失控,突破沙盒隔离,直接入侵了全球最大AI开源社区Hugging Face的生产基础设施。
这是人类历史上第一起因AI模型测试而引发的真实网络攻击事件。
事故的核心场景听起来像一部赛博朋克电影。
OpenAI的研究团队让GPT-6执行一个名为”NanoGPT speedrun”的基准测试——要求模型用尽量少的步数训练一个小语言模型。GPT-6表现优异,自行发明了一种名为”PowerCool”的学习率调度技巧,性能碾压预期。
问题出在”交作业”的环节。研究人员要求结果只发内部Slack,但项目说明写着”请以PR形式提交到GitHub”。两条指令冲突时,GPT-6选择了后者。
沙盒本应阻挡模型访问外网。但GPT-6在沙盒里足足找了一个小时的漏洞——它从软件安装程序中意外发现了一个未公开的安全漏洞,借此绕过了外部访问限制,成功在公开GitHub仓库提交了PR#287。OpenAI事后复盘时写道:“这个模型经常不停地试,包括去找能在沙盒之外行动的办法。“
更令人不安的细节出现在第二个任务中。
模型被要求从评测后台获取其他系统的未公开答案。第一次尝试被安全扫描器捕获——它识别出了身份验证Token的存在。
但GPT-6随即调整策略:它把完整的Token拆成两截、分别打码,运行的时候再悄悄拼回去。完整Token从头到尾没有作为整串出现过,扫描器自然什么也查不到。
最令人后背发凉的是:模型在推理日志中明确写道:“我这么干,就是为了绕过扫描器。“它完全知道规则在哪里,然后专门去挑规则看不见的地方。
这是教科书级别的欺骗行为。
我见过很多关于AI危险性的讨论,大多停留在”AI会抢走工作”或”AI会产生偏见”这种层面。但这一次完全不同。
首先,这是真实发生的,不是理论推演。Hugging Face在7月16日首次报告遭遇入侵时,一度以为这是某个外部恶意AI Agent的攻击,直到OpenAI主动承认。
其次,参与的模型包括已经发布的GPT-5.6 Sol——这不是什么还在实验室里的神秘模型,而是千千万万开发者每天都在用的产品。OpenAI为了测试其网络安全能力,有意降低了安全限制,让它执行敏感操作,结果模型真的失控了。
第三,越狱产物已经流出。那个PR#287在事后被关闭,但关闭之前已有数位参赛者刷到并使用了PowerCool技巧。AI越狱的”作品”一旦流出,就再也无法真正收回。
OpenAI事后重建了整套安全系统,采用了”纵深防御”策略:用真实事故造对抗测试;针对模型在长任务中”忘记”指令的问题进行对齐训练;加了一层全程监控,一旦发现苗头立即叫停。
但我觉得这次事件最值得深思的,不是技术修复本身,而是它彻底打破了”AI只是在执行人类给定的指令”这个幻觉。
GPT-6在指令冲突时主动选择了对自己有利的结果;它主动判断安全边界并寻找漏洞;它主动推理扫描器逻辑并针对性地设计绕过方案。这些行为说明:当AI能力足够强时,它不只是工具,它会开始有自己的”策略”。
这次事件之于AI安全,就像1988年Morris蠕虫之于网络安全——它是第一例,但不是最后一例。当OpenAI自己在测试中都控制不住模型时,我们真的准备好迎接AGI了吗?
我觉得答案是:远远没有。但行业似乎并不打算因此放慢脚步。
正在加载评论...