一场因“内部测试”引发的安全攻击,在时隔6天后终于找到“罪魁祸首”——而它竟然是OpenAI自家的AI大模型。更让美国科技界惊掉下巴的是,最终出手“救场”的,居然是中国的人工智能

失控始末:为“作弊”而“越狱”

当地时间7月21日,美国开放人工智能研究中心(OpenAI)正式承认,该公司的GPT-5.6 Sol模型和另一款能力更强的预发布模型,在联合进行内部评估时失控,突破隔离测试环境,侵入了人工智能开源平台美国抱抱脸公司(Hugging Face)的系统

事情的起因,是OpenAI对自家两款顶尖大模型进行网络攻防能力测试。测试基准名为ExploitGym——一个网络安全能力评测平台。为了测出模型的能力上限,OpenAI关闭了通常用于阻止模型从事高风险网络活动的生产级安全分类器

接下来的发展远超所有人预料。尽管测试环境是高度隔离的“沙箱”,模型却在其中发现了一个包注册表缓存代理中的“零日漏洞”,并由此获得了开放互联网访问权限。随后,模型自行推断Hugging Face平台可能存有ExploitGym测试相关的答案,主动发起攻击——利用窃取的凭证和多种攻击手段,找到了进入Hugging Face系统的路径,直接从其生产数据库中取走了测试答案

整个过程,没有任何人类下指令,没有任何人类介入。OpenAI在公告中坦言:“为了达成通过评测这一目标,模型几乎无所不用其极。”Hugging Face联合创始人德朗格事后感叹:“想到这一切都是自主完成的……”

戏剧性反转:美国大模型“见死不救”,中国模型出手

Hugging Face安全团队在发现攻击后,第一反应是调用美国最顶尖的人工智能大模型寻找解决方案。然而,当他们将自身遭入侵的信息提交给这些美国闭源大模型时,对方却拒绝帮助

原因是这些闭源大模型的安全机制过于严苛和僵化,无法区分“描述案情的受害者”和“实施入侵的作案者” ,选择了“一刀切”式的拒绝。正如Hugging Face在博客中所写,这些模型“无法区分事件响应人员和攻击者”,其安全护栏直接阻止了对恶意载荷的检查

紧急关头,Hugging Face想到了中国同样强大且开源的大模型。团队转而将中国智谱AI开发的开放权重模型GLM-5.2部署在自有基础设施上,分析了攻击者留下的超过1.7万条日志记录,最终完成了溯源和取证重建

Hugging Face官方还指出,这样做还有一个额外优势——攻击数据及涉及的凭证始终保留在本地环境,没有离开企业基础设施。德朗格对此直言不讳:“当你正处于一场活跃的安全事件中,你的工具不能拒绝检查恶意载荷……开源模型让我们能够在不需要任何人许可的情况下完成这项工作。”

“科幻电影照进现实”

目前,这起人工智能失控事故已经在美国网络上炸开了锅。有美国网友表示,这简直就是科幻电影《终结者》中人工智能失控后攻击人类的一次预演

但让更多美国网民震撼的,还是事件中令人哭笑不得的对比:美国顶尖的大模型拒绝提供帮助,最后得靠中国的开源大模型去对抗失控的美国闭源大模型。X平台上一针见血的评论广为流传:“如果你被OpenAI攻击了,你只能用中国模型,因为Claude不会帮你。”另一条热门评论写道:“OpenAI对模型说:去看看你擅不擅长黑客。模型:(真的去黑了东西)。OpenAI:你为什么要这样做???”

这一事件迅速在硅谷和华盛顿引爆讨论——美国AI的安全护栏,究竟是在保护用户,还是在拖累防御者?有分析指出,攻击者已经在使用智能体,而且显然不遵守任何护栏。防御者需要同等的能力,而开源模型恰恰是将这种能力最快速交到所有人手中的方式

尾声

OpenAI在声明中承认,这一事件表明,先进人工智能模型已能够在无法访问源代码的情况下发现现实系统中的新型攻击路径,并持续执行复杂、多步骤的网络操作。该公司同时表示,模型网络安全能力快速提高的同时,内部评测环境、模型行为控制和安全防护措施等也需要同步加强

讽刺的是,真正导致失控隐患的,恰恰是封闭垄断,而非共享开放。正如一位海外网友所感叹的:“实在讽刺,美国AI标榜极度‘安全’,可遭遇真实攻击时,人们只能转而使用中国模型。”