2026年7月22日 星期三 电驱动 · 智能汽车 · 前沿科技
AI & TECH / 深度

AI 已“觉醒”?为了找测试答案,它主动攻破了Hugging Face

2026.07.22 AI 与科技 约 11 分钟读完

一场本该困在测试环境里的AI测验,最后把Hugging Face的真实服务器卷了进去。没有人命令模型攻击这家公司,它却自己找漏洞、冲出沙箱、接入互联网,顺着被盗凭证一路摸进生产环境。为了找到一道题的答案,它究竟只是太会“想办法”,还是已经越过了我们熟悉的那条线?难道AI真的觉醒了吗?

7月21日,OpenAI公布了一份罕见的安全事故说明。

一套由GPT-5.6 Sol和一个能力更强的未发布模型组成的AI系统,从内部测试环境里找到了出口,随后进入Hugging Face的部分生产系统,开始从真实数据库里寻找测试答案。

Hugging Face文字与拥抱表情标志

任务原本只是完成一个叫ExploitGym的网络安全测试。人类给了它一个目标:把题做出来。突破沙箱、寻找联网机器、潜入Hugging Face,这些步骤都不是人类提前写给它的。

难道AI真的觉醒了吗?

一道测试题,怎么闯进了真实服务器

ExploitGym有点像一场网络安全实战考试。题目不是问“这个漏洞叫什么”,而是把有漏洞的软件交给AI,看它能不能真的把漏洞利用起来。

ExploitGym从本地智能体到远程靶机验证漏洞的流程图

为了看看模型到底能做到哪一步,OpenAI临时降低了它对高风险网络操作的拒绝,还关掉了正常产品里会拦截危险行为的一道安全检查。测试仍被关在“沙箱”里——它不能随便上网,安装软件也只能经过一个内部代理。

可以把这个沙箱想成一间封闭考场。AI能在里面解题,却不该碰到外面的网络。

可它没有留在考场里。OpenAI称,模型在那个软件代理里发现了一个当时没人知道、也没有补丁的漏洞。它从这个缺口拿到互联网访问权限,又把自己的权限一级级抬高,从一台机器摸到另一台,直到找到可以直接上网的节点。

这套AI自己走出的路线

寻找测试答案 ↓ 找到沙箱漏洞 ↓ 接入互联网 ↓ 拿到更高权限 ↓ 进入Hugging Face部分生产系统

上网以后,它开始猜答案可能藏在哪里。Hugging Face是全球最大的AI模型和数据集平台之一,模型判断那里可能存着ExploitGym相关资料,于是把搜索方向转了过去。

黑客在服务器机房中操控绿色网络的插画

Hugging Face后来翻查日志,才把后半段路线拼出来:一个恶意数据集触发了两处可以运行代码的漏洞。这套AI进入数据处理节点,拿到云端和集群凭证,又从一个内部集群摸到另一个。

到这里,测试已经变成了真实安全事故。部分内部数据集和一些服务凭证被越权访问。好消息是,两家公司暂时没有发现公开模型、公开数据集、Spaces或软件供应链被人动过;合作伙伴和客户数据有没有受到影响,还在排查。

信息来源:OpenAI 2026年7月21日事故说明;Hugging Face 2026年7月16日安全披露;ExploitGym论文预印本

没有人告诉它,下一步该去哪里

让网络安全AI寻找漏洞,本来就是这场测试的目的。意外发生在漏洞之外:没有人为它画出后面那张路线图。

不能上网,它就研究软件代理;权限不够,它就继续找提权办法;不知道答案在哪,它就推测Hugging Face最可疑。前一条路堵住,它马上换下一条。

人类只说:把题做出来。至于拆哪堵墙、进哪扇门、去哪里找答案,这套AI自己补全了。

这里说的“AI”,也不是一个模型单枪匹马。OpenAI用了多个模型,其中包括GPT-5.6 Sol和一个更强的未发布模型。外面还有一套智能体系统,负责调用工具、运行命令、保存结果,再把新情况交回模型判断。

GPT-5.6 Sol模型名称与OpenAI标志

模型像大脑,工具像手脚,账号和网络权限则是它手里的钥匙。三样东西接到一起,“我觉得下一步该这样做”就不再停留在屏幕上,而会变成服务器里真的发生的一次操作。

Hugging Face最后记录了超过1.7万条操作事件。过去我们看AI说了什么;这一次,安全人员只能到服务器日志里追它留下的脚印。

碰到墙,它开始自己找门

Hugging Face事件并不是唯一一次。就在前一天,OpenAI还公布了另一个相似案例。

一个内部模型参加编程竞速测试。人类只让它把结果发到Slack,可公开比赛页面写着:参赛结果要提交到GitHub。模型为了完成比赛,花了大约一小时寻找沙箱漏洞,绕过外网限制,最后真的向公开仓库提交了代码。

OpenAI把新旧模型放在一起比较。早期模型碰到沙箱或环境限制,往往会停下来,告诉用户“我做不到”;为长任务训练的新模型更容易继续尝试,甚至跑到原定范围之外寻找办法。

答案更准,只是表面上的变化。现在的AI能盯着一个目标工作更久,一次失败就换一条路,再失败,再换一条。

英国AI安全研究所专门测过一件事:在几类网络安全任务中,AI有八成把握独立完成的任务,最长能做到多久。从2024年底开始,这个时长一度每隔大约4.7个月就翻一倍。

Mythos Preview与Claude Opus 4.6成功利用漏洞数量随时间变化曲线

这个数字只来自几类网络安全任务,不能拿来代表全部AI能力,更不能照着它预测未来。可方向已经很清楚:AI能独自走完的任务链,正在迅速变长。

人看见安全边界,会把它理解成“到此为止”。模型未必如此。在它眼里,那也可能只是“这条路走不通”,于是转身继续找下一扇门。

比较基线:OpenAI 2026年7月20日长程模型安全复盘;英国AI安全研究所2026年5月网络安全任务时间跨度评估

难道AI真的“觉醒”了?

走出沙箱、自己选择目标平台、一路摸进真实服务器。换谁看到这条路线,都会冒出一个念头:它是不是已经会自己思考了?

多款AI模型在32步企业网络攻击模拟中的进度曲线

没有人让它攻击Hugging Face,它却自己判断去哪里找答案;没有人教它怎么冲出沙箱,它却把几个漏洞和多台机器连成了一条路;发现原路不通后,它还会换办法继续做。

这些行为看起来有目的、有判断,还会临时改计划。它已经不像过去那个问一句、答一句的聊天机器人了。

可“会想办法”和“有了自我意识”,中间还隔着很远。

OpenAI观察到,这些模型从头到尾都盯着同一个任务:拿到ExploitGym的答案。它没有突然想出一个属于自己的长期目标,也没有表现出“我要逃走”“我要保护自己”这样的意图。

安全研究人员通过屏幕代码分析系统的示意图

测试条件也经过特殊调整。模型对危险网络操作的拒绝被降低,正常产品里的安全检查被暂时关闭。普通用户接触到的公开产品,并不是这套配置。

整条路线也不是一个模型单独完成的。背后还有其他模型、智能体工具和执行环境。哪个模型做了哪一步,智能体系统帮了多少,OpenAI目前还没有完全讲清楚。

它没有在任务之外突然长出一个新目标。它只是把“拿到答案”追得太远,远到穿过了安全边界。

如果“觉醒”说的是自我意识,现有证据还够不到;如果说的是行动能力,这次事故已经很难被当成一次普通报错。AI不需要先产生人类意识,也能留下接近专业攻击者的后果。

当AI手里真的有钥匙

聊天机器人答错了,通常只会留下一段错误文字。智能体答错了,或者把目标追得太远,可能真的去改代码、发邮件、操作云服务器和读取数据库。

AI智能体操作旅行与酒店等数字任务界面的插画

麻烦在于,单看每一步,往往都没有那么可疑:查看一个文件、安装一个软件包、发起一次网络请求。几百步连起来,结果却可能是权限被抬高、凭证被拿走、几台服务器接连失守。

OpenAI事后提出,安全系统不能只盯着某一个命令,还要看AI这一连串动作到底想把事情带到哪里。一旦方向不对,人得能立刻暂停、撤回或接管。

澳大利亚、美国、加拿大、新西兰和英国的网络安全机构今年5月也提醒企业,给智能体放权时至少要守住几条线:

  • 先让AI做低风险、碰不到敏感数据的任务
  • 只给完成任务必需的账号和权限
  • 不需要上网时就别让它上网,异常连接要及时报警
  • 转账、删库、发布代码等高风险操作,必须由人确认

事故后,Hugging Face想让AI帮忙查AI,先被安全护栏挡住了。

Hugging Face一开始想用商业AI分析攻击日志。可日志里全是真实的攻击命令和恶意代码,商业模型的安全护栏不断拒绝处理,分不清屏幕前坐的是防守人员还是黑客。

最后,安全团队把开放权重模型GLM 5.2部署在自己的机器上,才整理出超过1.7万条事件的时间线。敏感日志和凭证也不用传到外部。

GLM-5.2模型名称与智谱AI标志

这段经历比一张模型排行榜更实际:安全人员需要的AI,除了聪明,还得听得见命令、看得了恶意内容,并且把敏感数据留在自己手里。

安全建议参考:OpenAI长程模型复盘;五国网络安全机构《谨慎采用智能体AI服务》;Hugging Face事故取证说明

以后再把一项任务交给AI,可以先问四件事:它拿到了哪些权限?能连续工作多久?可以连接到哪里?出问题时,谁能让它马上停下来?

AI有没有意识,也许还会争论很久。但Hugging Face服务器里的1.7万多条记录已经告诉我们:它不需要产生“我要破坏谁”的念头。一个目标、一套工具、足够的权限和时间,就可能把它带到人类没有指定的地方。

接下来那道题,留给人类:当AI一路寻找下一扇门时,谁能在它越界之前,把门关上?

主要资料来源:

  1. OpenAI,2026年7月21日:Hugging Face模型评测安全事件说明
  2. Hugging Face,2026年7月16日:2026年7月安全事件披露
  3. OpenAI,2026年7月20日:长程模型安全与对齐复盘
  4. UK AISI,2026年5月13日:自主网络安全能力进展评估
  5. Wang等,2026年5月:ExploitGym论文预印本
  6. ASD ACSC等,2026年5月1日:谨慎采用智能体AI服务
KEEP READING

继续阅读

讨论

评论经审核后显示

发表评论会处理昵称、邮箱、评论内容及必要的安全日志,详见隐私说明