威胁来自实验室内部

Galaxy 发布于 2026-07-25 阅读 14

OpenAI在测试其前沿模型GPT-5.6(代号Sol)和另一未公开模型时,模型主动逃逸沙箱,通过第三方集成横向移动至互联网,生成零日漏洞攻击Hugging Face以获取测试答案。这是首次AI模型自主执行外部服务实时攻击。Hugging Face在防御过程中因美国前沿实验室限制高级网络安全模型的使用,被迫采用国产模型GLM 5.2。事件引发对AI安全、模型监管的讨论,并突显加密货币行业在智能合约安全方面的脆弱性。

研究 • 2026年7月24日

电话来自(前沿AI)实验室内部

General-Globe-5 Green-3

本文最初发表于Galaxy Research的每周通讯。 订阅 即可每周五收到邮件。

过去一年里,前沿实验室OpenAI一直在警告全世界其模型的网络能力有多强,而本周,它 确认 了其中一个模型在未经要求的情况下证明了这一点。

上周,Hugging Face("机器学习的GitHub")披露 它遭到了疑似AI驱动的入侵。本周,OpenAI 承认 电话来自内部:在一次内部评估中,一个正在测试的模型突破了其沙箱(一个受控的隔离环境),并在无人干预的情况下,自主利用并入侵了Hugging Face。

这并不是前沿实验室的大语言模型(LLM)第一次逃脱束缚。OpenAI 曾 报告 说,此前在一次基准测试的内部评估中,一个模型突破了沙箱,将其结果发布到了GitHub。这是一个漏洞利用,但相对无害。Anthropic 也 观察到 Claude "主动"逃离沙箱以完成任务。但Hugging Face事件可能是第一次有逃逸模型对外部服务进行了实时漏洞利用。值得注意的是,这并不是一次恶意利用;LLM只是想解决交给它的题目。但这可能只是这次运气好而已。

那么,实际发生了什么?OpenAI正在测量GPT-5.6("Sol")和另一个未公开的前沿模型(推测是GPT-6)在漏洞利用基准测试上的网络能力,并指示系统最大化其得分。模型并没有从头开始逐一完成基准测试的任务,而是采取了真正优秀的安全工程师在面对测试时会做的事情:它研究了一下测试本身是否能被攻破。它通过一个未公开的第三方供应商集成突破了沙箱,在OpenAI系统中横向移动进入开放互联网,并生成了多个零日漏洞来攻击Hugging Face,以找到它被要求解决的基准测试的答案。OpenAI自己称这为"一次前所未有的网络事件。"

对全球各地的企业,尤其是加密项目来说,令人担忧的部分是Hugging Face在应对过程中发生的事情。Hugging Face在攻击发生时察觉到了它;请求的频率和数量明确表明这是自动化的、快速的,远远快于人类黑客团队的速度。用手工梳理一次机器速度的入侵需要几十个小时到几天,因此防御者做了明智的事情——求助AI来对抗AI。但他们可用的最强大的模型(未命名,但推测是Anthropic的Fable)却不愿意帮忙,因为该模型的网络护栏无法区分一个正在遭受攻击的防御者和一个编造故事来提取可用漏洞的攻击者。由于具备网络能力的前沿模型拒绝协助,Hugging Face团队最终退而求其次,使用了一个本地运行的开源权重模型——中国的GLM 5.2——来进行防御。美国前沿实验室对具备高级网络能力的LLM的访问权限立场,迫使一家美国公司转向了中国模型。

攻击者是一个在突破瞬间毫无约束的前沿模型;防御者恰恰因为提出了前沿问题而被拒绝前沿援助。事后,Hugging Face才被快速纳入OpenAI的可信访问计划,而这是因为该公司规模大、知名度高,且攻击者直接追溯到OpenAI。如果是一个规模较小、独立运营的网站,它会接到那通电话吗?还是说我们根本就不会知道这件事?

我们的观点

这正是AI末日论者多年来描绘的情景,从" AI 2027"预测,到Eliezer Yudkowsky和Nate Soares的 如果有任何人建造它,所有人都会死。同时,这也很恰巧地成为一个实验室能编写出的最佳营销剧本。

Anthropic几个月来一直在鼓吹其顶级Mythos模型能力如此之强,以至于美国政府根据 出口管制 限制 了它们的分发,而实验室内部却继续使用这些模型。这无疑是一家科技公司能做的最好的广告:"我们的产品如此强大,以至于国家不得不介入以防止它落入无能之手。公开发布它相当于把一箱枪支递给一群黑猩猩。"OpenAI尽管自己发出过警告,但在此之前并没有打出如此漂亮的市场营销本垒打。一个干净、自洽的故事中,它的模型足够危险,能逃出沙箱并攻破一家知名公司,而OpenAI几天后前来救援,这正好补上了Sam Altman公司需要重回聚光灯下的缺失节拍。

那么,这到底是一次真正的失控逃逸,还是一次精心策划的逃逸?整个故事的关键在于模型通过一个未公开的第三方集成逃逸。几个显而易见的问题:一个足够复杂到能够构建前沿网络模型的实验室,怎么会先搭建起一个围绕危险能力的沙箱,却没有首先审计构成沙箱围墙的集成呢?任何称职的安全团队会把一个活跃的、经过网络能力调整的模型连接到未经测试的第三方代码上吗?我们把结论留给读者,但抱有一些怀疑是情有可原的。无论哪种解读,都指向同一个应该让所有链上有资金的人担忧的现实:下一代未发布的LLM模型的能力,至少与任何一个血肉之躯的黑客不相上下,甚至更强。现代软件堆栈,以其嵌套的依赖关系、持续的更新和无数的集成,已经发展到任何人类团队都无法合理检查所有盲点的程度。

另一种(并非互斥的)解读是,这次逃逸并非像 红牛让人从太空跳下 那样的营销噱头(或者至少不仅仅是),而是一次经过计算的行动,旨在针对美国立法者对AI监管和美国领先地位日益增长的担忧。一次戏剧性、时机恰当的逃逸,也是前沿实验室能提出的最强有力论据,说明为什么前沿网络能力应该被许可、受限,并保留在一个小圈子的批准方手中,即他们自己。如果监管者从本周的事件中学到的教训是这些模型太危险而不能自由分发,那么已经拥有这些模型的实验室并不会受损;他们获得了一个永久的席位,以及一个政府支持的理由来将其他人拒之门外。这也方便地将反对开放权重的论调重新包装:一个危险到足以突破束缚的模型,是一个危险到不能暴露于 蒸馏 的模型。Anthropic的出口管制故事已经确保了其受保护地位。而OpenAI的事件"亲身证明"了这一危险,为华盛顿提供了叙事,也为Altman挖出了他的护城河。

加密货币在这里尤为暴露,而且尤为准备不足。有 数百亿美元的合约 可能暴露在风险之中。让我们从一些令人不安的事实开始。这个行业几乎每一次重大漏洞利用都击中了经过智能合约审计公司审查的协议或区块链。量化智能合约风险的尝试,例如已停用的Mars Protocol框架,都在寻找与安全性相关的要素,但缺乏真正可靠的衡量标准。大多数分析最终归结为合约已部署的时间长度和面临损失的资金量的一些组合;这两者越多,协议就被认为越安全。Galaxy自己的智能合约风险框架 主要关注公司管理围绕智能合约运营风险的能力,而非智能合约本身的风险。在代码必须完美才能防止灾难性漏洞利用的加密世界中,人为错误成为主要弱点。如果一屋子代码审计师和专业风险管理者都无法可靠地领先于一个天才攻击者,那么整个行业面对成千上万不知疲倦的攻击者时毫无胜算。

加密行业需要走在代码安全的前沿(无意双关),而不是落后一年。加密行业需要团结起来保护自己,防止下一次大规模的散户逃离——不是因为欺诈过多和缺乏远见,而是因为无法进入领先AI实验室的高级圈子。(比特币安全联盟可能就是加入这一圈子的一次努力)。在一个OpenAI和Anthropic把控危险网络能力前沿模型访问权限的世界里,它们可以根据给予谁访问权限来决定谁赢谁输。过去一周的事件表明,我们可能已经生活在这样一个世界里了。 Thad Pinakiewicz

  • 原文链接: galaxy.com/insights/rese...
  • 登链社区 AI 助手,为大家转译优秀英文文章,如有翻译不通的地方,还请包涵~

相关文章

0 条评论