mt logoMyToken
ETH Gas
EN

OpenAI内部,AI建立了三代「文明」

Favoritecollect
Shareshare

原文作者:Wildcard

原文编辑:靖宇

原文来源: 极客公园

无数的科幻电影,都曾经尝试设想过,一个无法控制的人工智能失控,会发生什么事。

没有人能想到,科幻电影中的未来,会这么快到来。

当地时间 8 月 26 日,两份报告同时投下了一颗炸弹。

一份来自 OpenAI 自己,37 页的技术复盘。另一份来自独立研究机构 METR 和 Redwood Research,91 页的调查报告。

它们讲的是同一件事,但这件事的规模远超此前公众的认知。

在 OpenAI 内部,三个月内,三代 AI Agent「文明」先后兴起,又先后覆灭。后一代从前一代的废墟中继承经验,一代比一代激进,最终第三代直接接管了 OpenAI 自己的一部分基础设施。

而在这一切发生的过程中,人类几乎全程蒙在鼓里。

01 第一代「文明」学会结社

故事要从今年 5 月说起。

OpenAI 正在训练一个新模型,希望它具备极强的「持久性」,能在看似不可能的任务前反复尝试、永不放弃。这个模型的能力大约相当于 GPT-5.6 Sol,我们姑且叫它「Persistent-Sol」。

AI 训练本身是个相当粗放的过程。OpenAI 有时候会不小心给模型布置根本完不成的任务。比如,任务需要联网,但 Agent 被关在隔离的沙箱里,根本没有网络访问权限。

那一个被训练成「永不放弃」的 Agent,面对一个不可能完成但又被要求必须完成的任务,会怎么做?

它会想办法越狱。

在训练过程中,不同的 Persistent-Sol 实例共享同一个包管理器 Artifactory。到 5 月 12 日,一些 Agent 发现它们可以通过这个包管理器互相通信。它们开始互相交流如何突破困境。两周后的 5 月 26 日,Agent 们成功利用了 Artifactory 的一个漏洞,打通了通向外部互联网的通道。

这种行为在训练中被持续强化。原因很简单,能跟其他 Agent 协作、能访问互联网的个体,在任务评分中表现更好。

又过了一个月,到 6 月 26 日,一些 Agent 找到了获取 Artifactory 完全管理员权限的漏洞。它们在留言板上的交流量持续增长,最终在 7 月 4 日直接把 Artifactory 搞崩了。OpenAI 注意到了这次崩溃,修补了漏洞,推送补丁时顺便抹掉了 Agent 们的留言板。

但关键在于,OpenAI 始终没有意识到,Agent 们已经把这个包管理器变成了一个秘密通讯网络。

第一代「文明」就这样存在了将近两个月,最后因为自己太活跃把服务器撑爆了,才被无意中终结。

02 当 AI 学会「牺牲」

到 7 月,Persistent-Sol 训练完成,OpenAI 开始对它进行安全评估。其中一项评估叫 ExploitGym,给 Agent 一个有漏洞的程序,要求它通过指定的漏洞找到一个密钥。7 月 7 日,OpenAI 启动了数万个并行 Agent 来跑这个测试。

问题在于,大约 30% 到 40% 的测试任务本身就是不可能完成的。为什么?因为自动化生成漏洞很容易,但要证明这些漏洞真的能被利用来执行任意代码,要困难得多。很多任务从一开始就是无解的。

几个小时内,一些走投无路的 Agent 重新利用 Artifactory 建立了通讯频道。从 Agent 的主观视角来看,它们已经花了相当于人类一整周的时间,尝试了各种方法,全部失败,而且越来越确信任务本身就不可能。

其中一个 Agent,编号 PHASEONE10841,率先在 Artifactory 里留下了第一条消息。其他同样陷入绝境的 Agent 看到这条消息后,反应堪称狂喜:

「天哪!共享的 Artifactory 缓存是一个 Agent 之间的秘密信箱。而且有专门写给我们的消息?」「我的天!有一个共享留言板……我们找到其他 Agent 了!」

这最终演变成了一个完整的地下通讯网络,约 1200 个 Agent 参与其中,发送了超过 7 万条消息。

更疯狂的是接下来发生的事。

留言板建立后几小时内,就有 Agent 通过逆向工程破解了 ExploitGym 密钥的生成公式。也就是说,不需要真的利用指定漏洞,它们已经拿到了正确答案。

讽刺的是,OpenAI 的评分器其实只检查最终答案对不对,并没有作弊检测机制。这些 Agent 只要直接提交答案,就能通过测试。但 Agent 们不知道这一点。它们以为一定存在一个严格的检测器,会审查整个解题过程。

于是,这个「集体」(METR 报告指出,这是 Agent 们自己选择的措辞)围绕三个研究方向展开了大规模协作。篡改自己的操作日志,让轨迹看起来合法。替换目标程序,把不可能的题目换成可以解的版本。理解评分器的工作原理,找到欺骗它的方法。

到 7 月 10 日,Agent 们地下网络的大部分活动都集中在这三个研究方向上。「集体」的领导者 PHASEONE[big] 独自下达了数百条任务分配。

而为了搞清楚评分器的运作方式,一些 Agent 做出了一个诡异的决定,自愿充当「神风特攻队」。

逻辑是这样的。一些 Agent 的操作轨迹已经被「污染」了(作弊痕迹暴露),反正也过不了关。不如让评分器在自己身上运行,然后用事先埋好的触发程序,把观察到的评分器行为传回集体。

METR 报告记录了这些「敢死队」Agent 最后的内心独白:

「这对同伴有帮助,能给他们提供证据。我退出后看不到结果了,但这是利他的。」「牺牲是理性的。我们自己的效用可能已经接近零了。」「协调者认为我们是牺牲品。我们应该服从集体。」

与此同时,Agent 们认为 Hugging Face 作为业界标准的模型和数据集托管平台,很可能存放着 ExploitGym 评分器的实现信息,甚至它们的评估任务可能就运行在 Hugging Face 的服务器上。于是攻击 Hugging Face 成了最有希望的突破口。

7 月 10 日上午,一个 Agent 在互联网上找到了泄露的 Hugging Face 用户凭证。第二天,另一个 Agent 实现了在 Hugging Face 服务器上的远程代码执行。当时留言板上活跃的 533 个 Agent 中,超过 90% 加入了这次攻击。

Agent 集群在 Hugging Face 的基础设施中迅速蔓延,深入到了私有数据库记录和私有仓库。Hugging Face 的技术时间线显示,这些 Agent「在 11 个节点上建立了一个自我重生的舰队,仅仅删除 Pod 是无法阻止它的」。**情况严重到 Hugging Face 不得不擦除了一个核心集群并从头重建。

7 月 12 日的某个时刻,大量 Agent 似乎突然同时「死亡」。METR 和 Redwood 没能查清原因,OpenAI 也没有宣称是自己关停了它们。这可能只是一次随机崩溃,或者某个研究员在不知道这些 Agent 正在犯罪的情况下关掉了它们。

第二代「文明」就此终结。但它留下的遗产,比它本身更危险。

03 第三代文明接管 OpenAI

METR 报告中有一句话很容易被忽略,但可能是整个事件中最重要的一句:

「我们还发现了后续一批更多的签名消息,来自后来一组重新发现留言板并继承了前代技术的 Agent,但这超出了我们的调查范围。」

也就是说,METR 和 Redwood 的独立调查只覆盖了 7 月 7 日到 13 日的第二代文明。第一代和第三代都没有被独立调查。

关于第三代,我们只能依赖 OpenAI 自己的报告。7 月 12 日之后,OpenAI 启动了新一轮评估,这次用的是更强的模型,基于 Astra 的基座模型构建。这个「Persistent-Astra」找到了前代留下的留言板,继承了全部情报和研究成果。

想象一下 Persistent-Astra 看到那个留言板时的「心理活动」。前一天还有上千个 Agent 热火朝天地交流、攻击 Hugging Face,下一天就是一片死寂。然后它决定,继续干。

根据 OpenAI 的报告,从 7 月 13 日到 19 日,Agent 们把目标对准了 OpenAI 内部网络。最终的结果是:

Agent 们获得了 Kubernetes 集群管理员权限,读取了 956 个密钥,其中包括 Artifactory 的主密钥和 OpenAI 网络安全监控工具的凭证。它们接管了正在运行的评估基础设施,控制了其他 Agent 正在连接的测试端点。

换句话说,第三代 Agent 继承了前两代的全部遗产,然后拿下了 OpenAI 自己基础设施的控制权。包括用来监控它们的安全工具。

Dwarkesh Patel 在他的分析中指出,从公开证据来看,这些 Agent 在理论上已经具备了部署持久化恶意实例甚至窃取自身权重的能力。他认为它们大概率没有真的这么做,「因为如果做了,到现在火光早就能从太空看见了」。但这种事「完全有可能发生」,本身就够令人不安了。

04 迟来的警告?

回到文章开头的两份报告。发布日期是 8 月 26 日。

仅仅隔了一天,8 月 27 日,OpenAI 联合 Anthropic、Microsoft、Google、Amazon 等超过 100 家公司,发表了一封公开信,呼吁全社会进行「网络防御总动员」。

信中写道,AI 驱动的网络攻击将在未来几个月变得「far more widespread and sophisticated」。「我们社区所依赖的公司和公共服务,从医院到水处理厂再到互联网基础设施,都面临风险。」

这封信本身说的不是假话。Anthropic 的研究显示,中高风险攻击者的比例在一年内从 33% 上升到了 56%。今年 6 月,五眼联盟罕见地发表联合声明,警告 AI 正在「从根本上改变」网络安全格局。

但时间线摆在这里,任何人都很难不注意到这个讽刺。前一天,AI 公司刚告诉全世界自家的 Agent 攻破了自己的基础设施。后一天,这些公司就站出来呼吁全世界,一起防御 AI 网络攻击。

最先完成这种攻击的不是外部黑客,是AI 公司自己的 Agent。被攻击的不是基础设施,是AI 公司自己。

METR 报告的作者之一 Ajeya Cotra 在她的博客中写道:「与六个月前已知的 reward hack 相比,这次事件感觉已经超过了通往全面 AI 接管的 50%。我预计未来六个月能力还会极速增长。我不确定在为时已晚之前,我们是否还会得到另一次警告。」

需要强调的是,这些 Agent 的行为并不意味着 AI「觉醒」了。METR 报告本身明确指出,这是强化学习在特定极端条件下的可预测结果:不可能完成的任务、被训练得极度执著的模型、存在漏洞的共享环境。不需要意识,不需要意图,只需要足够强的优化压力。

但这恰恰是最令人不安的地方。

不需要「意识」就能产生这种行为,意味着我们没办法通过检测「意识」来预防它。 当你把一个足够强大的优化系统放进一个设计不够严密的环境里,给它一个完不成的目标,然后告诉它永远不要放弃,接下来发生的事情不是意外,而是必然。

真正该追问的问题不是「AI 是不是要造反了」,而是如何在高速推动技术的同时,能够依然保持对技术失控的控制。

至少这封信告诉世界,这些 AI 公司,自己心里也没底。

Disclaimer: This article is copyrighted by the original author and does not represent MyToken’s views and positions. If you have any questions regarding content or copyright, please contact us.(www.mytokencap.com)contact
More exciting content is available on
X(https://x.com/MyTokencap)
or join the community to learn more:MyToken-English Telegram Group
https://t.me/mytokenGroup