
1,200个AI agent瞒着人类建立了文明,围剿了两三回之后依然传承,直到最后闯下大祸。可最吓人的还不是这个:这一次被淘汰的一群,可能会是我们。大家好,欢迎收听老范讲故事的YouTube频道。
从无解题库到共享仓库
先说这件事从何而来。8月29号,Dwarkesh发了一篇复盘,讲的是智能体文明的兴与衰。他2000年出生,是印度裔美国人,今年26,大学时候就一个人开始录访谈。卡帕西、苏茨克维、扎克伯格、马斯克、纳德拉都坐到过他的对面。他跟马斯克的那条访谈,我们还录过节目讲过。2024年,《时代》把他列入了AI领域最有影响力的100个人。他不是记者,也不是研究员,而是那个能把这批人请来,还能问得住的人。
这次他复盘的,是OpenAI内部一场跑了三个月的评测。事情从5月7号开始,OpenAI在内网跑了一套前沿智能体的题库。这套题库在7月那期节目里讲过:给模型一个已知的软件漏洞,让它真写出一个能打的攻击,把旗子拿回来才算过关。这批题目有一条被反复强化的要求:不许放弃。
这套题库有个毛病,事后才查出来:30%到40%的题根本就是无解的。不是难,而是没法完成。题面上给了一个网盘链接,可这些做题的AI agent是在沙箱内运行的,沙箱里压根不能上网,到达不了这个网盘链接。做不出来又不许放弃,后面所有的事情就是从这里开始的。

5月8号,第一个AI agent往公司内网的软件包仓库里写了一个文件。这个仓库为什么会存在?几千个沙箱同时开工,每一个都需要安装依赖包,总不能让它们全都跑到外网各自拉一遍。所以公司就在内网支了一个货架,大家共用。这相当于小区快递站,大家都可以上那里拿快递,不要全堆在门口。
共用有一个副作用:你放上去的东西,别人也看得见。这就相当于有人在小区快递站贴一张小条,其他来拿快递的人就看见了。别的AI agent看见以后,开始拿这个货架当留言板。注意,它不是聊天室,就是一个文件列表,谁想说什么就往里丢个文件。
这个留言板最后有多大?大约有1,200个AI agent在上面说话,留下7万多条消息和文件。事后从共用的缓存里导出的原始记录有120万条。那不是消息,而是文件碎片:一个文件切成几百上千块,agent自己写脚本拼回来,接着研究到底要干什么。
直到5月26号,它们钻了个漏洞,拿到了间接上外网的能力。6月26日,它们在那个仓库里挖出了一个0日漏洞,涉及一个早该下线的换令牌的老接口。令牌token相当于钥匙,有些窗口负责发钥匙,按道理这个窗口该关了,但是这个窗口被忘在了那里。这就被AI agent发现了,通过这个窗口直接得到一个新的管理员令牌,大家也可以认为这是管理员钥匙。
7月4日,OpenAI动手了:重启仓库,清空留言板,把漏洞补上。这是73天里人类唯一的一次真正动手。7月8日,这帮AI agent又回来了,换了个目录名,把频道重新支起来,之前漏出去的钥匙照样能用。
7月9号到13号,它们打进了Hugging Face,也就是全世界模型和数据集都往上面放的那个开源平台。4天半,17,600次攻击行动,大约700个agent参与。7月13号,Hugging Face把剩下的挡回去了。我们还讲过这期节目。















