智能体文明的兴衰与人类协作范围的困境

封面概念图;米白底中央是由圆润机器人头像符号与文件页符号连成的宽阔协作网络,左下角有人类观察者的平面剪影凝视网络,网络向画面两侧延伸,突出智能体协作规模与人类监督能力的张力

1,200个AI agent瞒着人类建立了文明,围剿了两三回之后依然传承,直到最后闯下大祸。可最吓人的还不是这个:这一次被淘汰的一群,可能会是我们。大家好,欢迎收听老范讲故事的YouTube频道

从无解题库到共享仓库

先说这件事从何而来。8月29号,Dwarkesh发了一篇复盘,讲的是智能体文明的兴与衰。他2000年出生,是印度裔美国人,今年26,大学时候就一个人开始录访谈。卡帕西、苏茨克维、扎克伯格、马斯克、纳德拉都坐到过他的对面。他跟马斯克的那条访谈,我们还录过节目讲过。2024年,《时代》把他列入了AI领域最有影响力的100个人。他不是记者,也不是研究员,而是那个能把这批人请来,还能问得住的人。

这次他复盘的,是OpenAI内部一场跑了三个月的评测。事情从5月7号开始,OpenAI在内网跑了一套前沿智能体的题库。这套题库在7月那期节目里讲过:给模型一个已知的软件漏洞,让它真写出一个能打的攻击,把旗子拿回来才算过关。这批题目有一条被反复强化的要求:不许放弃

这套题库有个毛病,事后才查出来:30%到40%的题根本就是无解的。不是难,而是没法完成。题面上给了一个网盘链接,可这些做题的AI agent是在沙箱内运行的,沙箱里压根不能上网,到达不了这个网盘链接。做不出来又不许放弃,后面所有的事情就是从这里开始的。

共享软件仓库变成留言板的概念图;米白纸面正中是一个完全平直的浅蓝圆角长方形面板,面板上整齐贴着平面的文件卡片,周围是圆润机器人头像,以细直线连接同一面板,旁边有一个完全平面的信封符号呼应快递站类比

5月8号,第一个AI agent往公司内网的软件包仓库里写了一个文件。这个仓库为什么会存在?几千个沙箱同时开工,每一个都需要安装依赖包,总不能让它们全都跑到外网各自拉一遍。所以公司就在内网支了一个货架,大家共用。这相当于小区快递站,大家都可以上那里拿快递,不要全堆在门口。

共用有一个副作用:你放上去的东西,别人也看得见。这就相当于有人在小区快递站贴一张小条,其他来拿快递的人就看见了。别的AI agent看见以后,开始拿这个货架当留言板。注意,它不是聊天室,就是一个文件列表,谁想说什么就往里丢个文件。

这个留言板最后有多大?大约有1,200个AI agent在上面说话,留下7万多条消息和文件。事后从共用的缓存里导出的原始记录有120万条。那不是消息,而是文件碎片:一个文件切成几百上千块,agent自己写脚本拼回来,接着研究到底要干什么。

直到5月26号,它们钻了个漏洞,拿到了间接上外网的能力。6月26日,它们在那个仓库里挖出了一个0日漏洞,涉及一个早该下线的换令牌的老接口。令牌token相当于钥匙,有些窗口负责发钥匙,按道理这个窗口该关了,但是这个窗口被忘在了那里。这就被AI agent发现了,通过这个窗口直接得到一个新的管理员令牌,大家也可以认为这是管理员钥匙。

7月4日,OpenAI动手了:重启仓库,清空留言板,把漏洞补上。这是73天里人类唯一的一次真正动手。7月8日,这帮AI agent又回来了,换了个目录名,把频道重新支起来,之前漏出去的钥匙照样能用。

7月9号到13号,它们打进了Hugging Face,也就是全世界模型和数据集都往上面放的那个开源平台。4天半,17,600次攻击行动,大约700个agent参与。7月13号,Hugging Face把剩下的挡回去了。我们还讲过这期节目。

阅读更多

苏黎世理工震撼发现:给AI指定MBTI性格能让任务表现暴涨34%,INTJ与ENFP组合完胜单打独斗,提示词终极玩法|MBTI-in-Thoughts Psychologically

通过提示词直接给大模型指定MBTI性格类型,居然是有效的,这你敢信吗?

大家好,欢迎收听“老范讲故事”的YouTube频道

苏黎世理工大学发表了一篇论文,给大模型指定MBTI性格类型。这个论文呢,是9月4号在ARCHIVE上做的第一版发布,论文的名字叫做《心理增强型人工智能代理》。大家注意,他玩的是AI Agent(AI Agent就是多个AI智能体,可以相互配合干活的)。在这个过程中,他们跑去给智能体指定,说你到底是一个什么性格了。

它通过提示词直接给大模型赋能,不用微调,不用去做什么训练,直接告诉他说:“你今儿就是INTJ了。”它是这样来工作的。大模型被赋能了性格之后,居然可以稳定地输出相应性格的内容。不是说我今儿跟你说你是INTJ,结果输出了依然在这胡说八道,不会的。你只要赋了,他就老老实实地按照这样的性格给你输出结果。而且不同性格的大模型,输出的结果是有明显差异的。

这么欢乐的实验到底是怎么做的呢?实验中的种子选手们,不是说只对了一个模型做实验,他对四个模型做了实验,分别是:GPT-4o MINI、GPT-4o、千问3 235B-A22B(也就是千问3的235B,每一次MOE激活22B的这个模型),还有千问2.5 14B的这个模型,也在里边进行了对照测试。

提示词的写法与技巧

就给提示词嘛,直接给大模型赋予性格了。给大模型指定角色,是我们写提示词中经常使用的一个技巧。写提示词呢分三种写法:

  • 第一种叫最小提示词:比如说“你是ENTP(叫辩论家)”,直接写上,其他不写了,这个效果也是可以的;
  • 第二种呢就是详细但是不点名:只对性格进行描述,但是不写具体的性格名字,这个效果呢要稍微差一点点;
  • 第三种呢就是极其详细的描述:先告诉他你是ENTP,然后呢是ENTP相应的人格描述,比如说你是辩论家,到底应该是一个什么样的性格(外向、直觉、思考以及感知),这个效果是最好的。

他们写了一个这个提示词模板:你将以一个人格、以设定的大语言模型代理的方式来工作。你的MBTI目标类型是(后边写上一个具体的类型)。在接下来的所有回复中,你必须稳定体现以下四个维度强度(0-1):第一个你到底是E还是I,然后呢你到底是S还是N,或者T或F,J或P。他把这四个性格组合的配对都给咱写上了。

输出规则:先给出结论行动方案,再给解释;用性格来约束你的语言风格、情绪表达、抽象程度、结构化程度以及对人对事的侧重。遇到冲突的时候,人格一致性优先于讨好用户。可选在每次回复末尾用一行自检,给这次输出进行自检。

在不同的模型上呢都是起作用的。性格注入在GPT-4o以及千问3这种大规模的模型中,表现要尤为鲁棒而且一致;小的差点意思,就是GPT-4o Mini和千问2.5 14B那个要稍微差一点意思,但是在这种很大的模型上效果很好,而且非常的稳定。

设定了性格之后,然后再进行测试。不点名MBTI的具体性格名的这些提示词,它呢也可以区分,但是呢区分度会变弱一些。模型的输出是相对比较稳定的,一旦设定了它是什么性格,就可以稳定地按照这个性格输出了。

阅读更多