Anthropic研究员Jacob Coxon辞职与AI竞赛的安全困局

封面采用左右对峙的正面信息图:中央是刚离开座位的预训练研究员,一手指向加速踏板、一手举起刹车警示牌;左侧排列OpenAI与Anthropic名称标识,右侧用赛车、警报三角与人群图标呈现技术竞赛、末日警告和围观规模之间的冲突

造AI的人亲口说了:这项技术10年内可能杀死全人类。1.3亿人围观,发话的正是踩油门的研究员,可Anthropic的2万亿IPO照样停不下来。大家好,欢迎收听老范讲故事的YouTube频道。先花30秒把“踩油门”这件事说清楚:造大模型分好几道工序,预训练是最核心的那一道,把海量数据灌进算力集群,亲手把模型能力喂出来;负责预训练的研究员,就是流水线上踩油门的那个人。

以前喊AI危险的,都是研究刹车的人:做对齐的、做安全的,或者外面的学者。他们喊了十几年,大家已经耳朵都听出茧子来了,反正不是造它的人自己在喊。这一次不一样了,是亲手把GPT-4o喂出来的人辞职以后说:“我要踩刹车了。”事情先摆在这里,每个人心里大概都要问6个问题:第一,这7条贴文到底说了什么狠话?第二,考克森到底是谁,凭什么他说话有人信?第三,他图什么,钱都不要了吗?第四,公司自己人怎么说?第五,一条辞职帖凭什么3天过亿?第六,这件事情最后该怎么办,真停得下来吗?咱们一个一个来说。

踩油门的人发出七条警告

首先,这7条都说了什么?考克森是9月8日晚上发的帖,一共7条,每条都能单独拎出来上热搜。第一条是辞职声明,也就是总纲。他说:“我今天从Anthropic辞职了。过去三年,我在OpenAI和Anthropic都做预训练。这两家公司都没有负责任的行动,他们正一头扎进能够自我改进的超级智能,拿我们的命下注。”注意,“自我改进的超级智能”是整件事情的题眼,后面还要反复出现。

第二条讲能力。他说,别低估这项技术,这些系统很快会变成超人级的,能黑掉任何东西,拿到现实世界的权力和资源,进展没有放缓。第三条是传播最广的一条。他说,造AI的人真心相信,这项技术可能在本10年结束前杀掉全人类。大家注意,前面讲的是10年内杀掉全人类;如果是本10年结束前杀掉全人类的话,那就还有4年,这更吓人一点。很多高管面对媒体把话说得很理性,私底下都在表达恐惧;没有其他任何人类活动带来过这种级别的危险。

第四条回答那个最常见的反问:既然真信,为什么还在造?他给了两个诊断。在OpenAI,很多人根本没把文明级利害内化进心里,这是无知之错;在Anthropic,利害关系大家都懂,但被锁死在必须第一个冲过去的竞赛里,这是囚徒困境之错。一家没看清,一家看清了也停不下来。

第五条是叙事上最狠的一条。他说,接受这场竞赛、进入所谓的终局,是一场傲慢的赌博;这些赌局本不该从一家私人公司的Slack频道里发动。他接受《华尔街日报》专访时说得更直白:这种事情本来应该发生在沙漠里的掩体中,像曼哈顿计划那样,现在却发生在旧金山几个工程师的MacBook上。这句话成了全网传播最广的金句。

第六条讲方案。他说,对实验室之间的协调还有希望,Hugging Face被攻击那件事情算一记警告射击;但要阻止全球竞赛,可能需要临时禁止一些提升模型能力的事情。第七条是写给同事的。他说:“你真的想在还没有搞懂一个超级智能的心智之前,就启动一次超级智能的强化学习训练吗?你是觉得反正这事会发生,就埋头干,还是站出来要求换一种条件呢?”他的判断是,到明年年底,在很多最激进的场景下,事情可能已经失控了。

一条辞职帖,把自己公司的底、竞争对手的底、整个行业的底全掀了。可掀底的人不是研究刹车的人,而是亲手踩油门、把模型能力催出来的那个人。那么,考克森到底是谁呢?

阅读更多