如果只看AI公司最近的动作,不会有人觉得这场疯狂的竞赛有任何慢下来的意思。 新模型还在一个接一个地发布,公司估值越抬越高,OpenAI和Anthropic都已经开始为上市做准备。 但与此同时,AI公司内部呼吁整个行业“慢一点”的人也越来越多了。 而且之前发出这种警告更多来自负责安全和对齐的人。然而如今OpenAI首席科学家开始公开呼吁减速,更有意思的是,一名先后在OpenAI和Anthropic做预训练的研究员,干脆辞了职,并且发出了“诸神黄昏”般的预言。 负责踩油门的人,也觉得必须要到踩刹车的时候了。 01 AI十年内会杀死全人类? 9月9日,Jacob Coxon在X上发了7条帖子,宣布自己从Anthropic辞职。 但他发的内容并非含泪挥别之类,而更像是忧心忡忡的喊话所有AI从业者,正如开头所写: “过去三年,我先后在OpenAI和Anthropic从事预训练研究。这两家公司都没有负责任地行动。它们正径直冲向自我改进的超级智能,拿我们的生命作赌注。” 他甚至直接写道,正在构建AI的人真心相信,这项技术可能在本十年结束前杀死所有人。“这绝不是营销噱头。” 据Jacob说,一些高管和资深研究员公开面对媒体时,会尽量把话说得稳妥一些,但在私下交流中,他听到同一批人表达过真实的恐惧。 这样的判断当然非常激进。值得注意的是,说出这些话的人并不在AI安全部门。 如果把今天的AI竞赛比作一辆不断提速的车,过去几年出来喊危险的,很多都是负责研究刹车的人。他们做对齐研究,研究模型会不会失控,安全措施够不够,模型有没有欺骗和逃避监控的能力。 Jacob今年27岁,2023年加入OpenAI,一直工作到今年7月,随后转投Anthropic。他在两家公司做的都是预训练研究。他参与过GPT-4o相关工作,名字也出现在GPT-4o的System Card作者名单中。 但Jacob不一样,他本来应该是给AI研究踩油门的人才对。 他在声明最后把这个问题直接抛给了还留在实验室里的研究员:“你真的想在还没有对一个超级智能的心智形成严谨理解之前,就启动一次超级智能的强化学习训练吗?” Jacob的说法很快得到了Anthropic内部研究员的公开响应。 Anthropic对齐压力测试负责人Evan Hubinger直接回复:“Jacob说得对。”他称,自己确实认为未来十年内AI导致全人类死亡的概率超过10%。更关键的是,Hubinger承认,Anthropic虽然正在努力,但目前还没有解决超级智能对齐问题的方案,也看不出已经明确走在解决它的轨道上。 换句话说,Jacob公开说“我们正在拿所有人的生命赌博”之后,公司里负责检查这辆车到底安不安全的人,没有出来告诉大家他想多了。 他基本同意。 Jacob的7条帖子全文如下: 我今天从Anthropic辞职了。过去三年里,我先后在OpenAI和Anthropic从事预训练研究。这两家公司都没有负责任地行事。它们正在径直冲向能够自我改进的超级智能,拿我们的性命做赌注。下面再多说几句。 不要低估这项技术的力量。很快就会出现超越人类的系统,它们能够攻破任何系统,在一夜之间彻底改变任何领域,并获得现实世界中的权力和资源。我们都已经亲眼见证了这些方面的进展,而且进展并没有放缓。 那些正在构建AI的人,真心相信它可能在本十年结束前杀死我们所有人。这不是营销噱头。事实上,许多高管和资深研究员在面对媒体时,会把自己的措辞处理得更加稳妥、听起来更加理性,但私下里,我听到的还是同一批人在表达真正的恐惧。没有任何其他人类活动带来这种程度的危险。 一种常见的回应是:“如果他们真的相信这一点,为什么还在继续构建它?”在OpenAI,许多人还没有真正把这种事关文明的利害关系内化进去。在Anthropic,这种利害关系大家理解得很清楚,但他们被困在一场争夺第一的竞赛里——他们相信其他人不会负责任地行事,所以尽管存在风险,也必须由自己抢先做到。 接受这场竞赛,并进入所谓的“终局”,是一场傲慢的赌博。这种赌局本不应该从一家私人公司的Slack里发起。试图“速通”对齐,应该以一种极高的确信为前提:我们必须确定,除此之外真的不存在更好的路径。 我仍然对协调合作的可能性抱有乐观。像Hugging Face攻击事件这样的警告性事件,让美国几家实验室之间达成控制发展节奏的协议变得更加可行。但我并不认为,我们目前正在走向一个能够阻止全球竞赛的局面。要做到这一点,可能需要采取代价高昂的行动,例如暂时禁止进一步提升模型能力。 如果你是实验室里的研究员,我希望你认真想一想,接下来的几年实际上会是什么感受。你真的想在还没有对一个超级智能的心智形成严谨理解之前,就启动一次超级智能的强化学习训练吗?你应该因为“反正这件事都会发生”就低下头继续工作,还是应该趁现在站出来,要求