Anthropic 研究员因担心 AGI 失控而辞职:或十年内致人类灭绝

作者:AGI Hunt 发布:2026-09-09 10:11 收录:2026-09-09 14:15 6 次阅读 约 1661 字
摘要:一名做了三年预训练的研究员宣布辞职并退出 AI 行业
推荐理由:本文涵盖「Anthropic」、「AGI」、「OpenAI」等多个主题,重点关注 Anthropic。

刚刚的一则炸裂消息:Anthropic 的一名研究员 Jacob Coxon 宣布辞职,并且直接退出了整个 AI 行业

WSJ 报道截图
WSJ 报道截图

他的理由是,Anthropic 和它的竞争对手们正在竞相打造一种他们自己都无法控制的系统,而这类系统可能在本十年末就会失控,甚至毁灭人类

三年预训练,两家都待过

01

Jacob Coxon 过去三年一直在做 AI 预训练研究,而且是在最前沿的御两家公司:先是 OpenAI,后来跳槽到了 Anthropic。

而他当初从 OpenAI 去离开 Anthropic,也正是因为 A 社在业内以重视安全著称。换句话说,他是奔着安全去的。

而在 Anthropic 认真工作了一段时间之后,他的结论是:

即便是最认真对待安全的公司,在没有政府干预或行业协调减速的情况下,也无法负责任地开发 AGI。

辞职公告
辞职公告

他在 X 上发了一条长 thread,开头写道:

我今天从 Anthropic 辞职了。过去三年我在 OpenAI 和 Anthropic 都做过预训练研究。两家公司都没有在负责任地行事。它们正在全速冲向自我改进的超级智能,拿我们的生命做赌注。

到明年年底可能就失控了

02

在接受 WSJ 采访时,Coxon 给出了一个时间判断:

照目前的轨迹,到明年年底,很多最激进的场景可能就已经失控了。

他担心的核心是递归自我改进,也就是 AI 接管了足够多的 AI 研究工作,开始加速开发比自己更强的后继者。

一旦这个循环启动,人类可能就,再也插不上手了。

而让他最终下定决心离开的,是他认为在公司之间的竞争压力下,安全方面的妥协几乎不可避免,尤其是还有中国的新兴竞争对手加入了这场赛跑。

两家公司,两种「不负责」

03

在他的 thread 里,Coxon 对 OpenAI 和 Anthropic 做了个很有意思的区分:

在 OpenAI,很多人其实并没有真正内化这件事的文明级别的风险。

风险
风险

而在 Anthropic 则不同,风险是被充分理解的,但他们锁定在了一场竞赛里:他们相信没有别人会负责任地来做这件事,所以必须自己来,哪怕要承担巨大的风险

Coxon 评价:

接受这场竞赛并进入「终局」,是一种傲慢的赌博,不应该从一家私人公司的 Slack 频道里发起。试图在对齐问题上走捷径,需要你对「不存在更好的路径」有异常强的信心才行。

MacBook 上的曼哈顿计划

04

而在 WSJ 的采访里,Coxon 提到:

疯狂的是,这一切发生在旧金山几个工程师的 MacBook 上,而不是当年曼哈顿计划所在的沙漠地堡里。

曼哈顿计划造核弹的时候,那是在新墨西哥州的沙漠里,有军事管控,有政府全程介入,有严格的安全协议。

狂妄的冒险行为
狂妄的冒险行为

而今天,可能影响全人类命运的 AI 系统,正在几个创业公司的办公室里、工程师的笔记本电脑上被造出来。

没有沙漠地堡,没有军事管控,甚至没有一个像样的国际监管框架(有的只是几份自愿签署的安全承诺书)。

2 万亿美元

05

这件事还有个背景是:Anthropic 正在筹备高达 2 万亿美元估值的 IPO

这就成了一个非常微妙的矛盾。

Anthropic 同时在要求世界相信两件事:

一是,越来越强大的 AI 可以创造巨大的经济价值,大到足以支撑 2 万亿的估值。

二是,当 AI 能力跨过危险阈值时,开发可能需要放缓甚至暂停。

那么问题来了——

当遵守安全承诺变得在商业上代价高昂的时候,这些承诺还能不能约束住自己呢?

这也正是 Coxon 选择离开的深层原因之一。他并不否认 Anthropic 在安全上是认真的,但他认为,在没有外部约束的竞争环境下,「认真」可能是不够的。

并非第一个

06

而 Coxon 也不是第一个因为安全顾虑而离开前沿实验室的人了。

过去两年里,类似的事情已经有过很多次。

OpenAI 的超级对齐团队负责人 Jan Leike 在 2024 年辞职后加入了 Anthropic,当时他公开表示安全文化和流程「在闪亮的产品面前已经退居二线」。而 OpenAI 的联合创始人 Ilya Sutskever 也在同一时期离开(虽然原因不尽相同)……

而 Coxon 这次辞职的区别是:他不是从一家「不够安全」的公司跳到了一家「更安全」的公司。他从全行业最重视安全的那家公司里,得出了「这还不够」的结论,然后选择了彻底离开

Encode 创始人 Sneha Revanur 在转发时说,这需要勇气。她提到,辞职不一定是每个人的正确答案,但更多人需要诚实地面对 Coxon 提出的那个问题:

你想在对 AI 的心智缺乏严格理解的情况下,启动一个超级智能的 RL 训练吗?你该因为「反正都会发生」就低头继续干吗——还是该抓住这个时机,呼吁改变开发条件?

协调合作的可能

07

Coxon 也不是全然悲观的。

协调合作的乐观态度
协调合作的乐观态度

他说自己对实验室之间的协调持乐观态度,最近的一些安全事件(比如 Hugging Face 被攻击)已经让实验室间的限速协议变得更加可行了。

但他也承认,要阻止一场全球性的竞赛,可能需要一些代价高昂的措施,比如暂时禁止提升模型能力。

呼吁建议
呼吁建议

这个呼吁,在当下这个 AI 军备竞赛的大环境下,听起来可能有些天真……但也正因为它来自一个在两家最前沿实验室做过预训练研究的研究员,或者也才更值得认真对待。

AI 真的会杀死人类吗?你怎么看呢?

◇ ◆ ◇

•  WSJ 原文:https://www.wsj.com/tech/ai/anthropic-researcher-quits-over-out-of-control-ai-fears-707b7628 

•  Jacob Coxon 的 X 长文:https://x.com/hilbertspaess/status/2097476196791709843 

•  Hacker News 讨论:https://news.ycombinator.com/item?id=49619227 

转载声明:本文转载自原发布平台 (作者:AGI Hunt), 原文标题《Anthropic 研究员因担心 AGI 失控而辞职:或十年内致人类灭绝》, 查看原文。 版权归原作者及原发布平台所有,本站仅作收录与展示,未对正文内容作实质性修改; 若涉及侵权请联系本站处理。