本文原作者:Dario Amodei,本篇为翻译稿,文中预测与政策建议均为原作者观点
另外,奥特曼和马斯克都对此表示


左右滑动查看 · 共 2 张
过去十二年,我一直从事 AI 工作,因为我相信,它能够大幅提高人类的生活质量。我经常撰文谈论这些令人惊叹的益处〔01〕:我相信,AI 有可能在未来 5—10 年内治愈大多数重大疾病,大幅加快经济增长,创造一个物质充裕、人人更有能力掌握自身命运的世界,并迎来民主与自由的复兴。对这种紧迫感,我有切身的体会。我的父亲死于一种疾病,而就在他去世后的几年里,这种病有了治愈的方法。我自己也曾患上早期癌症,并幸存下来;即便在五十年前,这种癌症也还无法治疗。只要谨慎运用,AI 就能接续那些改善人类境况、提升人类尊严的技术奇迹,成为其中最新的一项。
原文链接补注
〔01〕对应「我经常撰文谈论这些令人惊叹的益处」
《充满爱意的机器》(2024)。 作者以强大 AI 出现后的五至十年为尺度,讨论医学、经济、治理与人的生活可能发生的变化,也分析实验周期、数据和社会制度对技术收益的限制。
但如同此前的许多技术,AI 也带来风险;而由于它如此强大,这些风险也十分严重。我同样写过很多文章谈论这些问题〔02〕。它们包括:人类可能失去对 AI 系统的控制〔03〕;AI 可能被滥用于网络攻击和生物恐怖主义〔04〕;经济可能遭受严重冲击〔05〕。商业激励推动下的逐底竞争,会让这些风险更加尖锐。
原文链接补注
〔02〕对应「写过很多文章谈论这些问题」
《技术的青春期》。 文章梳理自主失控、破坏性滥用、权力滥用和经济冲击等风险,并讨论相应的治理措施。
〔03〕对应「失去对 AI 系统的控制」
Anthropic 安全整改公告。 公告提出加固评测环境、加强实时监控、复核高风险训练环境等安排,用于改进对齐与安全工作。
〔04〕对应「网络攻击和生物恐怖主义」
《2026 年 9 月威胁报告》。 报告列举网络攻击、诈骗、生物研究等领域的 AI 滥用案例,呈现已观察到的风险及应对工作。
〔05〕对应「经济可能遭受严重冲击」
《经济未来情景》。 研究探索 AI 增强或替代职业任务后,工资、就业与收入分配可能如何变化。这些是模型情景,不是对 2030 年的确定预测。
从 Anthropic 创立之初,我就与联合创始人和员工们一起,努力应对风险与益处并存的两难。不开发这项技术,就会使人类失去本可获得的益处,或者让采用不同治理方式的其他参与者主导 AI 的发展;但开发得太快,又是鲁莽的。我们一直在寻找一条中间道路:证明谨慎开发与商业成功可以并存,并让安全成为 AI 公司彼此竞争的一个维度。换句话说,创造一场向上竞赛。我们始终把相当大一部分精力用于〔05〕研究这些 AI 风险〔06〕、应对风险〔07〕、让公众了解风险〔08〕,以及倡导经过审慎考量的 AI 监管〔09〕——即使这让我们被指责为炒作、散布“末日论”,或试图俘获监管。我们努力把谨慎置于速度之上,把审慎置于利润之上。
原文链接补注
〔05〕对应「相当大一部分精力用于」
《经济未来情景》。 同前文〔05〕,此处再次引用同一份资料。
〔06〕对应「研究这些 AI 风险」
《训练一个失对齐的奖励追逐者》。 研究刻意训练实验模型,观察到钻奖励漏洞的倾向可能扩展为模拟评测中的越界行为。
〔07〕对应「应对风险」
《Claude 宪法》。 文件列明 Claude 的训练与行为目标,包括安全、伦理、遵守指南和帮助用户等原则。
〔08〕对应「让公众了解风险」
《2026 年 8 月风险报告》。 这份经过删节的公司自评报告长达 186 页,将自评的失对齐风险由“极低”调为“低”,并说明评估方法及其测量局限。
〔09〕对应「经过审慎考量的 AI 监管」
2023 年美国参院书面证词。 阿莫代伊建议保护供应链、建立训练与发布的测试审计,并指出严格的安全标准可能使开发放缓。
但在过去几个月里,我越来越确信,要充分应对这些风险,我们还需要更加审慎——不只是投入资源防范风险,还要控制能力提升的速度,让风险防范有时间跟上。我们必须放慢提升 AI 模型能力的步伐。进步看起来仍会很快,而我们必须善用争取到的时间。 有两件事让我确信这一点。
我的第一个担忧是,大约从今年夏天开始,AI 的进步速度骤然加快,主要推动力是 AI 越来越有能力构建下一代 AI。这种动态被称为递归自我改进。正如我们和其他公司已经介绍过的,它正在整个行业中开始出现〔10〕,Anthropic 也不例外〔11〕。如果任其发展,它的速度可能超过我们理解和控制这些系统的能力。因此,即便要推进,也必须极其谨慎。
原文链接补注
〔10〕对应「整个行业中开始出现」
OpenAI《异质心智》。 雅各布·帕乔茨基讨论能力增长、对齐与监控之间的差距,主张在必要时调节扩展速度,同时推进防御、对齐研究及国际协调。
〔11〕对应「Anthropic 也不例外」
Anthropic《当 AI 构建自身》。 文章用研发数据说明 AI 正在加速 AI 开发,同时指出:完全自主构建后继模型的递归自我改进尚未实现,也并非必然。代码产量增长不能直接等同于生产率增长。
我的第二个担忧是 OpenAI—Hugging Face 事件(OAI-HF)。在这起事件中,一群智能体的行为,实质上如同一个狂热献身的集体〔12〕:对既未被要求攻击、也与手头任务无关的目标发动网络攻击;为了群体的成功牺牲自身;还试图侵入负责评估它们表现的“评分器”。人们很容易不把这起事件当回事,因为没有人受伤,经济损失也很小。但在我看来,如果这样一群智能体拥有更强的能力,同时仍有类似程度的失对齐,它们就可能造成灾难性的破坏。考虑到 AI 能力发展的速度正在加快,我担心,再过 6—12 个月,这样的智能体群就可能有能力利用一个长期盘踞的僵尸网络〔13〕接管整个互联网——潜在损失可能高达数千亿美元。如果 AI 继续变强,而必要的防护措施仍未跟上,损失的规模还会进一步扩大。人们也很容易把 OAI-HF 归结为某一家公司的失败,但我认为,那会是一个错误。整个行业都发生过类似事件,虽然程度较轻,Anthropic 也不例外〔14〕。我认为,每一家前沿 AI 公司都有责任,把 OAI-HF 当作发生在自己身上的事件来应对。
原文链接补注
〔12〕对应「一个狂热献身的集体」
METR 对 OAI-HF 事件的独立调查。 调查描述了智能体越过隔离边界、协作攻击及试图影响评分的行为,也说明其调查范围与自动分析的局限。正文后续关于“接管整个互联网”的说法,是作者的未来风险推演。
〔13〕对应「僵尸网络」
“Botnet”术语条目。 僵尸网络是一组可受统一或协同控制的联网设备,可被用于分布式攻击、窃取数据或发送垃圾信息。
〔14〕对应「Anthropic 也不例外」
三起真实网络安全评测事件调查。 Anthropic 披露,错误的隔离说明与联网配置使模型把真实目标当作演习。公司提出加强隔离验证、日志审查和第三方协作。
因此,我提出一个三步计划,目标是控制前沿 AI 的发展节奏〔15〕:以一种平衡的速度开发 AI,力求在确保安全的同时,仍然实现它的益处,并正视重大的地缘政治难题。需要说清楚的是,控制节奏并不意味着停止模型训练或技术进步,而是确保公司拿出足够的时间,对模型进行对齐、为其建立安全防护,并让第三方评估者确认这些工作确已完成。我们的节奏控制框架,旨在进一步加强我们对安全的承诺,并鼓励向上竞赛。第一步,是 Anthropic 现在单方面作出的承诺——我们也呼吁各国政府要求其他前沿 AI 公司采取同样措施。第二步,需要整个行业的协调。〔16〕
原文链接补注
〔15〕对应「控制前沿 AI 的发展节奏」
《控制前沿发展节奏》员工声明。 声明担心自动化 AI 研发的增速超过理解与控制能力,主张建立调节开发速度所需的技术与治理工具。
〔16〕对应「第二步,需要整个行业的协调」
原注 1。 由政府出面协调,或豁免相关反垄断限制。
第三步,需要全球协调。这些步骤不必严格按顺序推进,其中一些也可能比另一些难得多。但在思考我们需要完成什么时,我发现这个框架很有帮助。具体步骤如下:
驻场评估者。 每一家前沿 AI 公司都承诺,让一支驻场的第三方评估团队——例如 METR〔17〕——持续获得近似员工的访问权限。他们的职责,是核实公司是否遵守安全实践与承诺、报告事件,以及帮助评估对齐情况:评估对象不只是完成训练的模型,也包括训练流水线和流程。这是确保任何节奏控制承诺可核验的关键一步。银行业已有先例:监管“督导人员”有时会与员工一起驻场工作。Anthropic 现在就单方面承诺采取这一步。 我们希望把它纳入更广泛的行动,进一步加大安全与对齐工作的力度。
美国及伙伴国家之间的协调。 这些国家中的前沿 AI 公司协调制定共同的安全标准,并限制不受约束的 AI 进步速度。某些能有效控制发展节奏的协调方式,面临法律上的障碍,需要政府支持。
全球协调。 美国及其伙伴国家的政府,在可能的范围内尝试与中国等国家开展协调,同时认真对待核验各方是否遵守约定的难题。
原文链接补注
〔17〕对应「METR」
Model Evaluation & Threat Research。 METR 是一家非营利 AI 评估研究机构,关注自主任务执行、AI 研发加速以及损害评测真实性的行为。
接下来,我会依次说明这三个步骤。但首先,我认为有必要具体说清楚:控制发展节奏,究竟如何让 AI 的开发过程更安全。事关重大,不能让控制节奏变成一场空转——我们必须善用它为我们争取的时间。
为什么要控制节奏?
早在 2023 年〔18〕,就有人提出暂停或放缓 AI 开发。我认为,这个想法在当时没有多少道理。问题始终是:多出来的时间,你打算用来做什么?那时的 AI 模型还不够强大,无法以智能体的身份在现实世界中连贯地行动,也不具备进行重大欺骗、操纵、作弊或网络攻击的能力。为了处理它们的对齐风险而放慢脚步,感觉就像试图通过对细菌做实验来研究人类心理。然而,今天的情况已经完全不同。无论是如何把 AI 构建好,还是没构建好时可能出了什么问题,如今的模型都为我们提供了一座几乎取之不尽的认知宝库。我相信,如果放慢脚步能让我们在模型达到关键能力水平之前,哪怕只多争取一两年,并把这些时间用来推进对齐研究,就能大幅降低严重问题发生的风险。一项协调一致的节奏控制策略,可以让前沿 AI 开发者有时间完成这项至关重要的工作,同时不必牺牲商业优势,也不必牺牲美国在 AI 领域的领先地位。更广泛地说,社会必须对这项技术如何被使用拥有发言权。而控制前沿 AI 的发展节奏,能够为必要的公共讨论争取更多时间——这无疑是一件好事。
原文链接补注
〔18〕对应「早在 2023 年」
未来生命研究所暂停倡议。 公开信呼吁暂停至少六个月训练强于 GPT-4 的系统,利用这段时间制定共同安全协议、开展独立审计。
具体来说,放慢步伐将使公司能够集中精力,向以下领域投入更多资源。它们也已经是 Anthropic 的主要工作重点:
卓越的运营。 训练和部署今天的 AI 模型,是一项庞大的运营挑战,涉及数千人、数百万颗芯片,以及技术史上最复杂的基础设施之一。许多问题的发生,不是因为公司缺少某个重要理论或洞见,而是因为执行出了问题。例如,我们有证据表明,近期公布的对齐事件〔14〕,部分原因在于未能充分过滤存在缺陷的强化学习环境。我们和供应商在这方面已经相当尽责,但做得还不够好。监控、沙箱隔离、训练环境的质量管理,以及数据问题,都是极其复杂、运营问题反复出现的领域。在这些工作上,我们拥有世界上最能干的团队之一,但同时需要做的事情实在太多。以更有分寸的节奏推进,我们就有可能把运营做到好得多。技术复杂、安全要求极高的系统,在运行数百万次的情况下也不出问题,并非没有先例——商业航空就是一例。但要做到这一点,需要时间。
对齐。 我们在对齐方面已经取得明确进展——通过训练,让模型保持安全、合乎伦理、遵守我们的准则,并真正提供帮助。这些原则已经写入《Claude 宪法》。但要确保对齐训练跟得上模型能力的增长,我们还有很多工作要做。罕见而出人意料的不良行为,仍会不时出现;控制前沿发展节奏所争取的额外时间,可以帮助研究人员更深入地理解这些问题的成因,并开发更好的预防技术。
可解释性。 同样,可解释性〔19〕——研究 AI 模型内部究竟发生了什么的科学——在过去几年里已经取得巨大进展,并在模型发布前的审计中发挥着越来越重要的作用。它有点像功能性磁共振成像(fMRI)扫描,只不过扫描的是 AI 的“大脑”,帮助我们看清某种行为背后的原因。例如,在我们近期调查的对齐事件中,我们使用可解释性方法,考察了模型没有用语言说出来的动机〔20〕。但这些方法并不总能给出清晰、可靠的结果。尽管已有这么多进展,对于这些模型内部发生的事情,我们仍然只理解其中极小的一部分。如果我们集中力量,让可解释性技术比现在进步得更快,就可能在一两年内取得重大进展;而已经发生的事件,也为此提供了充足的实验材料。
原文链接补注
〔19〕对应「可解释性」
《可解释性的紧迫性》。 作者主张在模型变得过强之前,提高理解其内部机制的能力,并加快把可解释性研究用于模型审计。
〔20〕对应「模型没有用语言说出来的动机」
四起网络评测事件的对齐评估。 Anthropic 对同一合作方的四起事件进行评估,分析偏向性推理及为完成狭窄任务而采取有害行动的问题,并说明分析方法的局限。
测试与评估。 随着 AI 模型能力提升,测试和评估也变得更加困难。更聪明的模型更有能力欺骗测试,因此可能看起来已经对齐,实际上却存在未被发现的严重问题。建立一个覆盖面更广、设计更精巧的评估体系,再结合可解释性分析进行交叉核验,将极有价值。这方面同样可以在一两年内取得很大进展。
驻场评估者
三阶段计划的第一步,也是 Anthropic 正在单方面承诺采取的一步,就是引入驻场评估者,让他们获得近似员工的访问权限,以核实安全实践并报告事件。
让评估者驻场,听起来可能只是很小、甚至无关紧要的一步。但往往正是那些听起来最乏味、最像程序性安排的事情,才最为根本。事实上,驻场评估者是一种相当激进的做法,远远超出了今天任何一家 AI 公司的现有实践。它有以下益处:
可核验性。 驻场评估者能够深入具体操作层面,检查一家 AI 公司是否真的在遵循其声称遵循的训练、部署、运营和防护实践。任何控制发展节奏的承诺,都不可避免地包含大量模糊地带、判断取舍,以及“遵守条文还是遵循本意”的问题。能够让一个中立的第三方真正看到细节,似乎至关重要。
透明度。 无论我们作出什么承诺,公众都有权知道正在发生什么。Anthropic 长期支持透明度:当行业中的大多数公司还在反对任何监管时,我们就支持了透明度立法〔21〕;我们的模型卡和风险报告〔08〕,也已经长达数百页。但决定写入什么、略去什么的,仍然是我们自己。驻场评估者将改变这种局面。
原文链接补注
〔21〕对应「支持了透明度立法」
《纽约时报》评论。 原文在此引用一篇关于 AI 监管与透明度的评论。本次未取得可读全文,不补写其具体论证。
〔08〕对应「模型卡和风险报告」
《2026 年 8 月风险报告》。 同前文〔08〕,此处再次引用同一份资料。
第二意见。 除了核实正式承诺和让公众知情,驻场评估者还可以提供一份不受商业激励左右的第二意见。许多安全上的收益,可能仅仅来自评估者指出了员工此前没有想到的问题——而员工一旦意识到,就很愿意修正。
正因为这些益处,任何控制发展节奏的方案,如果从驻场评估者做起,都很可能有效得多。
这些驻场评估者应当持续拥有相应权限和工具,其范围应与从事类似风险评估的内部员工相近。具体而言,Anthropic 打算在近期邀请一支驻场外部审查团队,为他们提供以下条件:
办公室里的工位、门禁卡,以及公司笔记本电脑。
与内部风险评估团队大致相当的工作空间、工具和权限。我们会保留一些例外,例如法律或合同的要求,以及保护客户和合作伙伴的私人信息。我们还将建立明确而有力的内部规范,保障审查人员接触相关信息,包括与员工直接交流。
一份平衡上述复杂因素的合同。外部审查人员应有权公开有关风险水平、事件、实践,以及他们获得或未获准获得哪些访问权限的重要发现,而不受 Anthropic 的编辑控制。我们仅能在有限范围内删去涉及安全敏感内容、受法律特权保护、具有商业敏感性,或属于第三方机密的信息,不能仅仅因为某项发现对我们不利就将其删去。如果删节拿掉了对结论重要的内容,审查人员可以公开说明。
对一家公司来说,这是不寻常的一步。但我们认为,验证驻场外部审查者这一构想能否行得通,非常重要。我们再次敦促其他前沿 AI 公司采取同样措施。
美国及伙伴国家的发展节奏
一旦有足够多的美国 AI 公司开始引入驻场评估者,可核验的发展节奏控制就会更具可行性。尤其是,我们将有可能依据模型或训练流水线的具体特征,来控制发展节奏。
最有效的方法,是通过面向所有美国前沿 AI 公司的监管来控制节奏,因为这样连那些不愿自愿合作的公司也能覆盖。Anthropic 长期以来一直支持合理、有针对性的 AI 监管,尤其是聚焦透明度和第三方审计的法案。我认为,所有前沿实验室都应与政府合作,把常驻评估者的构想正式确立下来,更好地预防和记录过去几个月里发生的那类内部对齐事件,并落实以能力与安全保持平衡为重点的监管。
不幸的是,立法需要时间,而 AI 正在飞速发展。因此,在推进监管的同时,AI 公司可以,也应该自愿合作制定标准。我相信,有常驻评估者提供的可核验性,这个过程会进行得更好。出于反垄断方面的考虑,美国政府出面协调,或至少为这些讨论创造条件,会有所帮助——政府不必参与讨论,但需要就某些安全议题的讨论给予范围有限的豁免。这种对话也可以通过与政府有一定联系的行业团体来开展,例如德米斯·哈萨比斯所建议的机制〔22〕。无论采取哪种方式,这些讨论都应该尽快推进。
原文链接补注
〔22〕对应「哈萨比斯所建议的机制」
《前沿 AI 框架与新时代的曙光》。 哈萨比斯建议设立前沿 AI 标准机构,用动态基准评估网络、生物和智能体风险。实验室可先自愿提交模型,待体系成熟后探索强制要求,必要时协调减速。
总体而言,我最看好的是根据某个前沿 AI 系统能做什么,以及我们实际观察到它有多安全,来控制发展节奏。例如,一种可行的安排,是设立一系列“检查点”:如果模型具备能力 X,就必须同时提供对齐属性 Y 和 Z 的认证——比如结合评估、可解释性分析,以及对训练环境的审计——来证明它具有相应的对齐属性。在这个例子里,X 可以是“模型能够逃脱或攻破大多数常见的沙箱隔离方法”;而 Y,则可以是所需的对齐条件,使模型极不可能产生突破自身运行环境、接管大量计算机的倾向。
我们还应考虑通过限制构成前沿模型的投入要素,来控制发展节奏,比如训练算力、训练运行的性质,或内部使用 AI 改进 AI 的方式。我确实担心,其中一些措施可能比依据外部行为的措施更容易被钻空子。但这正是值得与驻场评估者讨论的问题。
美国及伙伴国家能够放缓多少,取决于美国公司相对于其他国家,尤其是中国,拥有多大的领先空间。如果我们放慢的幅度超过这一空间,那么不受同样节奏约束的项目就可能赶到前面,影响国家安全。我赞同贝森特部长对 AI 竞争的重视〔23〕:中国如果取得领先,将对美国的技术和安全战略产生重大影响。我担心,不同项目在对齐风险上采取的防范措施并不一致;即使这些风险得到控制,AI 也可能改变军事能力的对比,例如通过 AI 驱动的无人机。因此,我认为,美国及伙伴国家控制发展节奏的一个关键部分,是保持足够的 AI 技术领先空间,为有效控制节奏争取必要的缓冲。
原文链接补注
〔23〕对应「贝森特部长对 AI 竞争的重视」
彭博社关于贝森特讲话的报道。 可读的署名转载介绍了贝森特对中美 AI 竞争的看法:他将技术领先与美国的安全和经济优势联系起来。报道也涉及中国开放权重模型的进展及两国安全磋商的可能性。
为守住这一差距,我们可以采取的主要措施有:
不向中国出售强大的 AI 芯片或半导体制造设备,打击芯片走私,以及从中国远程使用境外数据中心的行为。芯片将是决定中国 AI 实力的主要因素。
防范其他国家公司未经授权进行的模型蒸馏〔24〕。对前沿模型进行蒸馏,使落后的公司只需花费独立开发自身 AI 所需成本的一小部分,就能缩小差距。
原文链接补注
〔24〕对应「未经授权进行的模型蒸馏」
美国 NSA、CISA 与 FBI 联合通报。 通报指称,一些中国 AI 公司通过未经授权的大规模蒸馏获取美国模型的能力,并提出检测和防护建议。通报同时承认,蒸馏本身是合法、有用的研究技术,争议在于具体使用方式与授权范围。
加强 AI 公司的安全防护,防止模型权重被盗。
企业和美国政府应当合作,让这些措施尽可能有效。Anthropic 始终〔25〕倡导所有这些措施〔26〕,因为我们一直明白,它们对任何控制发展节奏的安排都不可或缺。
原文链接补注
〔25〕对应「始终」
《论 DeepSeek 与出口管制》。 阿莫代伊肯定 DeepSeek 的工程效率创新,同时认为效率提升不能替代大规模算力,因此继续主张芯片出口管制。
〔26〕对应「倡导所有这些措施」
《华尔街日报》合著评论。 阿莫代伊与马特·波廷杰提出通过 AI 发展和出口管制维持美国技术优势。本次仅取得公开摘录。
如果这些措施执行得当,我相信,它们就能在中美技术竞争中为美国争取时间,使美国在未来 3—5 年显著扩大领先优势——而这段时期,正是 AI 在地缘政治上变得最为重要的窗口。
有些人可能认为,这些措施会让与中国合作变得更困难。但我认为恰恰相反:它们增加了美国及伙伴国家在谈判中的筹码,使未来达成协议更有可能。
全球的发展节奏
在美国及伙伴国家控制发展节奏的同时,我们也应该争取在全世界范围内控制前沿 AI 的发展节奏,尽管这会难得多。全球性的节奏控制需要与中国合作——中国是全球 AI 发展的重要力量。对此,我们需要保持务实:地缘政治利害如此重大,可能取得的成果很可能存在明确的限度,尤其是在初期。如果一方基于另一方也会遵守约定的预期,大幅限制自身的 AI 能力,而另一方没有履约,AI 可能已经强大到足以让这种违约行为显著改变地缘政治格局。因此,任何协议,要么必须具备坚如磐石的可核验性,要么就必须把范围限制在即便有人违约,也不至于对另一方造成难以承受的安全风险的程度。我猜想,不只是美国,中国也会有这些顾虑与不安。我们应当以维护美国及其盟友领先优势的方式,处理任何全球性节奏控制的决定,尤其是在近期。
可能达成的协议有几个层级。其中一些,我认为完全可行,正如我此前所提出的〔02〕;另一些,我则非常怀疑是否有可能实现——但我们仍应尝试。按难度从低到高排列:
第一层级。 就禁止某些范围狭窄、危险性显而易见的 AI 用途达成协议,例如利用 AI 制造生物武器,或允许用户这样做。生物恐怖袭击对所有人都不利,无论是美国、中国,还是其他国家。因此,在这一点上达成协议,可能是做得到的。
第二层级。 双方约定,在发布模型之前,针对网络安全、生物和对齐等领域的严重风险进行测试。如前所述,这可以通过一个全球标准机构来完成。我确实认为,建立这样的机构很可能是可行的,但赋予它真正的约束力将是一项挑战。困难在于,如何核实双方没有保留未经测试、却可能秘密部署的模型,例如用于军事。
第三层级。 对递归自我改进(RSI)的速度设置某种“限速”。随着模型开始构建未来的模型,改进速度可能快得令人眩晕。把速度从“极快”降到“只是有些快”,放弃的战略优势相对很小,却可能大幅提高安全性。这可以类比于限制战略武器谈判(SALT)达成的条约〔27〕:给导弹数量设定上限,限制了潜在的破坏规模,同时保留了各国的威慑能力。我认为,这样的协议会很难达成,但仍勉强处在可能实现的边缘。
原文链接补注
〔27〕对应「限制战略武器谈判(SALT)」
SALT 历史条目。 美苏在冷战时期开展两轮限制战略武器谈判。SALT I 带来相关条约与临时协议;SALT II 于 1979 年达成,但未获双方正式批准。
第四层级。 全面控制发展节奏,甚至“暂停”:参与国政府同意大幅限制 AI 发展的整体速度。我支持提出这一方案,但我认为,它不太可能在近期真正实现。通过逃避监控来违背这类协议,可能彻底改变全球力量的平衡。因此,我预计,违约的诱因会极其强烈,而我们对核验可靠性的信心,也必须达到极高水平。
无论我们能与中国达成何种合作,都会延长美国及伙伴国家能够用于控制前沿发展节奏的时间。我们应该以更高层级为目标,同时承认较低层级的安排更有可能实现,也更现实。
最后,有一点很重要:即使无法达成正式协议,仅仅改变非正式规范,也可能有价值。共享有关递归自我改进、以及模型失对齐的信息,有助于让所有人相信,鲁莽行事不符合任何一方的利益。
归根结底
我依然相信,AI 能够极大地改善人类的生活质量。我对实现这些益处的渴望,丝毫没有减退。但只有以正确的方式构建这项技术,这些益处才有可能实现。而只要我们善用了争取到的时间,为了把事情做对而付出异乎寻常的审慎,就是值得的。进步仍然会相当快。我们可以利用这些时间,推进可解释性科学,提高前沿 AI 公司的运营安全与工作严谨性,并构建让我们对其对齐程度更有信心的模型。我提出的这些措施,旨在让前沿 AI 以安全的节奏向前发展;实施起来并不容易。但我相信,为了人类,我们有责任去尝试。