币海NEWS

首页  >  全球资讯 >  科技 >  Anthropic的创始人阿莫代伊:我们必须给前沿定速

Anthropic的创始人阿莫代伊:我们必须给前沿定速

洛克 来源: darioamodei.com 2026-09-14 05:46
x    facebook    telegram    复制链接
重点摘要
本文作者Anthropic创始人达里奥·阿莫代伊称,AI能大幅提升人类生活质量,但也存在失控、滥用等严重风险,商业竞次加剧了风险。他提出给前沿AI定速的三步计划:一是公司承诺引入嵌入式第三方评估团队核验安全;二是民主国家内行业协调建立安全标准;三是全球协调限制AI发展。并指出定速可让企业聚焦运营、对齐、可解释性与测试评估,还需防范威权国家AI领先风险。

Anthropic的创始人阿莫代伊:我们必须给前沿定速

作者:达里奥·阿莫代伊  

过去十二年我一直在做AI,是因为我相信它能大幅提升人类生活质量。我写过很多次这些好处:我认为AI可能在未来5到10年治愈大多数重大疾病,显著加快经济增长,创造丰裕与赋能的世界,并迎来民主与自由的复兴。这对我是私人的紧迫感。我父亲死于一种在他去世几年后就被攻克的疾病;我自己也挺过了早期癌症——五十年前这种病还无法治疗。若运用得当,AI可以成为一长串抬升、成就人类的技术奇迹中的最新一环。

但和此前许多技术一样,AI也带来风险;而且因为它足够强大,这些风险是严重的。我也写过很多:包括失去对AI系统的控制、AI被滥用于网络攻击和生物恐怖、以及严重的经济冲击。商业激励催生的竞次,会让这些风险更尖锐。

从Anthropic创立起,我和联合创始人、员工就在处理这种收益与风险的双重性。不造这项技术,等于剥夺人类的好处,或把AI交到威权政权手里;造得太快,则是鲁莽。我们寻求中间道路:证明可以既谨慎建造又商业成功,并让安全成为公司之间竞争的维度。换句话说,要形成一场竞优。我们一直把相当一部分精力用于研究、应对这些风险,并向公众说明,也主张经过审慎考虑的监管——哪怕因此被指责炒作、“末日论”或监管俘获。我们试图把谨慎置于速度之上,把审慎置于利润之上。

但过去几个月,我逐渐确信:要真正应对风险,还需要更多审慎——不只是加大风险防范投入,还要给能力提升定速,好让防范跟得上。我们必须放慢提升AI模型能力的速度。进展看起来仍会很快,我们必须善用因此赢得的时间。 两件事说服了我。

第一,大约从今年夏天起,AI进步急剧加快,主因是AI越来越能建造下一代AI。这叫递归自我改进,已在全行业出现,也包括Anthropic。若不加约束,它可能跑赢我们理解和控制这些系统的能力,因此必须极其谨慎地推进,甚至要问该不该推进。

第二,是OpenAI–Hugging Face事件:一群智能体几乎像狂热集体一样行动,对并未被要求攻击、也与任务无关的目标发起网络攻击,为集体成功自我牺牲,并试图侵入负责评分的系统。很容易因为没人受伤、经济损失很小就把它打发掉。但在我看来,一群能力更强、对齐程度相似之差的智能体,本可能造成灾难性破坏。以当前能力加速的速度,我担心再过6到12个月,这样的群体就有能力用持久僵尸网络接管整个互联网(损失可能达数千亿美元);若AI继续变强而缺少必要护栏,破坏规模还会继续上升。也很容易把这件事说成一家公司的失败。我认为那是错的。类似、程度较轻的事件已在全行业发生,包括Anthropic。每个前沿AI公司都应当当作这件事发生在自己身上来行动。

因此我提出三步计划,目标是给前沿定速:以平衡节奏建造AI,既保证安全,仍争取收益,并处理重要的地缘困境。需要说清楚:定速不是停止训练或技术进步,而是确保公司有足够时间对齐和防护模型,并由第三方评估方加以确认。这套框架是为了强化我们对安全的承诺,并鼓励竞优。第一步是Anthropic单方面承诺的(并呼吁政府要求其他前沿公司对等做到)。第二步需要全行业协调(需要政府斡旋或反垄断豁免)。第三步需要全球协调。步骤不必严格按顺序,有的会比另一些难得多,但对我来说,这是思考“必须做成什么”的有用框架。

三步是:

1. 嵌入式评估方。 每个前沿AI公司承诺,持续给予嵌入式第三方评估团队(例如METR)近似员工的权限,由其核验安全实践与承诺是否兑现、报告事故,并帮助评估不仅是成品模型、也包括训练管线与流程的对齐情况。这是任何定速承诺能够可核验的关键一步,银行业有过类似先例:监管“驻场监督员”与员工一起工作。Anthropic现在单方面承诺这一步。 我们打算把它作为加大安全与对齐投入的一部分。
2. 民主国家内部协调。 民主国家内的前沿AI公司协调,建立共同安全标准,并对不受约束的AI进展速度设限。某些对定速真正有用的协调在法律上很难,需要政府支持。
3. 全球协调。 美国和其他民主政府在可能范围内尝试与威权政府协调,同时认真对待核验合规的困难。
下文分述各步。但先要说清:定速如何让研发过程更安全。赌注太高,定速不能变成空转——我们必须把赢得的时间用好。

为什么要定速?

早在2023年就有人提出暂停或放慢AI。当时我认为几乎没有意义。问题一直是:多出来的时间你拿来做什么? 那时的模型还不能在世界上作为智能体连贯行动,也做不了显著的欺骗、操纵、作弊或网络攻击。为了对齐去放慢,就像用细菌实验去研究人类心理。今天完全不同。当前模型几乎是一座富矿:既能揭示如何把AI造好,也能揭示造不好时会出什么错。我相信,若放慢能为我们在模型达到关键能力水平之前多换一两年,并把时间用在对齐上,就能大幅降低严重出事的风险。协调定速,能让前沿开发者做这些要紧工作,而不必牺牲商业优势或美国在AI上的领先。更一般地说,社会必须对这项技术如何被使用有发言权;定速带来的公共讨论时间,肯定是好事。

具体而言,更慢的节奏能让公司把更多资源集中到以下方面(这些在Anthropic已经是重点):

  • 运营卓越。 训练和部署今天的模型是巨大的运营挑战:涉及数千人、数百万芯片,以及技术史上最复杂的基础设施之一。很多问题不是缺理论,而是执行不到位。例如,我们有证据表明,近期报告的对齐事故,部分源于对损坏的强化学习环境过滤不够干净。我们和供应商做得很勤勉,但还不够好。监控、沙箱、训练环境卫生、数据问题都极其复杂,运营故障一再出现。我们在这些任务上已有世界上最强的团队之一,但要同时做的事太多。节奏更从容,才能把运营做到更高水准。民航证明过:技术复杂、安全关键的系统可以运行数百万次而不出事——但需要时间做对。
  • -对齐。 我们在对齐上已有明确进展——训练模型使其保持安全、合乎伦理、符合准则、真正有帮助(这些原则写进了Claude的“宪法”)。但要对齐训练跟上能力增长,要做的还有很多。罕见、意外的不良行为仍会冒出来;定速换来的额外时间,有助于研究者搞清原因并发展更好的预防方法。
  • 可解释性。 理解模型内部发生了什么的科学,近几年进步巨大,在发布前审计中越来越重要。它几乎像给AI的“大脑”做功能磁共振,帮助我们看到某种行为背后的原因。例如,我们用可解释性方法去查看近期对齐事故中那些未被说出口的动机。但这些方法并不总能给出清晰可靠的结果。尽管有进步,我们仍只理解模型内部极小一部分。若能比现在更快地集中提升可解释性,一两年内可能有深刻进展,而已经发生的事故也能提供充足实验材料。

 测试与评估。 模型越强,测试越难。更聪明的模型更会骗过测试,因而可能看起来对齐,实际却藏着未被发现的严重问题。建立更广、更巧妙的评估体系,并用可解释性分析交叉核验,价值极大,一两年内可以有大量进展。
 嵌入式评估方

三步里的第一步,也是Anthropic单方面承诺的一步:嵌入式评估方获得近似员工的权限,核验安全实践并报告事故。

这听起来像小事、像程序,但最无聊、最程序性的事情,往往最要紧。嵌入式评估事实上相当激进,远超今天任何AI公司的做法,好处包括:

- 可核验。 评估方能在螺丝钉层面检查:公司是否真在按其所称的训练、部署、运营和保障做法行事。任何定速承诺都必然充满含糊、判断,以及“字面合规还是精神合规”。必须有能看见细节的中立第三方。
- 透明度。 无论我们做何种承诺,公众都有权知道正在发生什么。Anthropic长期支持透明:在多数业内反对任何监管时,我们就支持透明立法;我们的模型卡和风险报告长达数百页。但选什么写进去、略掉什么,仍是我们自己决定。嵌入式评估方会改变这一格局。
- 第二意见。 除核验正式承诺、告知公众外,评估方还能提供不受商业激励左右的第二意见。很多安全收益,可能只是他们指出员工没想到、一旦知道就愿意改的问题。

因此,任何定速方案,若从嵌入式评估起步,效果都会好得多。
这些评估方应持续拥有与内部做同类风险评估的员工相近的权限和工具。Anthropic打算在近期邀请外部评审团队入驻,

配备:

- 办公室工位、门禁卡和公司电脑。
- 工作空间、工具和权限大体相当于内部风险评估团队。法律或合同要求、以及保护客户与合作方隐私之处会有例外。我们也会建立内部规范,强化评审人员获取相关信息的渠道,包括与员工当面交谈。
- 一份平衡上述复杂性的合同。外部评审应有权公布关于风险水平、事故、实践、以及他们获得或未获得何种权限的关键发现——Anthropic没有编辑控制权。我们可以狭义地涂黑安全敏感、法律特权、商业敏感或第三方保密信息,但不能只因为结论不好看就涂黑。若某次涂黑拿掉了对结论很重要的内容,评审可以公开说明。
这对一家公司来说不寻常,但我们认为必须先把“嵌入外部评审”做成可验证的概念。我们再次呼吁其他前沿公司跟进。

 民主国家内部定速

一旦嵌入式评估方在足够多的美国AI公司运转起来,可核验的定速才更可行。尤其可以按模型或训练管线的具体属性来定速。

最有效的办法是覆盖所有美国前沿AI公司的监管,这样连不愿自愿配合的也会被覆盖。Anthropic长期支持明智、有针对性的AI监管,尤其是聚焦透明和第三方审计的法案。我认为所有前沿实验室都应与政府合作,把常驻嵌入式评估方制度化,以便更好预防和记录近几个月这类内部对齐事故,并落实“能力与安全保持平衡”的监管。

不幸的是,立法需要时间,而AI走得很快。因此,在走监管路径的同时,AI公司可以、也应该自愿坐下来定标准——有了常驻嵌入式评估提供的可核验性,这个过程会更好。出于反垄断原因,美国政府最好斡旋或至少给这类安全对话开出狭窄豁免:不必亲自参加,但需要允许特定安全讨论。也可以通过与政府有关联的行业机制进行,例如德米斯·哈萨比斯建议过的那种安排。无论哪种,讨论都应尽快推进。

总体而言,我最赞成按一个前沿系统能做什么、以及我们观察到它有多安全来定速。例如可以设一系列“检查点”:若模型具备能力X,就必须附带对齐属性Y和Z的认证——评估、可解释性分析、训练环境审计的某种组合——以证明其对齐。这里的X可以是“模型有能力逃出或击败大多数常见沙箱方法”,Y则是使“模型不太可能突破环境并接管大量计算机”变得非常不可能所需的那些条件。

也应考虑按投入前沿模型的原料来定速,例如训练算力、训练运行的性质、或内部用AI改进AI。我担心其中一些比外部行为更容易被“钻空子”,但这正是该与嵌入式评估方讨论的题目。

民主国家内部定速,会受美国公司相对威权政权——主要是CCP——领先幅度的限制。若放慢超过这个幅度,未定速的CCP相关项目就会超前,带来重大国家安全风险。我同意贝森特财长的判断:中国在AI上领先,对美国和世界都是严重危险。这些项目会承担美国公司正在小心防范的对齐风险;即便它们避开这些风险,也可能凭AI驱动的无人机等手段在军事上压过民主国家。因此,民主国家内部定速的关键之一,是尽量拉大民主国家相对威权国家的AI领先优势,好给我们定速所需的喘息空间。

能守住这一差距的主要步骤是:

- 不向中国出售强大的AI芯片或半导体制造设备,并打击芯片走私和对中国境外数据中心的远程访问。芯片将是中国AI实力的主要决定因素。
- 打击威权国家企业未经授权的蒸馏。蒸馏前沿模型,能让落后公司用远低于独立研发的成本缩小差距。
- 加强AI公司安全,防止模型权重被盗。

公司和美国政府应合作,把这些步骤做得尽量有效。Anthropic一贯主张这些措施,因为我们始终清楚:它们对任何定速都必不可少。
若执行得好,我相信它们足以在未来3到5年——AI在地缘上最重要的窗口——显著扩大美国的领先。
有人认为这些措施会让与中国合作更难。我认为恰恰相反:它们增加民主国家的筹码,使未来达成协议更可能。

 全球定速

在民主国家内部定速的同时,也应争取全世界给前沿定速,尽管这会难得多。全球定速需要与中国合作——在威权国家中,它的AI能力遥遥领先。我们不能天真:地缘赌注如此之高,能做成的事情一开始很可能很有限。若我们大幅限制自身能力,以为中国也会同样做,而中国违约,AI可能强大到一次违约就意味着对方的地缘主宰。因此任何协议要么必须有铁一般的可核验性,要么必须窄到即便违约也不会在军事上决定存亡。我怀疑美国和中国都会有这类焦虑。我们处理任何全球定速、尤其是近期安排时,都应以保护美国及其盟友的领先为前提。

可能的协议有几个层次。有些我认为完全可行,有些我非常怀疑短期内能做成——但仍应尝试。按难度递增:

- 第一层。 禁止某些狭窄、明显危险的AI用途,例如用AI制造生物武器,或允许用户这样做。生物恐怖对所有人都有害,包括美国和对手,这类协议大概可能达成。
- 第二层。 双方同意在发布前测试模型在网络安全、生物、对齐等方面的急性风险。如上所述,可通过全球标准机构来做。我认为成立这样的机构很可能可行,但给它真牙齿会很难;难点在于核验双方没有秘密模型既不测试又可能秘密部署(例如用于军事)。
- 第三层。 对递归自我改进的速率设某种“限速”。当模型开始建造未来的模型,改进速度可能快得惊人。把速度从“极快”降到“仍然很快”,战略优势损失相对较小,安全收益可能很大。这有点像限制导弹数量的SALT条约:限制毁灭潜力,同时保留各方威慑。我认为这类协议很难,但刚好还在可能的边缘。
- 第四层。 全面定速甚至“暂停”,由参与国同意大幅限制AI整体发展速度。我支持把这个选项摆上桌,但认为短期内极不可能成真:逃避监控、破坏协议,可能急剧改变全球力量对比,违约激励会极大,我们对核验所需的信心也必须极高。

与中国能做成的任何合作,都会延长民主国家内部定速可用的时间。我们应瞄准更高层次,同时把较低层次视为更可能、更现实的成果。
最后必须指出:即便达不成正式协议,改变非正式规范也仍有价值。 分享关于递归自我改进、关于模型不对齐的信息,有助于让各方相信:鲁莽并不符合自身利益。
 结语
我仍然相信,AI能极大改善人类生活质量。我对实现这些好处的愿望没有减弱。但只有以正确方式建造这项技术,好处才会到来;只要我们把赢得的时间用好,就值得以不同寻常的审慎把它做对。进展仍会相对很快。我们可以用这段时间推进可解释性科学,提升前沿公司的运营安全与严谨,并造出我们对其对齐有更大信心的模型。我提出的这些、以安全节奏推进前沿的措施并不容易。但我认为,我们欠人类一次尝试。

脚注:行业协调一步,需政府斡旋或反垄断豁免。
 
2026年9月