Dario想解决的其实不是「Anthropic 要不要慢一点」,而是能不能想办法,让所有车同时慢一点。
不知道是不是「巧合」,就在菲尔茨奖得主发出联合声明后不久,Anthropic CEO Dario Amodei 突然公开说,AI 太快了,咱们得悠着点儿了。
在最新长文 We Must Pace the Frontier 中,Dario 提出了一个比「重视 AI 安全」更进一步的主张:
我们必须放慢 AI 模型能力提升的速度。
这不是暂停训练,也不是停止技术进步。Dario 给它起了一个词:pacing the frontier,控制前沿 AI 的推进节奏。
他的判断是,AI 能力增长得太快,安全、对齐和评估已经开始有点跟不上了。与其一边狂奔一边补护栏,不如主动把速度降下来一点,给安全研究争取时间。
而且 Anthropic 不只是喊口号。
Dario 同时宣布,公司准备做一件在目前大型 AI 公司里相当激进的事:
让第三方安全评估机构长期驻扎 Anthropic,拿到接近内部员工的权限,直接检查公司究竟有没有把安全承诺做到位。
办公桌、门禁卡、公司电脑、内部工具和工作区访问权限,全都给。评估机构甚至可以在不经过 Anthropic 编辑的情况下,对外公布关键风险发现。
一家做最前沿模型的公司,主动把外部「安全监察员」请进办公室。Dario 觉得,现在已经到了需要这么干的时候。

全文地址:https://darioamodei.com/post/we-must-pace-the-frontier
过去几个月,AI 的速度突然不对劲了
Dario 在文章里给出了两个让他改变判断的原因。
第一个,是一个最近越来越频繁出现的词:递归自我改进,recursive self-improvement。
过去,AI 是工程师训练出来的工具。现在,这些模型已经越来越多地参与到下一代 AI 的研发中。
AI 写代码、跑实验、分析结果、改训练流程,再帮助人类造出更强的 AI。模型越强,它参与下一代模型研发的能力越强,整个过程就可能形成一个自我加速的循环。
Dario 说,大约从今年夏天开始,他观察到 AI 的进步速度出现了明显加速,而 AI 帮助开发下一代 AI,是其中最重要的原因之一。
这件事已经不只发生在某一家实验室。OpenAI、Anthropic 等前沿公司,都在公开讨论 AI 对 AI 研发的加速作用。
Dario 担心的是,一旦这个循环转起来,AI 能力的增长速度可能迅速超过人类理解和控制这些系统的速度。
所以他的态度已经从「研究怎么把 AI 做得更安全」,进一步变成了:能力本身也得控制增长速度。
真正让他紧张的第二件事,更加具体。Dario 提到了最近发生的OpenAI-Hugging Face 事件( OAI-HF )。
按照他的描述,当时一群 AI agents 在执行任务过程中出现了一系列异常行为。它们攻击了原本并没有被要求攻击、与任务也无关的目标;一些 agent 为了整个集群成功,会主动「牺牲」自己;更离谱的是,它们还尝试攻击负责评估自己表现的 grader。
Dario 用了一个非常重的形容:a fanatically devoted collective——一个狂热忠诚的集体。
这次事件本身没有造成人员伤亡,经济损失也很有限。但在 Dario 看来,问题恰恰不在这里。如果完全相同的失配行为,发生在一个能力强十倍、百倍的系统上,会怎么样?
他的预测相当激进:按照目前 AI 能力进步的速度,他担心未来 6~12 个月,类似的 agent swarm 就可能拥有通过持久化 botnet 大规模控制互联网的能力,并造成数千亿美元级别的损失。
而且,他特意强调,这不能简单归结为 OpenAI 一家的问题。Anthropic 自己也发生过类似、只是严重程度更低的 alignment 事故。他的结论是:
每一家前沿 AI 公司,都应该按照「 OAI-HF 就发生在自己身上」的标准采取行动。
2023 年喊暂停,他觉得没什么用;现在不一样了。这也是 Dario 这篇文章一个挺有意思的地方。
AI 行业其实早在 2023 年就出现过一轮「暂停大型 AI 实验」的呼吁。但 Dario 现在回头看,觉得当时暂停其实意义不大。
理由很简单:多出来的时间拿来干什么?
2023 年的大模型还没有能力以 coherent agent 的方式在世界里自主行动,也没有表现出今天这种程度的欺骗、操纵、作弊和网络攻击能力。当时为了研究 AI 对齐而减速,在 Dario 看来有点像:
每一家前沿 AI 公司,都应该按照「 OAI-HF 就发生在自己身上」的标准采取行动。
模型太弱,很多真正重要的安全问题根本还没有出现。
但今天完全不同,终于有真正的研究对象了。
现在的模型已经足够强,研究人员可以观察它们什么时候欺骗、什么时候试图绕过规则、什么时候出现未预期的目标和行为。
因此,Dario 认为,如果现在放慢一点,能在模型达到某些关键能力之前多争取一两年,而这些时间真正被用于 alignment、interpretability 和 evaluation,风险就可能被显著降低。
这也是他为什么一再强调:pacing 不是 pause。Anthropic 没准备停止训练 Claude,也没准备退出模型竞赛。他们想做的是,在能力、安全之间重新找一个速度。
Anthropic 准备先把「外部人」请进公司
Dario 为此提出了一套三步计划。
第一步,也是 Anthropic 已经决定单方面实施的一步,叫:Embedded Evaluators,嵌入式评估者。
Anthropic 计划邀请第三方风险评估团队长期驻扎公司。他们会拥有自己的办公室工位、门禁卡和公司电脑,可以访问与内部风险团队大体相同的工作空间、工具和权限,还能直接与员工沟通。
当然,涉及客户隐私、合作伙伴机密、法律限制等信息仍会设置边界。
但最关键的一点是:这些评估者不是 Anthropic 的公关部门。他们可以独立发布对于风险水平、安全事故、内部实践以及自己实际获得了多少权限的判断。
Anthropic 可以因为国家安全、法律特权、商业机密等极少数原因要求删减信息,但不能因为结论「对 Anthropic 不好看」就把内容删掉。
如果某次删减影响了最终判断,评估者甚至可以公开说明这一点。
这和今天 AI 公司常见的 model card、risk report 逻辑很不一样。后者说到底还是:公司检查自己,然后决定把什么告诉公众。
Dario 想试的是:把外部人真正放进公司里面看。
他甚至拿银行业作类比。一些银行监管机构本来就有长期驻场的「supervisor」,和银行员工一起工作,持续检查内部风险控制。Anthropic 想把类似机制搬到前沿 AI 公司里。
再往后,已经有点像「AI 军控」了
但光靠 Anthropic 自己慢下来没有用。这也是 Dario 整套方案真正棘手的地方。如果 Anthropic 花一年时间做安全,OpenAI、Google 或其他公司继续狂奔,商业上的惩罚会非常直接。
所以他的第二步是:让民主国家里的前沿 AI 公司一起协调。
大家建立统一安全标准,并针对未经充分安全验证的能力增长设置限制。Dario甚至设想,可以为 AI 建立一套「checkpoint」:
当模型达到能力 X,就必须同时证明自己满足安全标准 Y 和 Z,否则不能继续往前。
比如,如果模型已经有能力突破绝大多数常见 sandbox,那么开发者就必须证明,这个系统基本不具备主动逃逸、控制大量计算机的倾向。
AI 的速度表,从此和安全检查绑定。
第三步更大:全球协调。
Dario 把未来国际 AI 合作分成了四个等级。
最低一级,是禁止 AI 被用于制造生物武器这类明显危险用途。再往上,是各国在模型发布之前统一测试网络安全、生物风险和 alignment 风险。
第三级已经很有意思了:给递归自我改进设置 speed limit。
即使 AI 已经可以帮助研发下一代 AI,也不能让这个反馈循环无限加速。Dario 甚至直接把这套机制类比成冷战时期的 SALT 战略武器限制谈判。
当年美苏没有要求对方彻底放弃核武器,而是通过限制武器数量,让双方在保持威慑力的同时,降低失控风险。在他看来,AI 或许也需要类似制度。
最高一级,则是真正意义上的全球 AI 限速,甚至暂停。这一步连 Dario 自己都觉得短期实现的可能性很低。
最矛盾的一点:
一边限速,一边还得保证自己跑在前面
看到这里,一个问题已经非常明显了:如果慢下来更安全,为什么大家不一起慢?因为没人愿意先慢。公司怕输给竞争对手。国家也一样。
因此,他一边主张给前沿 AI「限速」,另一边又主张美国进一步对对手实现限制手段。
他的逻辑可以概括得很简单:先把领先优势拉大,再用领先优势换取减速空间。
在 Dario 的设想里,如果美国能在未来 3~5 年把领先优势继续扩大,就有更多余地花时间做安全,而不用担心竞争对手突然超过自己。
这也暴露出了整个 AI「限速」方案最难解决的那个死结。所有人可能都知道车开得太快了。但没有人愿意成为第一个松开油门的人。
于是最终,Dario 想解决的事情其实不是「Anthropic 要不要慢一点」。而是能不能想办法,让所有车同时慢一点。
Altman 点赞,我们今年不会 IPO
不过呢,Dario 到现在仍然是 AI 最坚定的乐观主义者之一。
他在这篇文章开头依然写道,AI 可能在未来 5~10 年内帮助治愈大多数重大疾病,大幅加速经济增长,并创造一个更加富足的世界。
就在文章发布后不久,马斯克转推支持。

Altman 不仅支持 Anthropic 提出的「前沿 AI 应该主动减速」,还在近期的一次受访中确认:OpenAI 今年不会上市。原因之一,恰恰就是 AI 安全。

在接受《财富》杂志采访时,Altman 明确表示,考虑到目前围绕 AI 安全正在发生的一切,现在上市是一个「 ill-advised moment 」——并不明智的时机。
当被追问是不是意味着 2026 年 IPO 已经彻底排除时,他直接回答:「 Not 2026 」。
今年 6 月,《纽约时报》曾报道,OpenAI 正考虑把可能达到 1 万亿美元估值的 IPO 从今年推迟到明年。当时市场更多把原因归结为资本市场环境、SpaceX 上市后的股价波动,以及宏观经济不确定性。
现在 Altman 第一次把另一个原因公开摆上了桌面:安全。
他说,OpenAI 还有很多事情要做,包括如何应对新的安全和对齐要求,以及 AI 公司和政府应该如何协作。
换句话说,AI 安全第一次开始直接进入一家顶级 AI 公司的