Dario Amodei 又扔出一篇文章,标题直译过来是《我们必须为前沿定速》。核心主张只有一句:AI 行业该慢下来。但这不是空喊口号,他给了一套三部分计划,把减速拆成能落地的步骤。而第一步,Anthropic 已经接了过去。
做法本身比措辞更值得琢磨:为第三方评估者提供永久的、员工级别的系统访问权限。不是阶段性开放,不是脱敏后的报告,而是和内部员工同一层级的权限。拿到这把钥匙的人能干什么?核实安全措施是否真的在执行、在事故发生时直接上报、以及在训练过程中评估模型的 alignment 表现。说白了,把"我们自己说自己安全"换成"外人可以自己看"。
更值得注意的是这已经不是孤例。Sam Altman 表态同意放缓前沿的主张,OpenAI 同样会向独立评估者开放访问;Thariq 那边则呼吁给系统加固和社会讨论留出时间。几家公司口径趋同,本身就说明压力从哪里来——不是监管文件,是外界对"自我认证"这套玩法越来越不买账。Anthropic 单方面走出这一步,代价是把自己交出去被人翻检,收益是抢在同行前面定义什么叫透明。至于另外两步是什么、由谁执行,眼下还没有让所有人满意的答案。

