Anthropic 把自己研发流程里最敏感的一块拆开量了:AI 究竟替人做了多少活。这套测量前沿 AI 开发节奏的指标分三个方向——AI 主导研发、智能体监督、算力分配。前沿实验室公开自评数据本就不常见,更少见的是它挑的切口:不谈模型能力有多强,只谈开发过程本身在加速到什么程度。指标不复杂,难的是敢公开。
三个方向对应三个真问题。AI 主导研发量的是自动化比例,人写代码和模型写代码的比重一变,迭代速度就换了档;智能体监督问的是人还看不看得住机器,当智能体开始互相检查、彼此修正,监督链条上还剩几个活人;算力分配则暴露资源往哪儿堆,训练、推理、内部实验各占多少,账面上藏不住战略意图。
这份数据的价值不在数字准不准,而在它给了一个可复用的透明度模板。过去实验室对外谈安全,谈的是原则和承诺;现在把研发自动化程度、监督强度、算力流向摊开讲,外界至少有了能追问的抓手。其他几家愿不愿意照这个格式填,才是真正值得盯的下一幕。

