Anthropic 的 CI 工程师用 Claude 建了一个值班智能体,直接扔到 CI/CD 管线的第一线当事故响应者。这个做法最狠的地方在于:它不玩虚的,出事之后中位 14 分钟就能发布首份基于证据的分析,最快的一次在 3 分钟内验证修复、确认错误率回到基线。不是演示,不是 PoC,是真正替人顶班的干活工具。
这套东西的实现路径也相当工程化——值班智能体跑在 Slack 频道里,接上 Datadog 或 Grafana 拿观测数据,再通过 GitHub 技能文件操作仓库、跑命令、查日志。Claude 在这里不是聊天机器人,而是一个被赋予工具权限、能自主按 on-call 手册操作的 agent。更关键的是它有自我迭代机制:每次处理完事故,教训会写进 lessons.md,下次遇到相似问题时直接调用。也就是说,它越用越熟,不是静态的规则脚本。
Anthropic 已经把通用设置套件公开发出来,其他团队想复制这套体系不需要从零造轮子。这大概是 AI 运维从“辅助人类”走向“独立值守”的一个明确信号——不是取代工程师,而是把那些半夜爬起来的重复劳动先接过去。对于任何被 CI/CD 故障折磨过的团队,这套工具都值得认真试一次。

