把大模型的评测塞进 CI,当成 Pull Request 门禁来用——OpenRouter 这份教程的核心动作只有一个:用一套固定的 eval 集在流水线里跑分,通过率跌破阈值,脚本直接以非零退出码结束,合并被拦在门外。没有仪表盘,没有人工评审会,和跑挂了的单测是同一套逻辑。
几个细节决定这套门禁能不能活下来。eval 集必须锁版本,数据和判分脚本一起进仓库,否则今天的 90% 和下周的 90% 根本不是同一个东西;阈值别贴着历史最高分设,得给模型留出正常波动空间,不然 CI 会因为无关紧要的措辞变化天天报红;调用成本要算清楚,每个 PR 都全量跑一遍大模型请求,账单一周就能让人清醒,常见的折中是小集合守门禁、大集合留给夜间任务。失败时脚本还应把具体掉分的样本打出来,让作者知道是哪道题崩了,而不是只看到一个红叉。
真正的价值在于,它把“模型好像变笨了”这种模糊抱怨,变成了可复现的阻塞条件。改提示词、换模型版本、动检索链路,任何触碰推理路径的改动都会先在 eval 上撞一次墙。但门禁不是免死金牌:评测集会过时,模型会慢慢学会讨好判分器,题目本身也会被现实甩在身后。把它当测试用例一样持续维护,它才是护栏;放任不管,它只是一张每年都得重刷的过时考卷。

