别再拿合成数据糊弄自己的评测流程了。OpenRouter 刚发了一份教程,核心主张很直接:golden 评测集应该从生产流量里长出来,而不是在办公室里拍脑袋编。它把这件事拆成五步——抽样生产流量、去重聚类、补上预期输出、跑首轮评估并修正 rubric,最后提交 Git 接进 CI,让每次部署前都自动过一遍回归。
规模上的建议也很克制:先挑 20 到 50 条样本人工复审,跑顺了再扩到 100 至 1,000 条,构成完整的回归集。非要用真实流量的理由很实在——只有真实请求能保住线上分布和那些你最不想再看见的失败模式,合成数据看着干净,却恰好把模型真正栽跟头的地方抹平了。这套流程的价值不在评测本身,而在于它把"上线前有没有退步"变成一个能自动回答的问题。
值得注意的是第三步和第四步的顺序。预期输出不是拍脑袋定下的标准答案,rubric 也要在首轮评估之后回头修正——golden 集因此是会迭代的活文档,不是一次性验收清单。提交进 Git 后,它跟着代码一起走版本:谁改了 prompt、换了模型、动了检索参数,CI 都会用同一批真实样本给出硬答案。评测集真正的价值,是它敢在你急着发版的时候拦住你。

