"便宜模型先顶上,没把握的再交给贵模型。"OpenRouter 最新发布的教程把这句话变成了能落地的工程方案:让廉价模型在结构化输出里多返回一个 0 到 1 的置信度字段,请求进来先走小模型,分数低于阈值就升级到更强的模型处理。听起来像白捡的降本手段,但 OpenRouter 在文章里泼了盆冷水——这个分数是模型自报的,不是经过校准的概率。
换句话说,模型说 0.9,不代表它真有九成把握。所以阈值不能拍脑袋定,得拿自己流量的真实数据说话:按置信度分数分段,统计每一段的实际错误率,再根据你能接受的错误水平去排序、去划线。别人跑出来的 0.7 换到你这里可能完全不是一回事,流量结构、任务类型、用户容忍度都在变。
上线只是开始。分数分布会不会随模型版本漂移?升级率是不是悄悄涨了、成本优势被一点点吃掉?那些没被升级的答案,错误率到底几何?这三个指标得盯着看,阈值也要跟着调。置信度路由不是一个设完就撒手的开关,更像一个需要持续校准的调节阀。

