端侧模型最大的敌人不是精度,是不自知。张嘴就来,答错了还一副理直气壮的样子——这在离线、隐私优先的端侧产品里,纯粹是埋雷。Cactus 刚刚甩出来的 Cactus Hybrid 思路很直给:把一把叫置信度探针的手术刀,直接植入 Gemma 4 的检查点。高自信,当场答。低自信,老老实实求助云端大模型。整个方案没玩虚的,开源、零额外训练数据、几个音频基准上直接把那条叫“熵”的旧标尺按在地上摩擦。
好模型,不该在错事上硬撑
信心,从来不是算出来的
过去端侧推理有个默认信条:token 概率高就等于可靠。Logits 分布里取个 softmax,谁高信谁。可现实规律很快啪啪打脸——大把错误回答的 token 概率甚至比正确回答还高。这不是什么秘密,是语言模型的结构性缺陷。模型没有“全局自知之明”,它只能在序列的局部每一步做最大似然,面对语境漂移、歧义和知识盲区,一错到底,还在输出层给你一顿蜜汁自信。
Cactus Hybrid 的做法很直接:别再靠解码时的 token 熵来赌命了,直接在检查点内部挂载一个轻量的置信度探针。这个探针不参与生成,只负责诊断:模型到底知不知道自己在说什么。
熵这个指标,早该撤了
熵基线经常被拿来当不确定性估计的廉价代理。逻辑上说得通——分布越平坦,模型越犹豫。但廉价的代价是粗糙。Cactus 团队摆出了一组很打脸的数据:在零个音频训练样本的前提下,token 熵在四个音频基准上的均值 AUROC 只有惨淡的 0.549,近乎乱猜。这个数字意味着什么?意味着当模型在语音命令或对话里产生幻觉时,熵完全不能帮你把危险答案筛出来。
而他们的探针,同样没看过音频数据,却跑出了 0.79 到 0.88 的 AUROC。这不是微调、不是蒸馏、不是加网络,是换了一套元认知的眼睛。差距大到已经不是改进,是代差。
把诊断器塞进检查点,为什么管用
检查点里的表征远比 token 输出层丰富。最后一层 logits 是信息压缩的尽头,而探针挂在中间层的激活上,拿到的是模型对“自己处在一个什么状态”的原始感知。这种表征天然携带更多不确定性信号——概念模糊、语境丢失、知识缺口,所有这些在到达输出口之前就已经暗中涌动。探针就是抓住这些暗涌的那根探针。
而且它轻到什么程度?训练只在检查点快照上完成,完全不碰生成权重,不影响推理速度。换言之,这相当于给模型加了一道几乎零延时的心理测评——你自信吗?不够自信?那就换个大模型来答。
零样本之下,泛化从哪儿来
不靠数据,靠表征的缝隙
零音频训练数据能拿到 0.88 AUROC,这本身就是一个非常反常的信号。通常,任何分类器在完全没见过目标域样本的情况下,表现都会急剧退化。但探针的特殊之处在于,它学习的不是“音频长什么样”,而是“模型处于不确定状态长什么样”。这是一种对表征稳定性的全局建模。
模型在处理陌生模态或分布外输入时,中间层会出现可辨识的激活漂移和方差膨胀。这种漂移在文本、图像、音频里具有一定的跨模态一致性——或者说,不确定性的结构本身是跨任务共享的。探针不需要理解音频内容,它只需要识别这种统一的不确定特征。于是,文本上训练出来的“疑心病”,在音频上照样好使。
从 0.549 到 0.88,数字不会撒谎
0.549 的 AUROC 表示熵基线对高风险样本基本没有区分力,0.88 则意味着探针能在显著降低虚警率的同时揪出大多数不可信输出。这个落差直接改变了混合路由的性价比公式。以往端侧混合模型不敢轻易切路由,因为触发求助的依据太糙,要么白费云端算力,要么漏掉错误。现在有了一个可信的置信度信号,路由决策从碰运气变成了算投入产出。
更妙的是,探针输出的是 0 到 1 之间结构化的分数,而不是模糊的“低/中/高”。产品侧可以根据场景设定精准阈值,在延迟、成本和完成质量之间做细粒度博弈——这在以前是做不到的。
路由的账本,应该算在谁头上
有了好探针,混合模型才能真正“混合”起来。Cactus Hybrid 的玩法是:探针判断自信够高,直接在设备端用 Gemma 4 的小体量模型回答,延迟近零、无网络、无隐私泄露。分数滑落到阈值以下,就自动拉起云端更大的模型。这种自动路由不需要用户做任何选择,也无感切换。
根据他们公开的数据,仅路由 15% 到 35% 的查询,就能让整体表现持平谷歌的 Flash-Lite。这意味着,一台离线设备上的轻量模型,在很少几次云端求助的辅助下,获得了接近中大型在线模型的体验。对成本敏感的边缘硬件,这张牌的分量不言自明。
端侧部署,要的是现实主义的诚意
隐私与延迟的再平衡
端侧场景有个铁三角:延迟、隐私与智能。过去,选端侧就要牺牲智能,选云端就要交出隐私并忍受延迟抖动。Cactus Hybrid 没有彻底打破这个三角,但它让三角的边界变得更软了。绝大多数常规提问完全在本地闭环,只有探针明确认为危险的极少数请求才脱敏后扔上云端。对语音助手、车载交互、可穿戴设备这类数据敏感又怕卡顿的产品,这种折中远比“全上云”或“全憋在本地”两个极端更符合商业逻辑。
更重要的是,探针的轻量特性使得整套混合管线可以跑在手机、无人机甚至 IoT 网关这级别的芯片上。它没有绑死某个特定尺寸的教师模型,云端模型可以随时替换,路由器只管分数,不管后面接的是谁。
开源是姿态,也是生存策略
Cactus 选择 MIT 协议直接开源整个仓库。这手牌打得聪明。探针的训练方法和检查点耦合方式一旦被社区消化,很快就会变成端侧推理管线里的标准组件。谁先定义标准,谁就占据隐形王座。更何况,MIT 许可证意味着企业可以零摩擦集成,商业化友好到门槛几乎为零。
与此同时,开源也把信任问题摆到了桌面:探针本身并没有藏私货,整个置信度机制的全部代码都裸露在开发者眼前。对隐私敏感的企业客户来说,黑盒信心和透明信心之间,根本不存在选择。一个干净的 MIT 库,比十份白皮书都管用。
少问“是不是”,多问“差多少”
Cactus Hybrid 不是在发新模型,是在给旧模型补上一块缺失已久的拼图。它提醒整个行业一点:端侧推理的瓶颈早已不是模型大小,而是模型能否诚实地面对自己的能力边界。当一个模型学会说“这个我不太确定,还是问一下更强的我吧”,这类产品才真正值得在口袋里占据一席之地。
那些还在堆参数、刷榜单的队伍,该停下来看看 AUROC 了。精度之外,自知才是端侧产品化的最后十公里。Cactus 用一行探针,画出了这十公里的起跑线。

