数字不会说谎,但会误导。Hugging Face 公开模型仓库从243万增至296万,只用了八个月。繁荣吗?当然。真实吗?未必。85.6%的模型下载量不足200次,1.5%的仓库却占据了99.2%的下载量。这不是长尾繁荣,这是头部通吃。开源模型的规模叙事越热闹,真实使用的集中度就越刺眼。
评估开源模型生态时最常见的偏差,就是把下载量与点赞量混成同一个热度指标。下载量记录的是实际依赖,点赞量捕捉的是社区兴奋点。一个模型被下载,可能是被集成进某个流水线;被点赞,可能只是路过时顺手一点。用兴奋点解释依赖度,会系统高估大量无人使用的发布。真正被反复使用的模型高度集中,绝大多数新仓库从上传那一刻起就进入沉默。榜单上的热闹,和流水线里的沉默,是两回事。
竞争格局也在变化。中国实验室月度最大开源模型参数规模在754B到2.78万亿之间,美国实验室七个月中有五个月低于130B。参数规模不能说明一切,但这样的差距已经足够形成路线分化。更值得注意的是发布方身份:AMD与NVIDIA各自发布超过200个新模型仓库,成为开源模型最活跃的发布者。硬件厂商不再只提供算力,他们开始直接下场定义开源叙事。下次再看到“开源模型数量创新高”,先别急着欢呼,问一句:下载量多少?点赞多少?这两个数字,本就不该被塞进同一个热度公式里。

