Prime Intellect 把推理做成了水电煤。Prime Inference 正式上线,一个专为推理模型设计的服务平台,同时提供 serverless 端点和预留容量两种形态。说白了,前者让你像调 API 一样随手试,后者给需要稳定吞吐的团队留出独占算力。
真正值得琢磨的是跨数据中心调度。前沿开源模型——那些动辄几百亿上千亿参数、跑起来能让单卡原地起火的家伙——现在被分布到多个机房对外服务,用户不必关心模型落在哪台机器上。Prime Intellect 给出的数字是:内部每天处理近一万亿 token。这个量级不是演示环境里跑出来的,是实打实的生产负载。推理成本正在成为开源模型能否被真正用起来的分水岭,谁把这件事做便宜、做稳,谁就握住了下一层的入口。
对开发者而言,选择其实变简单了。以前想跑一个顶级开源模型,要么自己搭集群、调推理框架、算显存,要么忍受第三方 API 的排队和限流。现在端点即取即用,预留容量兜底,跨机房这件事被藏在抽象层之下。开源与闭源之间最后一道体验鸿沟,正在被这类基础设施抹平。剩下要看的,是价格和延迟能不能扛住真实业务的拷问。

