一个 AI 亲手写出的推理引擎,把 vLLM 甩在了身后。Baseten 工程团队让 Claude Code(内部代号 Fable 5)参考 MetaInfer 论文,为 Qwen-3.6-35B-A3B 从零搭出一套推理引擎,取名 VibeQwen,硬件只给一张 B200,权重是 NVFP4 量化版本。
结果比参数本身更刺眼。单流解码速度比 vLLM 0.25.1 快 90%,首 token 延迟从 28 毫秒压到 12 毫秒,并发 32 时吞吐量高出 71%。这还是同一张卡、同一个模型、同一套量化精度下的对比,不是换硬件换来的账面数字。vLLM 是当下开源推理栈的默认答案,被一套"论文加 agent"的组合拳正面超越,意义远超一次 benchmark 刷榜。
真正值得琢磨的不是数字,而是做法。过去优化推理,得凑齐一队懂 CUDA、懂调度、懂量化的人磨上几个月;Baseten 这次把论文丢给 agent,让它自己读、自己写、自己调、自己测。这条路走通,推理引擎就能像配置文件一样被批量生成——每个模型、每种硬件、每种负载都有定制版本。但别急着宣布 vLLM 已死:单卡单场景的 90%,和稳定扛住生产流量之间,还隔着工程化与边界情况的长路。Baseten 真正证明的是——agent 不只写业务代码,它开始动系统层的硬骨头了。

