分词器从来不是 NLP 生产流水线上最耀眼的一环,但 GigaToken 用一组数字让它变成了前置讨论。在 5nm 工艺的 AMD EPYC 9565 双路 144 核 CPU 上,这枚新出炉的 tokenizer 对 GPT-2 文本的分词吞吐量锁死在 24.53 GB/s。不是 MB 级别,是每秒吞下二十多 GB 原始文本并稳定切出 token——这已经不是在“优化”旧工具,而是重新划定了速度坐标。
对比数字更惊人:相比 HuggingFace Tokenizers,GigaToken 快了 989 倍;对比 OpenAI 的 tiktoken,快了 681 倍。过去用主流方案跑一天的大规模语料分词任务,现在只用几分钟收工。这种量级的跨越不能归结为几个小优化,它背后是针对现代多核 CPU 的内存布局和指令流水线做的激进重构,把分词这件事从“够用”直接推进到了“毫无感知”的速度区间。
对长期被数据预处理卡脖子的团队而言,意义再直白不过。TB 级语料清洗、预训练集构建、实时推理前的文本切分,这些原本需要排队等高算力环节的工作,如今在一台双路服务器上就能跑出流水线级别的节拍。GPU 等待数据的空窗期被压缩到极限,这意味着昂贵的计算资源终于能持续喂饱,而不用在 IO 端空转。分词器,第一次成了效率故事的真正主角。

