把大模型推理速度提上去,最难的从来不是做出一套花哨的算法,而是让这套算法真的能“端到端”跑通,且不挑模型。腾讯混元刚刚开源的 AngelSpec 框架,直接把这层窗户纸捅破了。它不是一个停留在论文里的概念验证,而是一套支持训练与部署的全流程工具,在 Hy3-A21B 模型上,其 DFly 方案相比普通自回归解码实现了 1.98 至 2.40 倍的端到端加速,吞吐量比现有的 DFlash 方案高出 10.5% 到 11.8%。这组数据意味着,它处理的不再是实验室里清理干净的理想延迟,而是包括了网络传输、调度排队、内存搬运在内的真实物理世界的速度。
投机解码的“烂尾楼”问题
理论很丰满,落地只剩一地鸡毛
做过推理加速的人都知道,投机解码不是什么新概念。它的原理粗暴又优雅:用小模型(草稿模型)快速生成候选结果,再用大模型(目标模型)并行验证,验证通过就一把接受,看起来是在不降低精度的前提下绕开自回归的串行诅咒。但现实往往很打脸。很多团队的投机解码方案卡在了“最后三公里”——验证阶段的注意力掩码管理极其复杂,树形推测生成的那些非连续token序列,让KV缓存的读写变成了一场噩梦。你费尽心思把草稿生成效率做到极致,结果全堵在了显存读写和调度开销上。
挂羊头卖狗肉的“伪端到端”
更关键的是,大部分所谓的高加速比只存在于核函数层面。你去看论文的数据,动辄三四倍的提升,一部署到真实服务环境就原形毕露。因为完整的请求链路里,tokenizer的预处理、通信延迟、请求排队,每一个环节都在吃掉你的加速红利。抛开这些去谈推理加速,就是耍流氓。AngelSpec 的出手方式非常粗暴直接:直接把目光死死盯在端到端延迟上,拒绝任何把损耗藏起来的中间结果。
DFly,凭什么可以更快
不靠猜,靠“瞄一眼”
传统投机解码有一个致命伤:草稿模型和主模型是割裂的。草稿模型独自在那里蒙头猜,猜错了代价巨大。AngelSpec 里的 DFly 方案做了一个非常“灵性”的改动。它允许草稿模型在生成每一步时,直接“瞄一眼”主模型对应层产生的隐藏状态。这意味着草稿模型不再是一个盲猜的赌徒,它的每一步生成都受到了主模型语义理解的实时引导。这样做出来的候选序列,与主模型的潜在意图高度对齐,验证阶段的接受率被大幅拉高,无效计算被极大压缩。
去手工化,把一切交给数据
另一个常被忽略的痛点是树形结构的构建。为了提升验证效率,投机解码通常要把候选序列组织成树形结构。过去这依赖大量专家经验去设计固定的树模式,那种静态的拓扑结构根本应付不了生成内容的动态变化。DFly 走了一条完全不同的路——动态结构化注意力。它让模型自己去学习什么样的树形结构在当前语境下是最高效的,把手工设计的僵硬规则全部丢掉。这种数据驱动的动态拓扑,让计算资源真正做到了按需分配。
不让注意力计算拖后腿
验证阶段的注意力计算是计算密度的重灾区。DFly 专门为此设计了面向树形结构的加速注意力算法。它没有像传统方法那样把树铺平成序列去算,导致大量的无效注意力计算,而是直接利用树的拓扑优化访存路径。你几乎感觉不到因为要做树形验证而带来的额外显存波动,这在处理长上下文时尤其明显。它把验证阶段本该有的并行威力,不打折扣地释放了出来。
开源的诚意:给你鱼也给你渔
从脚本到权重,一步到位
很多开源项目只给推理代码,训练怎么搞你自己琢磨。但投机解码的草稿模型不经过针对性训练,根本达不到实用级别的对齐效果。腾讯这次的开放力度是实打实的,不仅放出了 AngelSpec 的完整训练代码和脚本,连 Hy3-A21B 模型对应的 MTP 和 DFly 草稿模型权重也一并开源了。这意味着你不需要从零折腾预训练和对齐,直接拿权重就能跑,或者用这套代码去训练你自己的定制模型。
工程细节才是魔鬼
看了一圈代码仓库的README,能感觉到这是工程团队亲自下场整理的项目。依赖清晰,脚本结构紧凑,没有那种为了学术酷炫而堆砌的冗余抽象。对于真正要在生产环境落地推理加速的团队而言,这种工程化程度比论文本身值钱得多。它省去了你阅读晦涩论文然后自己从头实现、反复踩坑的过程。拿来即用,改改就能上线,这就是开源最大的善意。
一次精准的技术对冲
在大模型推理成本依然高企的当下,投机解码是少数能直接换回真金白银的加速技术之一。AngelSpec 的价值在于,它没有重新发明理论,而是把投机解码体系里那些“理论上成立,工程上拉胯”的环节挨个修补了一遍,并且直接端上了能落地的成品。对于正在做推理加速的团队来说,这大概率是现阶段能接触到的最成熟的端到端投机解码方案之一。

