昊梵体育网

DFlash 2:并行草稿更准,LLM 推理更快 之前我们介绍过 DFlash

DFlash 2:并行草稿更准,LLM 推理更快

之前我们介绍过 DFlash,它把推测解码里的草稿阶段改成一次并行起草一整块 Token,再交给目标模型验证。DFlash 2 继续沿着这条路优化,用路径选择器 + 局部卷积修补两个短板,让每轮验证推进更多 Token,同时只增加约 1.3% 的草稿—验证单轮延迟。

第一个问题是候选有了,但没选对。在官方 5 层 Qwen3-4B、GSM8K 实验中,首个草稿位置 Top-1 命中率为 85.4%,正确 Token 落在 Top-16 中的比例却达到 99.5%。DFlash 2 因此加入轻量路径选择器,并行计算相邻候选的匹配关系,再选出更连贯的路径;额外增加约 2.0M 参数和 0.6% 单轮延迟。

第二个问题是草稿块越往后,候选质量越差。同一实验中,正确 Token 落在 Top-16 中的比例从 99.5% 降到 87.8%。直接多堆 10 个 Transformer 层会增加 15.2% 单轮延迟,DFlash 2 则用轻量双点动态深度卷积补相邻位置的短距离依赖,同时保持并行计算;额外参数约 3%,单轮延迟只增加 0.7%。

两个修复组合后,在 Qwen3.5-4B 的 5 项测试中,平均接受长度从 4.92 提升到 5.97,约 +21%。对 Serving 来说,这意味着每轮目标模型验证可以推进更多 Token,而新增的草稿开销仍然很小;在 lossless rejection sampling 下,目标模型原有输出分布保持不变。

Inco 还发布了 Qwen3.8-27B 和 Meta Muse Glimmer 两个 DFlash 2 草稿模型。官方报告中,Qwen3.8-27B 在 SGLang、batch size = 1 条件下达到约 2.7~3.4× 自回归解码吞吐。

DFlash 2 的思路很清晰:候选已经有了,就先把候选选好;问题集中在局部,就用轻量局部模块补。它没有重新引入逐 Token 的自回归预测,也没有靠把整个 Drafter 做重来换性能。对于 Agent Serving、低 batch 在线推理,或者对单请求吞吐敏感的团队,这类优化已经值得放到真实工作负载里测试。

DFlash2 LLM 大模型推理 推理加速 推测解码 Agent 模型服务 SGLang vLLM