昊梵体育网

[CL]《DiffusionGemma Technical Report》D T

[CL]《DiffusionGemma Technical Report》D T A A Taïga, J Assiene, D Calandriello, R Chaabouni… [Google DeepMind] (2026)

在大型语言模型领域,传统的自回归(AR)解码是一个严重的效率瓶颈。过去的方法受困于逐个 Token 生成的串行机制,本质原因是受限于内存带宽而非计算能力,导致硬件利用率极低且推理延迟随长度线性增长。

本文的核心洞见是:通过将文本生成重新看作一个并行迭代的离散扩散(Discrete Diffusion)过程。由此,将预训练的 Gemma 4 模型微调为同时处理 256 个 Token 的“画布”,并结合采样器蒸馏与强化学习(SD·RL)这一关键操作,使模型能以极少的迭代步数从噪声中熔炼出完整文本块。

这项工作真正留下的遗产是确立了文本生成速度与智能水平的新帕累托前沿,在 H100 上实现了每秒 1500 Token 的极致吞吐。它为后来者打开了通往超低延迟智能体和实时交互应用的新门,但尚未跨过的门槛是彻底消除扩散生成中偶发的 Token 重复,以及弥合其与原生自回归模型之间的绝对性能差距。

arxiv.org/abs/2608.00146 机器学习 人工智能 论文 AI创造营