昊梵体育网

谷歌开源“扩散式”大模型:单卡H100每秒生成1500个token

谷歌DeepMind近日发布新一代开源大模型DiffusionGemma,颠覆了传统大模型“逐字生成”的模式。该模型采用

谷歌DeepMind近日发布新一代开源大模型DiffusionGemma,颠覆了传统大模型“逐字生成”的模式。该模型采用扩散生成技术,每次前向传播可并行生成256个token,在单张英伟达H100显卡上实现约每秒1500个token的生成速度,远超采用投机解码的同类自回归模型。

据官方技术报告,DiffusionGemma基于Gemma 4 MoE架构微调而来,总参数25.2B,推理时仅激活约3.8B参数,训练成本不足原始模型的10%。与以往从零训练的扩散语言模型不同,它保留了思维链模式、多模态输入和长上下文支持,即便在扩散微调后仍能以自回归方式生成,性能仅轻微下降。

扩散式生成的最大优势在于,每个token都能“看到”同批其他token,特别适合代码补全、行内编辑等非线性任务,模型还能在生成过程中自我纠错。此外,DiffusionGemma原生支持英伟达NVFP4 4位浮点格式,在DGX Spark上可达每秒150 token,在DGX Station上更可突破每秒2000 token。

分析人士指出,DiffusionGemma的发布标志着开源大模型在推理效率上迈出关键一步。更快的生成速度意味着更低的推理成本与更高的并发能力,有望推动AI应用从云端走向边缘设备。随着谷歌将扩散式生成引入主流模型家族,自回归模型的“霸主”地位正面临前所未有的挑战。