昊梵体育网

[CV]《Parallel Decoding Distillation for

[CV]《Parallel Decoding Distillation for Fast Image and Video Generation》N Shaul, C Liu, A Vahdat, J Berner [NVIDIA & Weizmann Institute of Science] (2026)

在音视频生成领域,扩散模型的高昂推理成本是实时化的核心障碍。传统蒸馏方法受困于 GAN 损失的训练不稳定与模式崩坏(Mode Collapse),本质原因是现有方法在大幅压缩采样步数时,难以在保持生成质量与保留样本多样性之间达成平衡。

本文的核心洞见是:将多步去噪轨迹的序列积分重新看作一个可并行的解码任务。由此,并行解码蒸馏(PDD)这一关键操作使问题得以解开——通过一个共享主干网络同时预测多个时间步的平均速度,在单次推理中实现跨越式采样,且无需复杂的雅可比向量积(JVP)计算。

这项工作真正留下的遗产是证明了纯轨迹蒸馏在超大规模视频模型(如 22B 参数量)上的可行性与优越性。它为后来者打开的新门是实现了 4-8 步极速生成且不损失运动多样性的工业级方案,但尚未跨过的门槛是摆脱对预训练教师模型轨迹质量的底层依赖。

arxiv.org/abs/2607.26004 机器学习 人工智能 论文 AI创造营