昊梵体育网

[LG]《Training nGPT》I Loshchilov, B Ginsb

[LG]《Training nGPT》I Loshchilov, B Ginsburg [NVIDIA] (2026)

在大规模语言模型预训练领域,训练效率与超参数耦合是一个悬而未决的难题。过去的方法受困于梯度范数的不稳定增长与学习率/权重衰减的复杂交互,本质原因是传统架构中激活值与权重的范数不受限,导致优化路径在超高维空间中极易偏离最优流形。

本文的核心洞见是:把模型参数与激活向量的演进重新看作单位超球面上的一系列旋转优化步骤。由此,引入 Logit 梯度预处理(LGP)以剥离词表缩放对梯度的隐性干扰,并配合 GatedAdamW 优化器实现精准的角速度控制,使问题得以解开。

这项工作真正留下的遗产是证明了超球面表示学习在 14B 规模 MoE 模型上的可扩展性,仅需一半的 Token 量即可达到与基准模型相同的精度。它为后来者打开的新门是摆脱权重衰减依赖的纯几何优化路径,但尚未跨过的门槛是该方案在万亿参数级别下的超参数缩放法则及硬件算子适配。

arxiv.org/abs/2608.01284 机器学习 人工智能 论文 AI创造营