[LG]《Explorative Modeling: Unlocking a Third Pretraining Axis and End-to-End Generation》A Gladstone, H Ji, Y Du [UIUC & Harvard] (2026)
在生成模型领域,端到端训练一直是一个悬而未决的难题。过去的方法如扩散模型受困于繁琐的多步推理,本质原因是重构损失函数会将多峰分布的数据强制平均化,产生模糊的无效输出,迫使系统必须通过分解生成步骤来换取样本质量。
本文的核心洞见是:把生成过程的分解重新看作训练循环的分解。由此,在训练时探索K个候选样本并仅对最佳匹配进行优化的关键操作,使模型能够直接锁定特定数据模态而非对其进行模糊平均。这为模型引入了除参数和数据之外的第三个预训练缩放轴。
这项工作真正留下的遗产是证明了生成表现力是一个可随计算量增长的独立缩放维度。它为后来者打开了通往超高效率、单步端到端生成的大门,消除了推理时的曝光偏差。但尚未跨过的门槛是在处理极端多模态分布时,如何平衡搜索计算成本与覆盖完整性。
arxiv.org/abs/2607.27372 机器学习 人工智能 论文 AI创造营








