昊梵体育网

同一基座能力再涨 50%,后训练之王炼成了

大家好,我是居丽叶。

GLM-5.3 发布后,我注意到一个细节:
它没有换基座,也没有增加参数。

但在智谱内部自建的真实编程体感评测中,GLM-5.3 相比 GLM-5.2 提升了 50%;Terminal-Bench 3.0 从 4.6 涨到 28.3,DeepSWE v1.1 从 46.2 涨到 66.9。

这些提升全部来自后训练。

所以今天我们就来聊聊:一个基座模型明明没有变,为什么还能被后训练继续榨出这么多能力?智谱凭什么敢说,它可能还远没有摸到这个基座的智能上界?

看完官方 Blog,又顺着 IndexShare、SAO 和 slime 把论文、代码翻了一遍,我的判断是:“后训练之王”指向一整套把环境、经验和强化学习基础设施同时往上 Scale 的能力。

相比 GLM-5.3 这次涨了多少分,我更关心的是:这套后训练体系,能不能继续复用到下一代基座上。