8月14日智谱发布GLM-5.3,基座模型和5.2完全一样,所有提升全部来自后训练Scaling。编程能力暴涨50%,Terminal-Bench从4.6跃升至28.3翻了6倍,DeepSWE从46.2升至66.9。在 Code Bench中5.3 High档准确率31.4%超过Claude Opus 4.8的29.5%,每项任务平均输出5万tokens而Opus要12万。智谱表示在多项主流基准测试中已是排名最高的开源模型。
长程任务能力才是杀手锏,数十倍环境类型和超长后训练时间把模型丢进复杂环境里反复磨。安全维度同样亮眼:漏洞发现持平Mythos 5,利用链后段比5.2高出两倍以上,不仅能发现漏洞还能理解连锁反应。两周后开放模型权重,延续MIT协议可能性极大。
GLM-5.3验证了基座模型不是护城河,后训练才是。同样的基座,差距比很多公司换一代基座效果还大。智谱用IndexShare、SAO、Slime框架这套组合拳证明,模型智能上限远未被基座参数锁死。
