昊梵体育网

DeepSWE给分国模TOP,GLM命令行战场超 Kimi 前两天看智谱自家技术

DeepSWE给分国模TOP,GLM命令行战场超 Kimi
前两天看智谱自家技术报告数据时我记得 GLM-5.3 还不是这个数,今天把DeepSWE最新官榜重新捋了一遍,感觉智谱这波迭代值得重新再聊一聊。

DeepSWE官方主榜单上,GLM-5.3 的得分是69% ±3%,Kimi K3 是69% ±5%。两者均值完全持平,且GLM的置信区间更窄(稳定性更好)。

我开头说到的他们自家技术报告的数据对比表中,智谱给 Kimi 挂了 67.5%,还略微领先 GLM 的 66.9%,注意这是智谱自家挂的!我勒个老实人。

DeepSWE这个榜还是很硬核的。大家都很熟悉了,它评测的是长程软件工程能力,113个真实任务,来自91个开源仓库,5种编程语言。说白了,检验 AI 真实水平就看这个。所以现在主流模型厂商都很认这个榜。

对比一下Kimi K3这边。Kimi K3在DeepSWE上的表现也是很不错了,Claude Fable 5之后数一数二。但如果把开源vs闭源这个维度加进来,情况就微妙了,开源模型硬刚闭源,GLM 给到夯。

后面的成本列,GLM-5.3的API定价放在整个DeepSWE榜单里也是相当香。GLM-5.3的单任务平均成本是 3.99 便宜了近15%。输出Token数也更少(80k vs 81k),步骤数略多(124 vs 98),但总成本反而更低,说明GLM的推理效率在工程层面有独特优化。

我觉得智谱这次的后训练路线想得很清楚。GLM-5.3没有改动基座结构,完全靠扩大后训练规模实现能力跃升。后训练依赖的是真实可执行代码环境,训练信号来自终端任务是否完成,更贴近真实软件工程场景,而不是静态评测。

不过,如果只盯着DeepSWE,会错过GLM真正恐怖的地方。Terminal Bench 3.0这个侧重终端多步骤命令行任务的评测上,GLM-5.3拿下了28.3%,而Kimi K3只有17.4%,这反而是GLM 和 Kimi 掰手腕的维度。说明在复杂环境交互和长链路任务规划上,GLM的后训练策略确实走出了差异化路线。

当然,榜是静态的,迭代是动态的。下一版谁能拉开身位,甚至是登顶全球,我们拭目以待

智谱 Kimi GLM DeepSWE 大模型