昊梵体育网

这新模型接着来啊!智谱GLM 5.3 刚发布了! 智谱内部 Code Bench

这新模型接着来啊!智谱GLM 5.3 刚发布了!
智谱内部 Code Bench 成绩比 GLM-5.2 提高 50%
Terminal-Bench 3.0:4.6 → 28.3
DeepSWE v1.1:46.2 → 66.9
Agents’ Last Exam:23.8 → 28.5

Max 档完成率达到 34.5%,每项任务约消耗 7.5 万输出 token;GLM-5.2 为 23.4%、9.6 万 token
在 High 档测试中,GLM-5.3 用约 5 万 token 得到 31.4%,高于 Claude Opus 4.8 的 29.5%,后者消耗约 12 万 token。不过在官方测试里,GLM-5.3 仍落后于 Fable 5。

安全能力这部分提升有些出乎意料:
CyberGym:84.5%,GLM-5.2 为 77.2%
ExploitBench:24.4% → 54.4%
ExploitGym:两小时内完成 105 项,GLM-5.2 完成 29 项

智谱还与国内安全团队合作,在 269 个真实项目中发现了 2436 个漏洞,其中 1097 个属于高危或严重级别。最老的漏洞已经存在约 40 年。相关问题会经过专家复核和披露流程,并记录在公开的安全漏洞台账中。
AI 大模型 多模态人工智能 LLM 智谱