昊梵体育网

哎我去,毫无预警,智谱甩出了一枚重磅炸弹:GLM-5.3 正式发布! 最耐人寻

哎我去,毫无预警,智谱甩出了一枚重磅炸弹:GLM-5.3 正式发布!

最耐人寻味的是,智谱这次连基座模型都没换,完全靠后训练阶段的极致 Scaling,硬生生在短短不到两个月里——从 6 月 16 日发布 GLM-5.2 到今天——把大模型的智能上限又向上狠狠砸开了一道口子。

如果说过去大家还在靠 MMLU 或者各种选择题刷题集拼文科表达,那现在国产大模型的正面战场已经彻底变天了。

这次披露的 9 项硬核 Benchmark 释放了一个极其明确的信号:AI 行业的终局比拼,已经全面转向了 Coding、工具链深度调用、长程任务规划以及真正的 Agent 落地执行能力。

看懂这次智谱公布的数据,就会明白什么叫“降维打击”。

在 Terminal Bench 3.0 终端操作测试中,GLM-5.3 从 GLM-5.2 的 4.6 分直接暴涨到了 28.3 分,翻了近六倍;

在网络攻防和安全漏洞挖掘测试 ExploitBench 上,得分从 24.4 飙升到 54.4;ExploitGym 在 6 小时预算下更是直接从 39 飙到了 130。

这种数量级的跃迁早已超越了常规调参,这是直接把 AI 从“只能帮忙贴代码的文本生成器”,改造成了“能真正接管 Linux 终端、独立解决复杂工程报错的数字打工人”。

更让人直呼过瘾的是在硬碰硬的横向对比上。

在 AutomationBench 自动化任务评测中,GLM-5.3 斩获 48.2 分,直接超越了 Kimi K3 的 46.7、Fable 5 的 46.2 以及 GPT-5.6 Sol 的 45.8;

评估复杂经济与实际价值生成能力的 GDPVal-AA v2 拿下 1769 分,成功压制了 Fable 5 的 1743 和 GPT-5.6 Sol 的 1730;而在 CyberGym 仿真攻防评测中,84.5 的高分也再次击败了 Kimi K3 的 80.0 和 GPT-5.6 Sol 的 83.6。

即使在极为苛刻的 DeepSWE 软件工程测试(66.9 分)、Agents' Last Exam CLI 命令行 Agent 考试(28.5 分)以及 HLE w/ Tools 带工具高级推理测试(62.5 分)中,GLM-5.3 也展现出了极高的竞技水准,不仅大幅拉开与上一代 GLM-5.2 的差距,还与 GPT-5.6 Sol 和 Fable 5 杀得难解难分。

这背后的技术逻辑其实非常明确:

靠简单堆叠预训练算力的“暴力出奇迹”时代正在边际递减,而后训练强化学习(RL)、数十倍的长程环境模拟以及超长链条的任务自愈能力,才是把 AI 推进真正的 Agent 时代的核心钥匙。只要环境够真实、奖励函数够硬核,模型就能在长程探索中进化出人类都意想不到的解决方案。

目前 GLM-5.3 已经优先通过 GLM Coding Plan 和 ZCode 平台开放给开发者体验。智谱官方也明确表示,API 访问权限与开放权重将在完成严苛的安全评估后,分阶段陆续释放。

从 DeepSeek 的高性价比突围到智谱 GLM-5.3 的 Agent 狂飙,国产大模型这一轮对轰彻底撕下了“只会聊天”的标签。当大模型开始能真正帮你跑终端、修 Bug、部署复杂系统的时候,离程序员彻底变成“监工”的日子恐怕真不远了。