GLM-5.3-Flash:前沿能力进入 Flash 成本
智谱正式发布并开放 GLM-5.3-Flash,这是 GLM-5 系列首个原生多模态模型,采用 320B 总参数、18B 激活参数,支持 1M Token 上下文。这次 Flash 的重点,是从模型架构和推理服务两端同时降低计算成本。
能力方面,GLM-5.3-Flash 在 Artificial Analysis Intelligence Index v4.1.1 中取得 57 分,进入前沿模型能力区间。智谱公布的测试中,它在 DeepSWE v1.1、Toolathlon Verified、AutomationBench v1.0.6 等编程与 Agent 评测上均明显超过 GLM-5.2。
架构上,GLM-5.3-Flash 总参数规模与 GLM-4.5 接近,但激活参数从 32B 降至 18B,层数从 92 层降至 45 层;同时引入线性注意力与稀疏注意力混合架构,并通过 IndexPool 进一步降低长上下文开销。按智谱公布的比较口径,其注意力计算量约为 GLM-5.3 的 33%,KV 缓存约为 23%。
原生多模态也被直接放进编程执行闭环。在前端、游戏、Blender 等任务中,模型可以生成代码、运行项目、观察界面或渲染结果,再根据视觉反馈继续修改;ZCode 还将这套能力扩展到浏览器和计算机操作。
推理服务层面,智谱称 GLM-5.3-Flash 已跑在国产芯片集群上,并采用编码—预填充—解码分离式架构。相较同一硬件上的初始基线,端到端服务性能提升 3 倍。
目前模型已开放 API、GLM Coding Plan 和 Hugging Face 权重,模型 ID 为 glm-5.3-flash,模型权重采用 MIT 许可证。Z.ai API 当前限时价格为每百万 Token 输入 $0.075、缓存输入 $0.015、输出 $0.25,5 折优惠持续至 2026 年 9 月 9 日 24:00(UTC+8)。
智谱GLM 智谱GLM5 大模型 多模态 Agent AI编程 模型架构 推理优化 国产芯片





