更新:2026-08-19 — 智谱 GLM-5.3 于 8 月 14 日正式发布。本文基于智谱官方公告、bigmodel.cn 官方定价页与多家媒体报道整理。
8 月 14 日,智谱把 GLM-5.3 端了上来。这一周的大模型圈已经卷到几乎一天一个新旗舰:Grok 4.6 刚发完,DeepSeek V4 Pro 正式版虚晃一枪,然后智谱的答卷也到了。
但 GLM-5.3 这次有个不太一样的点:基座没换。 7430 亿参数,跟 GLM-5.2 同一套底子,所有性能提升全部来自后训练阶段的 Scaling——智谱官方原话是 “scaling post-training is all we did”。
不换基座,靠训练方法把智能上界往上推,还顺便点亮了一个谁都没预告的技能树:网络安全。这篇把 GLM-5.3 到底强在哪、怎么用、价格多少讲清楚。
太长不看版
| 维度 | 结论 |
|---|---|
| 发布时间 | 2026-08-14,智谱(港交所 02513) |
| 模型规格 | 7430 亿参数,与 GLM-5.2 同基座,纯后训练升级 |
| 编程能力 | 内部体感评测较 GLM-5.2 提升 50%,Terminal-Bench 3.0 从 4.6 涨到 28.3 |
| 开源排名 | Terminal-Bench 3.0、Agents’ Last Exam (CLI) 等公开基准开源第一 |
| 网络安全 | CyberGym 84.5%(开源第一),白盒代码审查追平 Anthropic Mythos 5 |
| Token 效率 | 高思考档位下 31.5% 准确率,超过 Claude Opus 4.8 的 29.5% |
| 开源计划 | 发布两周后开放模型权重(先做安全加固) |
| 当前入口 | GLM Coding Plan、ZCode、AutoClaw 已上线,API 很快上线 |
| 适合谁 | 编程、终端操作、长程 Agent 任务开发者 |
这版 GLM-5.3 为什么值得关注
先说清楚这次的定位:GLM-5.3 不是”新一代基座”,而是同一基座下的后训练极限。智谱官方技术博客开篇就写得很直白——scaling post-training is all we did。基座没换、参数没加,所有提升来自后训练阶段的强化学习和数据工程。
对行业来说,这是个信号:堆参数的路线告一段落,训练方法成了新的竞争焦点。 之前传闻的万亿参数升级没有出现(那枚牌大概留给了 GLM-5.5),但智谱靠后训练硬是把性能拉高了 50%。
对开发者来说,重点就两个:编程真的变强了,而且意外多出来一个网络安全能力——后者是智谱自己都承认”超出预期”的涌现能力。
核心性能评测
1. 编程能力:Terminal-Bench 3.0 涨了 6 倍
编程是 GLM-5.3 的主场。官方数据:内部自建体感评测较 GLM-5.2 提升 50%。公开基准上的跃升更直观:
| 基准 | GLM-5.2 | GLM-5.3 | 变化 |
|---|---|---|---|
| Terminal-Bench 3.0 | 4.6 | 28.3 | 约 6 倍 |
| DeepSWE v1.1 | 46.2 | 66.9 | +20.7 |
| CyberGym 漏洞推理 | 77.2% | 84.5% | +7.3% |
Terminal-Bench 3.0 衡量的是模型在真实终端环境中完成复杂任务的能力——跑命令、改代码、查日志,不是单纯的代码生成。GLM-5.3 从 4.6 干到 28.3,是智谱公布的所有基准里涨幅最夸张的一个。
2. Agent 能力:开源第一,逼近 Claude Fable 5
在 Agents’ Last Exam (CLI) 等公开基准中,GLM-5.3 拿下开源模型第一。多家媒体的实测结论是:编程与智能体能力接近 Claude Fable 5 和 GPT-5.6 Sol,编程体感超过其他国产模型。
与国产竞品比:GLM-5.3 和 Kimi K3 在编程、智能体领域互有胜负,但在绝大部分基准上领先 DeepSeek V4 Pro 正式版(0813)。
3. Token 效率:花更少的钱办同样的事
这次智谱专门强调了 Token 利用率。实测数据:在相同的高思考档位预算下,GLM-5.3 的准确率达到 31.5%,超过 Claude Opus 4.8 的 29.5%;任务平均输出约 5 万个 token,不到 Opus 的一半。
对 API 用户来说,这意味着同样的效果、更低的账单——在 OpenAI 刚刚把 GPT-5.6 Luna API 价格下调 80%(每百万 token 输入从 $1 降到 $0.2)的价格战背景下,Token 效率比单看分数更重要。
4. 网络安全:意外涌现的技能树
GLM-5.3 最大的惊喜在这里。智谱说这是”充分的模型后训练涌现出的超出预期能力”:在白盒代码审查与漏洞发现任务上,表现与 Anthropic 的 Mythos 5 持平——而 GLM-5.3 的参数体量只有 Mythos 的十分之一。
最出圈的案例:清华 NASP 实验室用它深入 Cursor 的底层架构,直接在权限校验逻辑里发现了一个可任意写文件的漏洞。2436 个漏洞被翻出来,有些藏了 45 年。
当然要客观说:招银国际的研报指出,GLM-5.3 的网络安全能力在任务链较前端的环节(代码审查、漏洞推理)表现强,但完整漏洞利用链条任务上还有提升空间。它是”安全之盾”的胚子,不是已经完工的攻防一体。
定价方案
API 定价(bigmodel.cn 官方)
| 项目 | 价格 |
|---|---|
| 输入 | 8 元 / 百万 token |
| 输出 | 28 元 / 百万 token |
| 缓存命中 | 2 元 / 百万 token |
| 限时免费 | ✅(新品限时免费阶段) |
注意:GLM-5.3 与 GLM-5.2 定价一致(输入 8 元、输出 28 元),但上下文窗口升级到 1M。限时免费阶段是体验窗口,之后恢复标准价格。
GLM Coding Plan 订阅
GLM Coding Plan 已全量开放订阅,按 Token 扣积分计费(7 月底刚从”按 prompt 次数”改为积分制)。8 月 14 日发布当天 13:00,全员额度重置——订阅用户当天起就能用上 GLM-5.3。具体档位价格以官网实时显示为准。
使用教程:四种方式接入
方式一:GLM Coding Plan(订阅用户最快)
8 月 14 日当天,GLM-5.3 已在 GLM Coding Plan 全量上线。订阅用户打开就能切到新模型,不需要任何额外配置。适合日常用 AI 写代码、跑 Agent 任务的开发者。
方式二:ZCode / AutoClaw(官方编程工具)
智谱同步上线了官方编程工具 ZCode 和效率工具 AutoClaw。ZCode 是围绕 GLM-5.3 打造的编程 Agent 工作台,AutoClaw 偏自动化效率场景。两个工具都内置了 GLM-5.3,开箱即用。
方式三:兼容主流编码平台
GLM-5.3 兼容 Claude Code、OpenCode 等主流代码代理工具——把模型后端切到智谱的 API 即可,调用逻辑不用重写。同时 TraeWork/TraeCode、扣子、WorkBuddy/CodeBuddy、Qoder/QwenWork、CatPaw、JoyCode 等编码平台已开放抢先体验;范式集团的 PhanRouter 平台 8 月 17 日完成适配,首批支持 GLM-5.3 调用,原有 API 接口和账号体系可直接沿用,只改模型名。
方式四:等两周后的开源权重
智谱承诺发布两周后开放完整模型权重(约 8 月底),在此之前先做分层风险审查和安全加固,“尽可能限制潜在攻击能力,保留防御价值”。想本地部署、想微调、想自托管推理的团队,直接等开源权重即可,到时 Hugging Face 上会有官方仓库。
竞品对比:和 Kimi K3 / DeepSeek V4 Pro / Claude Fable 5 怎么选
| 维度 | GLM-5.3 | Kimi K3 | DeepSeek V4 Pro | Claude Fable 5 |
|---|---|---|---|---|
| 编程定位 | 开源第一,逼近 Fable 5 | 编程/Agent 互有胜负 | 生产环境 Agent 强 | 闭源标杆 |
| 终端操作 | Terminal-Bench 3.0 开源第一 | — | 87.9 分 | 88 分(最高) |
| 网络安全 | 白盒审查追平 Mythos 5 | — | — | Mythos 系同厂 |
| 开源 | 两周后开源权重 | 部分开源 | 闭源 API | 闭源 |
| 价格 | 输入 8 元 / 输出 28 元 | — | 高峰 $1.32/$3.96 | 最高 |
| Token 效率 | 31.5% / 5 万 token | — | — | Opus 级 29.5% |
一句话:要开源、要自托管、要编程性价比 → GLM-5.3;要生产环境 Agent 稳定 → DeepSeek V4 Pro;预算不敏感要闭源标杆 → Claude Fable 5。 GLM-5.3 和 Kimi K3 是同一赛道的直接对手,互有胜负,建议按你实际跑的基准自测。
FAQ
Q1:GLM-5.3 是开源的吗? 权重计划在发布两周后(约 8 月底)开放,先做安全加固。当前通过 GLM Coding Plan、ZCode 和第三方平台(PhanRouter、Trae 等)使用。
Q2:GLM-5.3 和 GLM-5.2 有什么区别? 基座相同(7430 亿参数),所有提升来自后训练。编程能力 +50%,Terminal-Bench 3.0 从 4.6 涨到 28.3,新增网络安全能力(CyberGym 开源第一)。
Q3:API 什么时候上线? 官方口径是”很快上线”。目前 bigmodel.cn 定价页已列出 GLM-5.3(输入 8 元 / 输出 28 元 / 1M 上下文),限时免费阶段可以先体验。
Q4:国内开发者可以直接用吗? 可以。智谱是国内公司(港交所 02513 上市),bigmodel.cn 开放平台直接注册使用,不需要额外的网络环境。
Q5:GLM Coding Plan 值得订阅吗? 如果你每天高强度用 AI 写代码,订阅制按 Token 扣积分比按次付费划算;轻度用户建议先等 API 上线按量付费,别急着锁订阅。
Q6:网络安全能力对普通开发者有什么用? 代码审查、漏洞发现这类”找茬”任务可以交给它——比人工翻代码快得多。日常开发用它做代码 review 也能覆盖一部分安全视角。
总结
GLM-5.3 是 2026 年 8 月国产模型混战里性价比很高的一张牌:不换基座纯靠后训练,编程能力冲上开源第一,还白捡一个网络安全技能树。两周后开源权重是最大的变量——到时候本地部署、微调、自托管全都解锁,价格敏感型团队值得等。
想第一时间体验 GLM-5.3 和国内大模型生态,稳定的网络环境是刚需。下面几家跨境网络加速服务可以按需选择:
| 推荐场景 | 服务商 | 特点 |
|---|---|---|
| 编程开发为主 | 光速云 | IEPL专线 抗抖动,不限设备数,团队友好 |
| 性价比入门 | 飞猫云 | IEPL 专线 + 住宅 IP,一鱼两吃 |
| 稳定专线 | SS-ID | 老牌专线,稳定性优先 |
| 长期包年 | MESL | 企业级线路,长期使用更划算 |
相关阅读:DeepSeek V4 Pro 正式版指南 2026 | Kimi K3 指南 2026 | Grok 4.6 发布评测 | DeepSeek Harness 上手指南