价格追踪 · 五折 9 月 9 日截止

GLM-5.3-Flash 价格
五折 $0.075/$0.25,到 9 月 9 日

标价是每百万 token $0.15 输入 / $0.50 输出,发布期五折到 2026-09-09 24:00(UTC+8)。便宜是真的,但缓存读取那一栏值得单独算一遍。

#$0.075 / $0.25#五折至 9/9#缓存 $0.015#Opus 4.8 的 1/40

四栏价格

$0.075

输入 · 折扣期

每百万 token。标价 $0.15,五折期结束后回到标价。

$0.25

输出 · 折扣期

每百万 token。标价 $0.50。输入输出比 1:3.3,比多数同级模型温和。

$0.015

缓存读取 · 折扣期

标价 $0.03。⚠️ 这一栏是长上下文 agent 的真实成本大头,见下方对比。

1/40

相对 Opus 4.8

同为 AA 智能指数 57 一档,折扣期价格约为 Claude Opus 4.8 的四十分之一。

官方价怎么算

智谱开放平台与 Z.ai 对 GLM-5.3-Flash 的标价是每百万 token 输入 $0.15、输出 $0.50,缓存读取 $0.03;发布期打五折,即输入 $0.075、输出 $0.25、缓存读取 $0.015,缓存存储在优惠期内免费。这个价位约为同代旗舰 GLM-5.3 的十分之一(折扣期二十分之一),也是 Claude Opus 4.8 的四十分之一。折扣的截止时间是明确的:2026 年 9 月 9 日 24:00(UTC+8)。

各平台报价对照

OpenRouter 的 z-ai/glm-5.3-flash 当前展示的就是促销价 $0.075 / $0.25(缓存 $0.015)。Novita 的 zai-org/glm-5.3-flash 按自有 serverless 报 $0.15 / $0.50。AIHubMix 上架时标了限时五折。QuickSilver Pro 声称比官方促销价再低约两成($0.06 / $0.20)。差价来自各家的补贴策略与结算口径,选之前先确认对方是否同样支持 1M 上下文与缓存计费。

价格时间线

2026-08-26

发布并开放 API,五折优惠同步生效:$0.075 / $0.25,缓存读取 $0.015。

2026-08-26

OpenRouter 下架免费的 stealth/ox-alpha,改挂 z-ai/glm-5.3-flash 按促销价计费。

2026-09-09

24:00(UTC+8)五折结束,回到标价 $0.15 / $0.50,缓存读取回到 $0.03。

已确认 vs 需自己核

已确认

标价 $0.15/$0.50、五折价 $0.075/$0.25、缓存读取 $0.03(折扣 $0.015)、截止时间 2026-09-09 24:00(UTC+8)、缓存存储优惠期免费 —— 全部出自智谱与 Z.ai 的官方文档与发布公告。

需自己核

第三方聚合的报价随时在变,且不一定包含同样的上下文上限与缓存策略;「比官方还便宜」的平台要看清是补贴还是降配。另外 Coding Plan 的额度换算(Flash 约为 GLM-5.3 的三倍)按订阅档位不同而变,以你所在区域的官方页为准。

便宜之外,先算缓存

标价确实压得很低

$0.075 / $0.25 在同智能档位(AA 57)里几乎是最低的一档。一次性、短上下文、批量处理的任务,成本优势直接兑现。

缓存读取是另一回事

缓存读取 $0.03(折扣期 $0.015)。有开发者实测这个数字约为 DeepSeek V4 Flash 非高峰价的四倍。Agent 循环里同一段长上下文会被反复读取,缓存费用可能反超标价省下的钱——先用自己的缓存命中率和平均上下文长度算一遍。

怎么算自己的账

把一次典型请求拆成三部分:新增输入 token、命中缓存的输入 token、输出 token。折扣期的公式是 新增输入 × $0.075 + 缓存命中 × $0.015 + 输出 × $0.25,除以一百万。Agent 工作流的缓存命中率通常在 60% 到 90% 之间,命中率越高,缓存那一栏的权重越大——这也是为什么不能只看标价。9 月 9 日之后把三个数字各乘二即可得到长期成本。

在 QCode 上

QCode 接入的智谱型号是 GLM-5.3、GLM-5.2、GLM-5.1,一律按官方价乘服务费率计费,价格随上游变动自动跟随。GLM-5.3-Flash 尚未接入,本页只做价格资料整理。想比较国产模型的实际成本,可以先用 GLM-5.3 或 DeepSeek V4 系列——后者还有峰谷分时定价,非高峰时段价格减半。

常见问题

五折到底什么时候结束?

2026 年 9 月 9 日 24:00,时区是 UTC+8。之后输入回到 $0.15、输出回到 $0.50、缓存读取回到 $0.03,都是每百万 token。

有没有免费额度?

没有永久免费的公开端点。免费的是它匿名公测期的 stealth/ox-alpha,揭晓当天已从 OpenRouter 生产目录移除。智谱平台新用户有赠送额度,属于试用性质。

缓存怎么计费?

缓存读取按 $0.03 每百万 token 计(折扣期 $0.015),缓存存储在优惠期内免费。注意缓存读取单价虽然只有输入价的五分之一,但在高命中率的长上下文场景里它承担了绝大部分 token 量。

比 DeepSeek V4 Flash 便宜吗?

看你怎么用。纯输入输出上 GLM-5.3-Flash 折扣价更低;但缓存读取这一栏,有开发者实测它约为 DeepSeek V4 Flash 非高峰价的四倍。DeepSeek 还有峰谷分时定价,非高峰减半。缓存命中率高、上下文长的 agent 场景,两者要各自算一遍才知道谁便宜。

Coding Plan 划算还是按量付费划算?

智谱 Coding Plan 里 Flash 的额度约为 GLM-5.3 的三倍,适合每天稳定高频使用的人。用量波动大、或者需要同时用多家模型的,按量付费更灵活——尤其是当你还要跑 Claude、GPT 或 Gemini 时,统一按量计费能省掉在每个平台分别充值。

第三方比官方便宜,能信吗?

可以用,但要核三件事:上下文上限是不是同样 1M、缓存计费策略是否一致、以及限流。有平台报出比官方促销更低的价格(例如 $0.06 / $0.20),通常是阶段性补贴,未必长期维持。

信息来源

智谱开放平台与 Z.ai 官方定价文档、Z.ai 发布公告(2026-08-26)、OpenRouter 与 Novita 模型页报价、AIHubMix 与 QuickSilver Pro 上架公告、开发者在 X 上的缓存成本实测(2026-08-26 至 27 抓取)。

国产模型,一把 key 全通

GLM-5.3、DeepSeek V4、Kimi K3、Qwen 在 QCode 同端点可切换,按官方价乘服务费率,不用在各平台分别充值。

相关阅读

价格为 2026-08-27 快照,随厂商调整变化。QCode 与智谱 AI 无隶属关系。GLM-5.3-Flash 尚未在 QCode 接入。