GLM-5.3-Flash
320B-A18B、1M 上下文、MIT 开源
智谱 8 月 26 日发布,前身是 OpenRouter 上匿名公测的 Ox Alpha。价格是 GLM-5.3 的十分之一,但它不是「笔记本能跑的 Flash」——3200 亿总参,本地部署门槛在 181GB 起。
四个关键数字
参数规模
3200 亿总参、180 亿激活的 MoE,混合稀疏 + 线性注意力。名字里的 Flash 指推理成本,不指模型体积。
上下文窗口
官方与 Z.ai 文档标 1,048,576,最大补全 131,072。⚠️ Artificial Analysis 页面标的是 400K,两处不一致。
发布期五折价
标价 $0.15 / $0.50 每百万 token,五折到 2026-09-09 24:00(UTC+8)。缓存读取 $0.03(折扣期 $0.015)。
AA 智能指数
与 Claude Opus 4.8 同档。⚠️ 不是 Fable 5 那一档——社区一度流传的 80% 是 10 题小样本。
GLM-5.3-Flash 是什么
智谱 GLM-5 系列里第一个原生多模态模型,2026 年 8 月 26 日发布并同步开源权重(MIT 许可,已上 Hugging Face)。架构是 3200 亿总参 / 180 亿激活的 MoE,采用混合稀疏与线性注意力,支持文本、图像、视频输入,输出文本,带工具调用与视觉编程能力。发布前它以代号 Ox Alpha 在 OpenRouter 上做过一周匿名公测;官方称那一周全程跑在国产 AI 芯片集群上、日均服务约 100 万亿 token,自研的 SGLang 推理引擎把端到端性能提升约 3 倍。
发布后 24 小时发生了什么
揭晓当天 OpenRouter 就把匿名 slug stealth/ox-alpha 从生产目录下架、换成 z-ai/glm-5.3-flash,免费公测随之结束;Novita、AIHubMix 等聚合平台同日上架,硅基流动、Fireworks、Together 截至 8 月 27 日尚未跟进。社区最集中的三个疑问是:分数到底多少、免费没了怎么接、本地跑不跑得动。第三个在 r/LocalLLaMA 讨论量最大——不少人被 Flash 这个名字误导,以为是小模型。
时间线
GLM-5.3 发布(基座不换、纯后训练),8 月 19 日 API 上线,定价与 GLM-5.2 一致。
代号 Ox Alpha 的匿名模型出现在 OpenRouter 与 OpenCode,免费公测,身份未公开。
智谱揭晓 Ox Alpha 即 GLM-5.3-Flash,同日开源权重、上线 API,匿名 slug 下架。
已确认 vs 易误读
已确认
发布日期、320B-A18B 架构、MIT 许可与权重上架 Hugging Face、官方标价 $0.15/$0.50 与五折截止 2026-09-09、AA 智能指数 57、Ox Alpha 身份——这些都有官方公告或厂商文档可核。
易误读
「DeepSWE 80%」是隐身期 10 题小样本的结果,官方 DeepSWE v1.1 实测 63.4%,社区 113 题单次运行约 58.4%。「对标 Fable 5」同样不成立:AA 指数 57 对应的是 Opus 4.8 那一档。「叫 Flash 所以能本地跑」也是误读,它有 3200 亿总参。
便宜四十倍的另一面
输入输出确实便宜
五折期 $0.075/$0.25,约为 GLM-5.3 的二十分之一、Claude Opus 4.8 的四十分之一。短对话与批量任务上成本优势明显。
但缓存读取不便宜
缓存读取 $0.03(折扣期 $0.015),有开发者实测约为 DeepSeek V4 Flash 非高峰价的四倍。长上下文反复复用的 agent 工作流,缓存费用可能盖过标价优势——按自己的缓存命中率算一遍再决定。
怎么用
官方 model code 是 glm-5.3-flash,走智谱开放平台或 Z.ai 的 OpenAI 兼容端点。第三方聚合上的 id 各不相同:OpenRouter 是 z-ai/glm-5.3-flash,Novita 是 zai-org/glm-5.3-flash。想本地部署先算显存:FP8 权重约 306 GiB、BF16 约 585 GB,目前最小的 NVFP4 量化约 181 GB,Unsloth 的 GGUF 仍在制作中。用 Claude Code 一类客户端时注意 [1m] 这类后缀是客户端标记,需要网关层处理,不能原样透传给上游。
在 QCode 上
QCode 目前接入的智谱型号是 GLM-5.3、GLM-5.2 与 GLM-5.1,按官方价乘服务费率计费,一把 key 同端点可切换。GLM-5.3-Flash 发布于 8 月 26 日,尚未接入——本页只做资料整理,不代表它在 QCode 上可调。想现在就跑国产模型,可以先用 GLM-5.3 或 DeepSeek V4 系列。
常见问题
GLM-5.3-Flash 免费吗?
不免费。免费的是它匿名公测期的 stealth/ox-alpha 端点,揭晓当天已从 OpenRouter 生产目录下架且没有别名。OpenRouter 上现在也没有它的 :free 端点(带免费端点的是上一代 GLM-5.2)。智谱平台新用户有赠送额度,但那不是永久免费。
上下文到底是 1M 还是 400K?
官方文档与 Z.ai 文档都写 1,048,576,最大补全 131,072;Artificial Analysis 的页面写 400K 并把它标为闭源模型,与 MIT 开源的事实矛盾。两处不一致,推测 AA 抓的是某个服务端点的实际上限。以官方文档为准,但如果你依赖超长上下文,先在你要用的那个供应商上实测。
DeepSWE 到底是 63.4% 还是 80%?
官方 DeepSWE v1.1 数字是 63.4%。80% 来自隐身期一次 10 题的小样本测试,样本扩大后没有复现;社区用 113 题跑单次约 58.4%。做选型时用 63.4% 这个口径。
本地跑得动吗?
要看你有多少显存。FP8 权重约 306 GiB,BF16 约 585 GB,目前社区最小的 NVFP4 量化约 181 GB。单张消费级显卡不可能,256GB 统一内存的工作站是讨论最多的方案,Unsloth 的 GGUF 量化仍标注制作中。绝大多数人走 API 更划算。
它和 GLM-5.3 该怎么选?
GLM-5.3 是同代旗舰后训练版本,复杂编程更强;Flash 是同代的低成本档,价格约为前者的十分之一,且多了原生多模态。批量、成本敏感、需要看图的任务用 Flash,复杂长链路编程仍建议 GLM-5.3。智谱 Coding Plan 里 Flash 的额度约为 GLM-5.3 的三倍。
五折优惠什么时候结束?
2026 年 9 月 9 日 24:00(UTC+8)。之后回到标价每百万 token $0.15 输入 / $0.50 输出,缓存读取从 $0.015 回到 $0.03。
信息来源
智谱开放平台与 Z.ai 官方文档、Z.ai 发布博客与官方社交账号公告(2026-08-26)、OpenRouter 与 Novita 模型页、Hugging Face 模型卡、Artificial Analysis 模型页、r/LocalLLaMA 与 V2EX 社区讨论(2026-08-26 至 27 抓取)。
相关阅读
本页数据为 2026-08-27 快照,随厂商更新变化。QCode 与智谱 AI 无隶属关系。GLM-5.3-Flash 尚未在 QCode 接入。