GLM-5.3-Flash
320B-A18B、1M コンテキスト、MIT ライセンス
Z.ai が 8 月 26 日にリリース。OpenRouter で Ox Alpha として匿名公開されていたモデルの正体です。価格は GLM-5.3 の 10 分の 1 ですが、「ノート PC で動く Flash」ではありません。総パラメータ 3,200 億、ローカル実行は 181GB からです。
押さえるべき 4 つの数字
パラメータ規模
総 3,200 億 / アクティブ 180 億の MoE。ハイブリッドスパース + 線形アテンション。名前の Flash は推論コストを指し、モデルサイズのことではありません。
コンテキスト長
公式ドキュメントと Z.ai ドキュメントはいずれも 1,048,576、最大補完 131,072 と記載。⚠️ Artificial Analysis は 400K としており、両者が食い違っています。
リリース記念 50% オフ
定価は 100 万トークンあたり $0.15 / $0.50。半額期間は 2026-09-09 24:00(UTC+8)まで。キャッシュ読み取りは $0.03(割引期間は $0.015)。
AA インテリジェンス指数
Claude Opus 4.8 と同ティア。⚠️ Fable 5 のティアではありません。一時期出回った 80% という数字は 10 問のサンプルによるものです。
GLM-5.3-Flash とは
Z.ai の GLM-5 シリーズで初のネイティブマルチモーダルモデルで、2026 年 8 月 26 日にリリースと同時に MIT ライセンスで重みが公開されました(Hugging Face 掲載済み)。アーキテクチャは総 3,200 億 / アクティブ 180 億の MoE で、ハイブリッドスパースと線形アテンションを採用。テキスト・画像・動画を入力として受け取りテキストを出力し、ツール呼び出しとビジュアルコーディングに対応します。リリース前には Ox Alpha というコードネームで OpenRouter 上に 1 週間匿名公開されており、Z.ai によればその期間は国産 AI チップクラスタのみで稼働し、1 日あたり約 100 兆トークンを処理、自社の SGLang ベース推論エンジンによりエンドツーエンドで約 3 倍の性能向上を実現したとのことです。
リリース後 24 時間の動き
正体が明かされた当日、OpenRouter は匿名スラッグ stealth/ox-alpha を本番カタログから削除し z-ai/glm-5.3-flash に差し替え、無料プレビューは終了しました。Novita と AIHubMix は同日に対応。SiliconFlow、Fireworks、Together は 8 月 27 日時点で未対応です。議論は 3 点に集中しています。実際のベンチマークスコアはいくつか、無料枠が消えた後どう繋ぐか、ローカルで動かせるか。3 つ目は r/LocalLLaMA で最も伸びており、Flash という名前から小型モデルだと誤解した人が多かったためです。
タイムライン
GLM-5.3 リリース(ベースは据え置き、ポストトレーニングのみ)。8 月 19 日に API 提供開始、価格は GLM-5.2 と同一。
コードネーム Ox Alpha の匿名モデルが OpenRouter と OpenCode に登場、無料プレビューとして提供。
Z.ai が Ox Alpha = GLM-5.3-Flash と公表。同日に重み公開と API 提供を開始し、匿名スラッグは廃止。
確定事項 vs 誤読されやすい点
確定事項
リリース日、320B-A18B というアーキテクチャ、MIT ライセンスと Hugging Face での重み公開、定価 $0.15/$0.50 と 2026-09-09 までの割引期限、AA インテリジェンス指数 57、Ox Alpha の正体 —— いずれも公式発表またはベンダードキュメントで確認できます。
誤読されやすい点
「DeepSWE 80%」はステルス期間中の 10 問サンプルによる数字です。公式の DeepSWE v1.1 は 63.4%、コミュニティによる 113 問の単発実行では約 58.4% でした。「Fable 5 相当」も成立しません。AA 指数 57 は Opus 4.8 のティアです。「Flash という名前だからローカルで動く」も誤りで、総パラメータは 3,200 億あります。
40 分の 1 の価格には裏がある
入出力は確かに安い
割引期間の $0.075/$0.25 は GLM-5.3 の約 20 分の 1、Claude Opus 4.8 の約 40 分の 1 です。短いターンやバッチ処理ではコスト優位がはっきり出ます。
ただしキャッシュ読み取りは安くない
キャッシュ読み取りは $0.03(割引期間 $0.015)。ある開発者の実測では DeepSeek V4 Flash のオフピーク価格の約 4 倍でした。長いコンテキストを繰り返し再利用するエージェントのループでは、キャッシュ料金が表示価格の優位を打ち消す可能性があります。自分のキャッシュヒット率で一度計算してから判断してください。
使い方
公式のモデルコードは glm-5.3-flash で、Z.ai または bigmodel.cn の OpenAI 互換エンドポイントから利用します。サードパーティの ID は異なり、OpenRouter は z-ai/glm-5.3-flash、Novita は zai-org/glm-5.3-flash です。ローカルで動かすならまずメモリを見積もってください。FP8 の重みが約 306 GiB、BF16 が約 585 GB、現時点で最小の NVFP4 量子化が約 181 GB で、Unsloth の GGUF はまだ作業中と表示されています。Claude Code のようなクライアントから使う場合、[1m] のようなサフィックスはクライアント側のマーカーなので、ゲートウェイ層で処理し上流にそのまま渡さないよう注意してください。
QCode では
QCode で現在ルーティングできる Z.ai のモデルは GLM-5.3、GLM-5.2、GLM-5.1 で、公式価格 × サービス料率での課金、1 本のキーと同一エンドポイントで切り替えられます。GLM-5.3-Flash は 8 月 26 日リリースでまだ接続していません。本ページは資料整理であり、QCode 上で呼び出せることを意味しません。今すぐ中国製モデルを使いたい場合は GLM-5.3 か DeepSeek V4 系列からどうぞ。
よくある質問
GLM-5.3-Flash は無料ですか?
無料ではありません。無料だったのは匿名プレビュー期間の stealth/ox-alpha エンドポイントで、公表当日に OpenRouter の本番カタログから削除され、エイリアスも残っていません。OpenRouter に :free エンドポイントもありません(無料枠があるのは前世代の GLM-5.2 です)。Z.ai プラットフォームの新規アカウントには試用クレジットがありますが、恒久的な無料とは別物です。
コンテキストは 1M ですか 400K ですか?
公式ドキュメントと Z.ai ドキュメントはどちらも 1,048,576、最大補完 131,072 と記載しています。Artificial Analysis は 400K と記載し、さらにクローズドソースと分類していますが、これは MIT 公開という事実と矛盾します。両者は食い違っており、AA 側がサービング上限を取得した可能性が高いと見られます。公式ドキュメントを基準としつつ、超長コンテキストに依存する場合は実際に使うプロバイダで実測してください。
DeepSWE は 63.4% ですか 80% ですか?
公式の DeepSWE v1.1 は 63.4% です。80% はステルス期間中の 10 問の単発テストによるもので、サンプルを増やすと再現しませんでした。コミュニティによる 113 問の単発実行では約 58.4% です。モデル選定では 63.4% を基準にしてください。
ローカルで動きますか?
相応のメモリが必要です。FP8 の重みが約 306 GiB、BF16 が約 585 GB、コミュニティ製で最小の NVFP4 量子化が約 181 GB です。コンシューマ向け GPU 1 枚では不可能で、256GB のユニファイドメモリを積んだワークステーションが最もよく議論されている選択肢です。Unsloth の GGUF 量子化は現在も作業中と表示されています。多くの場合は API の方が安く済みます。
GLM-5.3 と GLM-5.3-Flash はどう使い分けますか?
GLM-5.3 は同世代のフラッグシップのポストトレーニング版で、複雑なコーディングに強いモデルです。Flash は同世代の低コスト帯で価格は約 10 分の 1、さらにネイティブマルチモーダルに対応します。バッチ処理、コスト重視のワークロード、画像を扱うタスクは Flash、長期的なコーディングは GLM-5.3 をおすすめします。Z.ai の Coding Plan では Flash のクォータが GLM-5.3 の約 3 倍です。
割引はいつまでですか?
2026 年 9 月 9 日 24:00(UTC+8)までです。以降は定価に戻り、100 万トークンあたり入力 $0.15 / 出力 $0.50、キャッシュ読み取りは $0.015 から $0.03 になります。
情報源
Z.ai および bigmodel.cn の公式ドキュメント、Z.ai のリリースブログと公式 SNS 告知(2026-08-26)、OpenRouter と Novita のモデルページ、Hugging Face のモデルカード、Artificial Analysis のモデルページ、r/LocalLLaMA と V2EX のコミュニティスレッド(2026-08-26〜27 取得)。
関連記事
GLM-5.3 完全ガイド
同世代フラッグシップの性能・価格・接続方法。
GLM-5.3 と GLM-5.2 の比較
ポストトレーニングで実際に何が変わったか。
AI モデルレーダー 2026
各ファミリーの価格と提供状況の追跡。
本ページの数値は 2026-08-27 時点のスナップショットで、ベンダーの更新により変わります。QCode は Z.ai と資本・提携関係にありません。GLM-5.3-Flash は QCode 未接続です。