GLM-5.3-Flash の価格
$0.075/$0.25、9 月 9 日まで
定価は 100 万トークンあたり入力 $0.15 / 出力 $0.50。リリース記念で半額、2026-09-09 24:00(UTC+8)までです。安いのは本当ですが、キャッシュ読み取りの行だけは別途計算する価値があります。
4 つの価格
入力 · 割引価格
100 万トークンあたり。定価は $0.15 で、割引期間終了後は定価に戻ります。
出力 · 割引価格
100 万トークンあたり。定価は $0.50。入出力比は 1:3.3 で、同クラスの多くのモデルより緩やかです。
キャッシュ読み取り · 割引価格
定価 $0.03。⚠️ 長コンテキストのエージェントでは、この行が実コストの大半を占めます。下の比較を参照してください。
Opus 4.8 との比
どちらも AA インテリジェンス指数 57 のティア。割引期間の価格は Claude Opus 4.8 の約 40 分の 1 です。
公式価格の内訳
Z.ai と bigmodel.cn が示す GLM-5.3-Flash の定価は、100 万トークンあたり入力 $0.15、出力 $0.50、キャッシュ読み取り $0.03 です。リリース記念でこの 3 つがいずれも半額になり、$0.075 / $0.25 / $0.015 となります。キャッシュの保存料は割引期間中は無料です。この価格は同世代のフラッグシップ GLM-5.3 の約 10 分の 1(割引期間では 20 分の 1)、Claude Opus 4.8 の約 40 分の 1 に相当します。期限は明示されています。2026 年 9 月 9 日 24:00(UTC+8)です。
各プラットフォームの価格比較
OpenRouter の z-ai/glm-5.3-flash は現在、割引価格の $0.075 / $0.25(キャッシュ $0.015)を表示しています。Novita は自社 serverless 上の zai-org/glm-5.3-flash を $0.15 / $0.50 で提供。AIHubMix は期間限定 50% オフで掲載しました。QuickSilver Pro は公式の割引価格よりさらに約 2 割安い($0.06 / $0.20)と表明しています。差額は各社の補助方針と精算条件によるもので、乗り換える前に 1M コンテキストとキャッシュ課金が同条件かを確認してください。
価格のタイムライン
リリースと API 提供開始。初日から 50% オフが適用:$0.075 / $0.25、キャッシュ読み取り $0.015。
OpenRouter が無料の stealth/ox-alpha を廃止し、z-ai/glm-5.3-flash を割引価格で掲載。
24:00(UTC+8)に割引終了。定価 $0.15 / $0.50 に戻り、キャッシュ読み取りは $0.03 に。
確定事項 vs 自分で確認すべき点
確定事項
定価 $0.15/$0.50、割引価格 $0.075/$0.25、キャッシュ読み取り $0.03(割引時 $0.015)、期限 2026-09-09 24:00(UTC+8)、割引期間中のキャッシュ保存無料 —— いずれも Z.ai と bigmodel.cn の公式ドキュメントおよびリリース告知に基づきます。
自分で確認すべき点
サードパーティの価格は頻繁に変わり、コンテキスト上限やキャッシュポリシーが同一とは限りません。公式の割引価格を下回るプラットフォームについては、補助金なのかスペックを落としているのかを見極めてください。Coding Plan のクォータ換算(Flash は GLM-5.3 の約 3 倍)もプランによって変わるため、お住まいの地域の公式ページをご確認ください。
安さの前に、まずキャッシュを計算
表示価格は確かに低い
$0.075 / $0.25 は AA 指数 57 のティアではほぼ最安の部類です。単発の呼び出し、短いコンテキスト、バッチ処理では削減効果がそのまま出ます。
キャッシュ読み取りは別の話
キャッシュ読み取りは $0.03(割引期間 $0.015)。ある開発者の実測では DeepSeek V4 Flash のオフピーク価格の約 4 倍でした。エージェントのループでは同じ長いコンテキストが何度も読み直されるため、キャッシュ料金が表示価格の削減分を上回ることがあります。自分のヒット率と平均コンテキスト長で先に計算してください。
自分のコストを計算する
1 回のリクエストを 3 つに分けます。新規入力トークン、キャッシュヒットした入力トークン、出力トークンです。割引期間の計算式は(新規 × $0.075 + キャッシュ × $0.015 + 出力 × $0.25)÷ 100 万。エージェントのワークフローではキャッシュヒット率は通常 60〜90% で、率が高いほどキャッシュの行の比重が大きくなります。表示価格だけを見てはいけない理由がここにあります。9 月 9 日以降は 3 つの数字をそれぞれ 2 倍すれば長期コストになります。
QCode では
QCode でルーティングできる Z.ai のモデルは GLM-5.3、GLM-5.2、GLM-5.1 で、いずれも公式価格 × サービス料率での課金、上流の価格変動に自動追随します。GLM-5.3-Flash は未接続で、本ページは価格資料の整理です。中国製モデルの実コストを今すぐ比較したい場合は GLM-5.3 か DeepSeek V4 系列からどうぞ。後者にはオフピーク半額の時間帯別価格もあります。
よくある質問
割引は正確にいつ終わりますか?
2026 年 9 月 9 日 24:00、タイムゾーンは UTC+8 です。以降は入力 $0.15、出力 $0.50、キャッシュ読み取り $0.03 に戻ります(いずれも 100 万トークンあたり)。
無料枠はありますか?
恒久的な無料の公開エンドポイントはありません。無料だったのは匿名プレビューの stealth/ox-alpha で、公表当日に OpenRouter の本番カタログから削除されました。Z.ai プラットフォームの新規アカウントには試用クレジットがありますが、これは無料枠とは別物です。
キャッシュはどう課金されますか?
キャッシュ読み取りは 100 万トークンあたり $0.03(割引期間 $0.015)、キャッシュの保存料は割引期間中は無料です。キャッシュ読み取りの単価は入力の 5 分の 1 ですが、ヒット率の高い長コンテキストの用途では課金トークンの大半をこれが占めます。
DeepSeek V4 Flash より安いですか?
トラフィックの形によります。素の入出力では GLM の割引価格の方が安いです。キャッシュ読み取りでは、ある開発者の実測で GLM は DeepSeek V4 Flash のオフピーク価格の約 4 倍でした。さらに DeepSeek はオフピークに半額になります。長コンテキストでヒット率の高いエージェント用途では、両者を別々に計算する必要があります。
Coding Plan と従量課金はどちらが得ですか?
Z.ai の Coding Plan では Flash のクォータが GLM-5.3 の約 3 倍で、毎日安定して大量に使う方に向いています。使用量の波が大きい場合や、Claude・GPT・Gemini も併用する場合は、1 つのゲートウェイでの従量課金の方が柔軟で、プラットフォームごとにチャージする手間もありません。
公式より安いサードパーティは信用できますか?
使えますが、3 点を確認してください。コンテキスト上限が本当に 1M か、キャッシュ課金が同条件か、レート制限はどうか。公式の割引価格を下回る提示(例えば $0.06 / $0.20)は多くの場合一時的な補助であり、長続きするとは限りません。
情報源
Z.ai および bigmodel.cn の公式価格ドキュメント、Z.ai のリリース告知(2026-08-26)、OpenRouter と Novita のモデルページ価格、AIHubMix と QuickSilver Pro の掲載告知、X 上の開発者によるキャッシュコスト実測(2026-08-26〜27 取得)。
関連記事
GLM-5.3-Flash 完全ガイド
アーキテクチャ、コンテキスト、本当のスコアと接続方法。
GLM-5.3 完全ガイド
同世代フラッグシップの性能と価格。
AI モデルレーダー 2026
各ファミリーの価格と提供状況の追跡。
価格は 2026-08-27 時点のスナップショットで、ベンダーの調整により変わります。QCode は Z.ai と資本・提携関係にありません。GLM-5.3-Flash は QCode 未接続です。