Новая модель · релиз 2026-08-26

GLM-5.3-Flash
320B-A18B, контекст 1M, веса под MIT

Z.ai выпустила её 26 августа — это та самая модель, которая работала на OpenRouter анонимно под кодовым именем Ox Alpha. Стоит в десять раз дешевле GLM-5.3, но это не «Flash, который запустится на ноутбуке»: 320 млрд параметров, локальный запуск начинается со 181 ГБ.

#glm-5.3-flash#320B-A18B#контекст 1M#лицензия MIT

Четыре ключевые цифры

320B-A18B

Параметры

MoE: 320 млрд всего, 18 млрд активных, гибридное разреженное и линейное внимание. Flash в названии — про стоимость инференса, а не про размер модели.

1M

Окно контекста

Официальная документация и доки Z.ai указывают 1 048 576 и максимум 131 072 на ответ. ⚠️ Artificial Analysis пишет 400K — источники расходятся.

$0.075 / $0.25

Стартовая цена (−50%)

Прайс — $0.15 / $0.50 за миллион токенов; скидка действует до 2026-09-09 24:00 (UTC+8). Чтение из кэша $0.03 ($0.015 во время акции).

57

Индекс AA

Тот же уровень, что у Claude Opus 4.8. ⚠️ Не уровень Fable 5 — разошедшаяся цифра 80% получена на выборке из 10 задач.

Что такое GLM-5.3-Flash

Первая нативно мультимодальная модель в линейке GLM-5 от Z.ai, выпущенная 26 августа 2026 года сразу с открытыми весами под лицензией MIT (уже на Hugging Face). Архитектура — MoE на 320 млрд параметров с 18 млрд активных, гибридное разреженное и линейное внимание. Принимает текст, изображения и видео, отдаёт текст, умеет вызывать инструменты и работать с визуальным кодом. До релиза она неделю работала на OpenRouter под кодовым именем Ox Alpha; по словам Z.ai, всю эту неделю она крутилась исключительно на отечественных AI-ускорителях, обслуживала порядка 100 триллионов токенов в сутки, а собственный движок на базе SGLang дал примерно трёхкратный прирост end-to-end.

Что произошло за первые сутки

В день раскрытия OpenRouter убрал анонимный слаг stealth/ox-alpha из продакшн-каталога и заменил его на z-ai/glm-5.3-flash — бесплатный предпросмотр на этом закончился. Novita и AIHubMix подключили модель в тот же день; SiliconFlow, Fireworks и Together на 27 августа ещё нет. Обсуждение крутится вокруг трёх вопросов: какая на самом деле цифра в бенчмарке, как подключаться теперь, когда бесплатного эндпоинта нет, и можно ли запустить локально. Третий вопрос — самый громкий тред на r/LocalLLaMA: название Flash многих сбило с толку, они ждали маленькую модель.

Хронология

2026-08-14

Выходит GLM-5.3 (та же база, только пост-тренинг). API открывается 19 августа по цене GLM-5.2.

2026-08-19

На OpenRouter и в OpenCode появляется анонимная модель под кодовым именем Ox Alpha — бесплатный предпросмотр.

2026-08-26

Z.ai раскрывает: Ox Alpha — это GLM-5.3-Flash. В тот же день открыты веса и запущен API, анонимный слаг снят.

Подтверждено vs часто трактуют неверно

Подтверждено

Дата релиза, архитектура 320B-A18B, лицензия MIT и веса на Hugging Face, прайс $0.15/$0.50 и дедлайн акции 2026-09-09, индекс AA равный 57, личность Ox Alpha — всё это проверяется по официальным анонсам или документации вендора.

Часто трактуют неверно

Цифра «DeepSWE 80%» взята из прогона на 10 задачах в период анонимности. Официальный DeepSWE v1.1 — 63.4%, а один прогон сообществом на 113 задачах дал около 58.4%. «Сопоставима с Fable 5» тоже не проходит: индекс AA 57 — это уровень Opus 4.8. И «раз называется Flash, значит запустится локально» — неверно: в модели 320 млрд параметров.

Обратная сторона цены в 40 раз ниже

Вход и выход действительно дёшевы

По акционной цене $0.075/$0.25 это примерно одна двадцатая от GLM-5.3 и одна сороковая от Claude Opus 4.8. На коротких запросах и пакетной обработке выигрыш в стоимости реальный.

А вот чтение из кэша — нет

Чтение из кэша стоит $0.03 ($0.015 во время акции) — один разработчик замерил, что это примерно вчетверо дороже внепиковой цены DeepSeek V4 Flash. В агентных циклах, где длинный контекст переиспользуется снова и снова, плата за кэш может съесть всю выгоду от прайса. Посчитайте на своём проценте попаданий в кэш, прежде чем решать.

Как подключить

Официальный код модели — glm-5.3-flash, работает через OpenAI-совместимый эндпоинт Z.ai или bigmodel.cn. У агрегаторов идентификаторы свои: на OpenRouter это z-ai/glm-5.3-flash, на Novita — zai-org/glm-5.3-flash. Для локального запуска сначала посчитайте память: веса в FP8 — около 306 ГиБ, в BF16 — около 585 ГБ, самая компактная на сегодня квантизация NVFP4 — примерно 181 ГБ, а GGUF от Unsloth всё ещё помечен как в работе. Если вы дёргаете модель из клиента вроде Claude Code, учтите: суффиксы вида [1m] — это клиентские маркеры, их должен обрабатывать ваш шлюз, а не передавать наверх как есть.

На QCode

Из моделей Z.ai на QCode сейчас маршрутизируются GLM-5.3, GLM-5.2 и GLM-5.1 — по официальной цене, умноженной на сервисный коэффициент, переключение одним ключом на одном эндпоинте. GLM-5.3-Flash вышла 26 августа и пока не подключена: эта страница — справочный материал, она не утверждает, что модель доступна на QCode. Если китайская модель нужна прямо сейчас, начните с GLM-5.3 или семейства DeepSeek V4.

Частые вопросы

GLM-5.3-Flash бесплатная?

Нет. Бесплатным был эндпоинт stealth/ox-alpha в период анонимного предпросмотра, и в день раскрытия этот слаг убрали из продакшн-каталога OpenRouter без алиаса. Эндпоинта :free для неё на OpenRouter тоже нет — бесплатный тариф есть у прошлого поколения, GLM-5.2. Новым аккаунтам на платформе Z.ai начисляют пробные кредиты, но это не то же самое, что бесплатно навсегда.

Контекст всё-таки 1M или 400K?

Официальная документация и доки Z.ai указывают 1 048 576 при максимуме 131 072 на ответ. Artificial Analysis пишет 400K и помечает модель как проприетарную, что противоречит релизу под MIT. Источники расходятся; скорее всего, AA зафиксировала лимит конкретного сервинга. Ориентируйтесь на официальную документацию, но если вы завязаны на сверхдлинный контекст — замерьте на том провайдере, которым будете пользоваться.

DeepSWE — это 63.4% или 80%?

Официальный DeepSWE v1.1 — 63.4%. Цифра 80% получена в одном прогоне на 10 задачах в период анонимности и не воспроизвелась на большей выборке; прогон сообщества на 113 задачах дал около 58.4%. Для сравнения моделей берите 63.4%.

Получится запустить локально?

Только при серьёзном объёме памяти. Веса в FP8 — около 306 ГиБ, в BF16 — около 585 ГБ, самая компактная квантизация NVFP4 от сообщества — примерно 181 ГБ. На одной потребительской видеокарте не выйдет; чаще всего обсуждают рабочую станцию с 256 ГБ унифицированной памяти, а GGUF-квантизация Unsloth до сих пор помечена как в работе. Большинству дешевле пойти через API.

Что выбрать: GLM-5.3 или GLM-5.3-Flash?

GLM-5.3 — флагманский пост-тренинг того же поколения, он сильнее в сложном программировании. Flash — бюджетный уровень того же поколения примерно за десятую часть цены, плюс нативная мультимодальность. Пакетные задачи, чувствительные к стоимости нагрузки и всё, где нужны картинки, — на Flash; длинные цепочки кодинга — на GLM-5.3. В Coding Plan от Z.ai квота Flash примерно втрое больше, чем у GLM-5.3.

Когда закончится скидка?

2026-09-09 в 24:00 (UTC+8). После этого возврат к прайсу: $0.15 за миллион входных токенов и $0.50 за миллион выходных, чтение из кэша — с $0.015 обратно на $0.03.

Источники

Официальная документация Z.ai и bigmodel.cn, релизный блог Z.ai и анонсы в официальных соцсетях (2026-08-26), страницы модели на OpenRouter и Novita, карточка модели на Hugging Face, страница Artificial Analysis, треды сообществ r/LocalLLaMA и V2EX (собрано 2026-08-26—27).

Китайские модели — одним ключом

GLM-5.3, DeepSeek V4, Kimi K3 и Qwen переключаются на одном эндпоинте QCode по официальной цене с сервисным коэффициентом — не нужно пополнять баланс на каждой платформе отдельно.