GLM-5.3-Flash
320B-A18B, контекст 1M, веса под MIT
Z.ai выпустила её 26 августа — это та самая модель, которая работала на OpenRouter анонимно под кодовым именем Ox Alpha. Стоит в десять раз дешевле GLM-5.3, но это не «Flash, который запустится на ноутбуке»: 320 млрд параметров, локальный запуск начинается со 181 ГБ.
Четыре ключевые цифры
Параметры
MoE: 320 млрд всего, 18 млрд активных, гибридное разреженное и линейное внимание. Flash в названии — про стоимость инференса, а не про размер модели.
Окно контекста
Официальная документация и доки Z.ai указывают 1 048 576 и максимум 131 072 на ответ. ⚠️ Artificial Analysis пишет 400K — источники расходятся.
Стартовая цена (−50%)
Прайс — $0.15 / $0.50 за миллион токенов; скидка действует до 2026-09-09 24:00 (UTC+8). Чтение из кэша $0.03 ($0.015 во время акции).
Индекс AA
Тот же уровень, что у Claude Opus 4.8. ⚠️ Не уровень Fable 5 — разошедшаяся цифра 80% получена на выборке из 10 задач.
Что такое GLM-5.3-Flash
Первая нативно мультимодальная модель в линейке GLM-5 от Z.ai, выпущенная 26 августа 2026 года сразу с открытыми весами под лицензией MIT (уже на Hugging Face). Архитектура — MoE на 320 млрд параметров с 18 млрд активных, гибридное разреженное и линейное внимание. Принимает текст, изображения и видео, отдаёт текст, умеет вызывать инструменты и работать с визуальным кодом. До релиза она неделю работала на OpenRouter под кодовым именем Ox Alpha; по словам Z.ai, всю эту неделю она крутилась исключительно на отечественных AI-ускорителях, обслуживала порядка 100 триллионов токенов в сутки, а собственный движок на базе SGLang дал примерно трёхкратный прирост end-to-end.
Что произошло за первые сутки
В день раскрытия OpenRouter убрал анонимный слаг stealth/ox-alpha из продакшн-каталога и заменил его на z-ai/glm-5.3-flash — бесплатный предпросмотр на этом закончился. Novita и AIHubMix подключили модель в тот же день; SiliconFlow, Fireworks и Together на 27 августа ещё нет. Обсуждение крутится вокруг трёх вопросов: какая на самом деле цифра в бенчмарке, как подключаться теперь, когда бесплатного эндпоинта нет, и можно ли запустить локально. Третий вопрос — самый громкий тред на r/LocalLLaMA: название Flash многих сбило с толку, они ждали маленькую модель.
Хронология
Выходит GLM-5.3 (та же база, только пост-тренинг). API открывается 19 августа по цене GLM-5.2.
На OpenRouter и в OpenCode появляется анонимная модель под кодовым именем Ox Alpha — бесплатный предпросмотр.
Z.ai раскрывает: Ox Alpha — это GLM-5.3-Flash. В тот же день открыты веса и запущен API, анонимный слаг снят.
Подтверждено vs часто трактуют неверно
Подтверждено
Дата релиза, архитектура 320B-A18B, лицензия MIT и веса на Hugging Face, прайс $0.15/$0.50 и дедлайн акции 2026-09-09, индекс AA равный 57, личность Ox Alpha — всё это проверяется по официальным анонсам или документации вендора.
Часто трактуют неверно
Цифра «DeepSWE 80%» взята из прогона на 10 задачах в период анонимности. Официальный DeepSWE v1.1 — 63.4%, а один прогон сообществом на 113 задачах дал около 58.4%. «Сопоставима с Fable 5» тоже не проходит: индекс AA 57 — это уровень Opus 4.8. И «раз называется Flash, значит запустится локально» — неверно: в модели 320 млрд параметров.
Обратная сторона цены в 40 раз ниже
Вход и выход действительно дёшевы
По акционной цене $0.075/$0.25 это примерно одна двадцатая от GLM-5.3 и одна сороковая от Claude Opus 4.8. На коротких запросах и пакетной обработке выигрыш в стоимости реальный.
А вот чтение из кэша — нет
Чтение из кэша стоит $0.03 ($0.015 во время акции) — один разработчик замерил, что это примерно вчетверо дороже внепиковой цены DeepSeek V4 Flash. В агентных циклах, где длинный контекст переиспользуется снова и снова, плата за кэш может съесть всю выгоду от прайса. Посчитайте на своём проценте попаданий в кэш, прежде чем решать.
Как подключить
Официальный код модели — glm-5.3-flash, работает через OpenAI-совместимый эндпоинт Z.ai или bigmodel.cn. У агрегаторов идентификаторы свои: на OpenRouter это z-ai/glm-5.3-flash, на Novita — zai-org/glm-5.3-flash. Для локального запуска сначала посчитайте память: веса в FP8 — около 306 ГиБ, в BF16 — около 585 ГБ, самая компактная на сегодня квантизация NVFP4 — примерно 181 ГБ, а GGUF от Unsloth всё ещё помечен как в работе. Если вы дёргаете модель из клиента вроде Claude Code, учтите: суффиксы вида [1m] — это клиентские маркеры, их должен обрабатывать ваш шлюз, а не передавать наверх как есть.
На QCode
Из моделей Z.ai на QCode сейчас маршрутизируются GLM-5.3, GLM-5.2 и GLM-5.1 — по официальной цене, умноженной на сервисный коэффициент, переключение одним ключом на одном эндпоинте. GLM-5.3-Flash вышла 26 августа и пока не подключена: эта страница — справочный материал, она не утверждает, что модель доступна на QCode. Если китайская модель нужна прямо сейчас, начните с GLM-5.3 или семейства DeepSeek V4.
Частые вопросы
GLM-5.3-Flash бесплатная?
Нет. Бесплатным был эндпоинт stealth/ox-alpha в период анонимного предпросмотра, и в день раскрытия этот слаг убрали из продакшн-каталога OpenRouter без алиаса. Эндпоинта :free для неё на OpenRouter тоже нет — бесплатный тариф есть у прошлого поколения, GLM-5.2. Новым аккаунтам на платформе Z.ai начисляют пробные кредиты, но это не то же самое, что бесплатно навсегда.
Контекст всё-таки 1M или 400K?
Официальная документация и доки Z.ai указывают 1 048 576 при максимуме 131 072 на ответ. Artificial Analysis пишет 400K и помечает модель как проприетарную, что противоречит релизу под MIT. Источники расходятся; скорее всего, AA зафиксировала лимит конкретного сервинга. Ориентируйтесь на официальную документацию, но если вы завязаны на сверхдлинный контекст — замерьте на том провайдере, которым будете пользоваться.
DeepSWE — это 63.4% или 80%?
Официальный DeepSWE v1.1 — 63.4%. Цифра 80% получена в одном прогоне на 10 задачах в период анонимности и не воспроизвелась на большей выборке; прогон сообщества на 113 задачах дал около 58.4%. Для сравнения моделей берите 63.4%.
Получится запустить локально?
Только при серьёзном объёме памяти. Веса в FP8 — около 306 ГиБ, в BF16 — около 585 ГБ, самая компактная квантизация NVFP4 от сообщества — примерно 181 ГБ. На одной потребительской видеокарте не выйдет; чаще всего обсуждают рабочую станцию с 256 ГБ унифицированной памяти, а GGUF-квантизация Unsloth до сих пор помечена как в работе. Большинству дешевле пойти через API.
Что выбрать: GLM-5.3 или GLM-5.3-Flash?
GLM-5.3 — флагманский пост-тренинг того же поколения, он сильнее в сложном программировании. Flash — бюджетный уровень того же поколения примерно за десятую часть цены, плюс нативная мультимодальность. Пакетные задачи, чувствительные к стоимости нагрузки и всё, где нужны картинки, — на Flash; длинные цепочки кодинга — на GLM-5.3. В Coding Plan от Z.ai квота Flash примерно втрое больше, чем у GLM-5.3.
Когда закончится скидка?
2026-09-09 в 24:00 (UTC+8). После этого возврат к прайсу: $0.15 за миллион входных токенов и $0.50 за миллион выходных, чтение из кэша — с $0.015 обратно на $0.03.
Источники
Официальная документация Z.ai и bigmodel.cn, релизный блог Z.ai и анонсы в официальных соцсетях (2026-08-26), страницы модели на OpenRouter и Novita, карточка модели на Hugging Face, страница Artificial Analysis, треды сообществ r/LocalLLaMA и V2EX (собрано 2026-08-26—27).
Китайские модели — одним ключом
GLM-5.3, DeepSeek V4, Kimi K3 и Qwen переключаются на одном эндпоинте QCode по официальной цене с сервисным коэффициентом — не нужно пополнять баланс на каждой платформе отдельно.
Читайте также
Полный гайд по GLM-5.3
Возможности, цены и подключение флагмана того же поколения.
GLM-5.3 против GLM-5.2
Что реально дал пост-тренинг.
Радар AI-моделей 2026
Отслеживание цен и доступности по всем семействам.
Данные — срез на 2026-08-27, меняются по мере обновлений у вендора. QCode не аффилирован с Z.ai. GLM-5.3-Flash на QCode не подключена.