Kimi K3 на Amazon Bedrock: цены AWS, кэш промптов и три способа вызывать
AWS открыла Kimi K3 от Moonshot на Bedrock 2026-09-18: контекст 1M, нативное зрение, $3 вход / $15 выход за миллион токенов на глобальном эндпоинте, кэш-чтение $0.30 и кэш-запись $3.75, id модели `moonshotai.kimi-k3`. Ставим формулировки AWS рядом с двумя другими путями — собственным API Moonshot и агрегатором: веса те же, различаются лимиты, учёт кэша и эксплуатационные условия.
Обновлено 2026-09-20
Четыре жёстких числа из документации AWS
вход/выход за миллион токенов
Таблица цен в карточке модели Bedrock: Global CRIS — $3.00 вход / $15.00 выход; US CRIS на 10% дороже ($3.30/$16.50). Это прайс AWS, а не лист Moonshot и не тариф QCode.
чтение из кэша (за миллион)
Там же: кэш-чтение $0.30, кэш-запись (30 мин) $3.75. Карточка добавляет: чекпоинт не короче 1 024 токенов, хранится минимум 30 минут, явный кэш пока только у Responses и Chat Completions.
размер контекста
В карточке сказано Context window: 1M tokens — под долгие задачи на больших репозиториях, документах и изображениях; на вход карточка перечисляет аудио, изображение, речь, текст и видео, на выход — эмбеддинг, изображение, речь, текст и видео, то есть не только текст.
минимум токенов на чекпоинт кэша
Короткий префикс в кэш не попадёт. По умолчанию работает неявное (автоматическое) кэширование; AWS пишет, что явное поднимает долю попаданий, а значит снижает задержку и стоимость.
Что такое K3 и что меняет выход на Bedrock
Карточка AWS называет K3 «самой способной open-weight моделью Moonshot»: нативное зрение плюс контекст 1M, GA на Bedrock с 2026-09-18 под id `moonshotai.kimi-k3`. Меняются не веса, а слой доступа: эндпоинты и лимиты AWS, IAM и журналы аудита, регионы и уровень CRIS, уведомление об EOL за 45 дней и собственный прайс AWS. Ключевая заявленная фишка — явное кэширование промптов: AWS называет это первой open-weight моделью с явным кэшем на Bedrock. Число параметров (2.8T и т. п.) и детали обучения — объяснение Moonshot, на счёт AWS мы их не пишем.
Хронология выхода
2026-09-18: заметка What's New «Kimi K3 by Moonshot AI is now generally available on Amazon Bedrock» вышла вместе с карточкой модели, где заданы цены, модальности и рекомендация по эндпоинту (новые приложения — `bedrock-runtime`, для K3 — Chat Completions). Дата проверки этой страницы — 2026-09-20: цены и параметры кэша перенесены из версии карточки того дня; при изменении прайса AWS цифры нужно сверять заново.
Три даты
2026-09-18: AWS объявляет GA Kimi K3 на Bedrock; карточка выводит 1M контекста, мультимодальный вход, цены Global/US и условия явного кэша.
2026-09-20: проверка по каталогу QCode: `kimi-k3` в списке, за 30 дней есть оплаченные вызовы — то есть путь через агрегатор сравним с путём AWS, а не гипотетичен.
2026-09-10, ориентир: пост Cognition о SWE-2 прямо говорит «post-trained from Kimi K3 (2.8T)» и публикует собственные результаты K3 в кодовых таблицах — K3 эти две недели выступает базовой моделью.
Задокументировано против «так сказать нельзя»
Что в документах AWS
По карточке модели от 2026-09-20: дата GA, id модели, контекст 1M, четыре строки цен (вход, выход, чтение кэша, запись кэша) с надбавкой 10% для US, минимум 1 024 токена на чекпоинт и хранение от 30 минут, ограничение на Responses/Chat Completions, рекомендованный эндпоинт и «уведомление об EOL минимум за 45 дней» — всё из той самой карточки.
Что фактом не пишем
По состоянию на 2026-09-20: «Первая open-weight модель с явным кэшем» — про границы Bedrock, а не про индустрию. Параметры (2.8T), места в рейтингах и «сильнейшие открытые веса» — заявления Moonshot или третьих сторон. Цены AWS меняются от региона, уровня CRIS и акций; корпоративные условия, потолок параллелизма и комплаенс-зоны здесь не проверялись и не достраиваются догадками.
Bedrock против агрегатора: одна модель, разные условия
Amazon Bedrock (по терминам AWS)
`moonshotai.kimi-k3`; Global $3/$15, US $3.30/$16.50, кэш-чтение $0.30 / запись $3.75. Плюс IAM, аудит, выбор региона и 45 дней уведомления об EOL; но чекпоинты явного кэша — ваша задача, и счёт приходит от AWS.
Агрегатор (QCode)
Та же модель под id `kimi-k3` в каталоге QCode (проверено 2026-09-20, за 30 дней есть оплаченные вызовы): OpenAI-совместимый вызов с заменой model id, без разбивки цены по регионам и без ручных чекпоинтов кэша; поведение кэша и учёт — по нашей странице цен. Актуальные цены и лимиты — в /pricing и в живом каталоге.
Как выбрать путь: три проверки
Первое — где счёт и границы соответствия: если RAG и агенты уже живут в AWS и нужна локализация данных или один счёт, Bedrock естественен; если хочется переключать модели из одной точки, агрегатор дешевле в эксплуатации. Второе — как вы используете кэш: на Bedrock длинные префиксы надо собирать в чекпоинты от 1 024 токенов и переиспользовать в окне 30 минут, иначе ставка $0.30 не включается; если относиться к кэшу как к магии, обе дороги считают вход по полной. Третье — модальности и эндпоинт: AWS для K3 рекомендует Chat Completions; видео и аудио заявлены, но длинных примеров в документации нет, так что сначала маленький прогон.
Положение на QCode
`kimi-k3` есть в каталоге моделей QCode (проверено 2026-09-20), за 30 дней есть оплаченные вызовы, способ вызова как у моделей GPT — меняется только model id. Конкретную цену K3 у нас страница не приводит: цена, учёт кэша и лимиты задаются страницей /pricing и живым каталогом. Чтобы сравнить AWS с агрегатором, прогоните один и тот же шаблон промптов, замерьте долю попаданий в кэш и только потом сопоставляйте два счёта.
Вопросы
K3 на Bedrock — это та же модель, что в API Moonshot?
Те же веса, другой слой доступа: AWS публикует запись `moonshotai.kimi-k3` со своими ценами, семантикой кэша, лимитами и условиями, поэтому поведение и биллинг не совпадают с собственным эндпоинтом Moonshot.
Нужно ли доплачивать за контекст 1M?
В карточке 1M указан как context window без отдельной надбавки за длину, но вход тарифицируется полностью, если не попал в кэш (чтение $0.30, запись $3.75). Реальную стоимость определяет то, как вы переиспользуете длинные префиксы.
Что нужно, чтобы явный кэш реально работал?
По документации: чекпоинт от 1 024 токенов, хранение минимум 30 минут и только APIs Responses и Chat Completions. Ставьте стабильный префикс в начало, изменяемое — в конец.
В чём K3 силён и где проседает?
И официальные, и сторонние таблицы ставят его на долгое контекстное программирование и визуальный вход; слабые места надо мерить на своей задаче. Для ориентира: в таблице Cognition от 2026-09-10 базовый K3 даёт 44.2% на FrontierCode 1.1 Main и 21.5% на Terminal-Bench 4 против 50.9% и 55.8% у Fable 5.1 — это таблица вендора, не независимый рейтинг.
Могут ли снять K3 с Bedrock?
Формулировка AWS по этой записи: дата EOL не назначена, уведомление — минимум за 45 дней. Это про срок уведомления, а не про вечное наличие.
Можно пользоваться обоими путями?
Да, типичное разделение: AWS — для локализации данных и единого счёта, агрегатор — для переключений и подстраховки. Настраивайте лимиты, семантику кэша и логирование отдельно: один и тот же код не должен ожидать одинакового поведения с двух сторон.
Источники
AWS What's New, «Kimi K3 by Moonshot AI is now generally available on Amazon Bedrock», 2026-09-18, https://aws.amazon.com/about-aws/whats-new/2026/09/moonshot-ai-kimi-k3-on-amazon-bedrock/; карточка модели в руководстве Bedrock «Moonshot AI — Kimi K3», https://docs.aws.amazon.com/bedrock/latest/userguide/model-card-moonshot-ai-kimi-k3.html (оба сняты 2026-09-20). Цифры таблиц для сравнения — из поста Cognition «Introducing SWE-2» от 2026-09-10, https://cognition.com/blog/swe-2 (таблица вендора). Наличие в каталоге QCode и платные вызовы за 30 дней — наши проверки.
Сравнивайте на одном шаблоне, потом выбирайте
kimi-k3 вызывается на QCode (проверено 2026-09-20, за 30 дней есть оплаченные вызовы); цены и лимиты — из /pricing и живого каталога.
Дальше
Kimi K3 против GPT-5.6 Sol
Сравнение двух продаваемых у нас моделей по коду и стоимости.
GLM-5.3 против Kimi K3
Два открытых флагмана: база, лимиты и разница в условиях.
Гид по ценам QCode
Как считает агрегатор: официальный прайс × сервисный коэффициент, кэш и учёт вызовов.
Мы не связаны с Amazon и Moonshot AI. Цены, параметры кэша и условия жизненного цикла AWS перенесены из открытой документации, снятой 2026-09-20; результаты бенчмарков — заявления вендоров. QCode не предоставляет Amazon Bedrock и не выставляет счёт от его имени.