已上架(GA)· QCode 也能调同一个模型

Kimi K3 上 Amazon Bedrock:价格、缓存与三条调用路径

AWS 在 2026-09-18 把 Moonshot 的 Kimi K3 正式放上 Bedrock:1M 上下文、原生视觉,Global 端点每百万 token 输入 $3、输出 $15,缓存读 $0.30、写 $3.75,模型 id `moonshotai.kimi-k3`。这页把 AWS 的口径与另外两条拿法摆在一起:官方 API、Bedrock、以及 QCode 这类聚合入口 —— 同一权重,差别在限速、缓存计费与运维条款。

更新于 2026-09-20

#1M 上下文#显式缓存#原生视觉#GA 2026-09-18

AWS 文档里的四个硬数字

$3/$15

每百万 token 输入/输出

Bedrock 模型卡 Pricing 表:Global CRIS 输入 $3.00、输出 $15.00;US CRIS 各高 10%($3.30/$16.50)。这是 AWS 的表,不是 Moonshot 官方价,也不是 QCode 的价。

$0.30

缓存读(每百万 token)

同一张表:cache read $0.30、cache write(30min) $3.75。模型卡另写显式缓存每个检查点最少 1,024 token、保留至少 30 分钟,且目前只有 Responses 与 Chat Completions 两个 API 支持显式缓存。

1M

上下文窗口

模型卡 Context window: 1M tokens,主打「大仓库、长文档、跨图」的长任务;输入模态列出音频、图像、语音、文本、视频,输出也含图像与语音 —— 不是纯文本输出。

1024

缓存检查点最小 token 数

AWS 文档的门槛值:短于这个长度的前缀不会形成缓存检查点。文档同时说默认走隐式(自动)缓存,显式缓存能提升命中率从而降低延迟与成本。

Kimi K3 是什么,Bedrock 上架改变了什么

K3 是 Moonshot 目前的开源权重旗舰:AWS 模型卡写的是「most capable open-weight model」,原生视觉 + 1M 上下文,2026-09-18 在 Bedrock 上 GA,AWS 侧的模型 id 是 `moonshotai.kimi-k3`。变化不在模型权重,而在接入面:AWS 的推理端点与限速、IAM 与审计日志、Region 与 CRIS 层、45 天 EOL 通知的生命周期条款,以及一张 AWS 自己的价格表 —— 显式 prompt caching 是 AWS 侧的重点,其文档称这是 Bedrock 上第一个支持显式缓存的开源权重模型。至于参数规模(社区常说 2.8T)与训练细节属于 Moonshot 的口径,本页不替 AWS 表背书。

上架节奏

2026-09-18:AWS 官方 What's New 发布《Kimi K3 by Moonshot AI is now generally available on Amazon Bedrock》,模型卡同页给出价格、模态与端点建议(新应用推荐 `bedrock-runtime`,K3 建议用 Chat Completions API)。本页核对日 2026-09-20:价格表与缓存参数按当天模型卡版本转述;AWS 若调价,本页数字要重核。

三条时间线

2026-09-18

2026-09-18:AWS 宣布 Kimi K3 在 Bedrock GA;模型卡列出 1M 上下文、多模态输入、Global 与 US 两档价格与显式缓存参数。

2026-09-20

2026-09-20:本页核对 QCode 目录:`kimi-k3` 在列,且近 30 天有计价调用 ⇒ 聚合入口这条路与 AWS 这条路可以并存比较。

2026-09-10

2026-09-10 参照:Cognition 的 SWE-2 公开说自己是「post-trained from Kimi K3(2.8T)」并在多项编码榜上给出 K3 本体的分数 —— K3 近两周是被反复当底座的那个模型。

官方写明 vs 还不能说

AWS 文档写明的

截至 2026-09-20 抓的模型卡:GA 日期、模型 id、上下文 1M、输入/输出/缓存读/缓存写四项价格(含 US 档 10% 上浮)、显式缓存的最小检查点 1,024 token 与 ≥30 分钟保留、仅 Responses 与 Chat Completions 支持显式缓存、推荐端点、以及「至少 45 天 EOL 通知」的生命周期条款 —— 全部来自那张模型卡。

别当成事实写的

截至 2026-09-20,「Bedrock 上第一个支持显式缓存的开源权重模型」是 AWS 的表述,范围只在 Bedrock 内,不等于全行业第一;参数规模(2.8T)、各榜名次与「最强开源权重」这类排序属于 Moonshot 或第三方的口径;AWS 的价格随 Region、CRIS 层与促销变动,且企业协议、并发上限、合规区划本本页未核,一律不推断。

Bedrock 与聚合入口:同一模型差在哪

Amazon Bedrock(AWS 口径)

`moonshotai.kimi-k3`,Global $3/$15、US $3.30/$16.50,缓存读 $0.30 / 写 $3.75;带 IAM、审计、Region 选择与 45 天 EOL 通知,显式缓存要自己管检查点。账单落在 AWS 侧。

聚合入口(QCode)

同一模型族 id `kimi-k3` 在 QCode 目录中(2026-09-20 核对,近 30 天有计价调用),OpenAI 兼容接口直接换 model id,不按 Region 拆价、不单独配缓存检查点,缓存是否命中与计费以本站定价页为准;具体价格与限速看 /pricing 与实时目录。

选哪条路:三个判断点

第一看账务与合规归口:已经在 AWS 上跑 RAG/Agent、要求数据驻留与统一账单的,Bedrock 顺手;想在一个入口里横向换模型的,聚合侧省事。第二看缓存用法:Bedrock 的显式缓存要你把长前缀组织成≥1,024 token 的检查点并保持 30 分钟内的复用节奏,收益直接体现在 $0.30 这一档;把缓存当透明的写法在两边都会算成未命中。第三看模态与端点:K3 在 AWS 侧推荐 Chat Completions,多模态输入虽列出,但视频/音频在长任务里的实际表现官方没有给样例,先用小样本验证再接生产。

QCode 上的实际情况

`kimi-k3` 在 QCode 的模型目录中(2026-09-20 核对),且近 30 天有真实计价调用,接口与 GPT 系列一致:改 model id 即可。本页不写 QCode 的 K3 单价 —— 价格、缓存计费口径与限速以 /pricing 和实时目录为准。要在 AWS 与聚合入口之间比较成本,请用同一份 prompt 模板实测缓存命中率,再对着两边账单算,不要照抄任何一方的宣传页。

常见问题

Bedrock 上的 K3 和 Moonshot 官方 API 是同一个模型吗?

同一权重族,但接入层不同:AWS 模型卡给的是 `moonshotai.kimi-k3` 这一条目,价格、缓存语义、限速与合规条款都按 AWS 的文档走,与 Moonshot 自营端点不是一回事。

1M 上下文要不要额外付费?

AWS 模型卡把 1M 写成该条目的 context window,没有单独的长上下文附加价;但输入 token 全额计价,除非命中缓存(读 $0.30、写 $3.75),所以长前缀的复用方式决定实际成本。

显式缓存要做什么才有效?

文档要求每个检查点至少 1,024 token、保留至少 30 分钟,且只有 Responses 与 Chat Completions 两个 API 支持。把稳定前缀放前面、易变内容放后面才有收益。

K3 擅长什么、短板是什么?

官方与第三方口径都把它放在长上下文编码与视觉输入上;短板要靠你自己的任务测。参照 Cognition 2026-09-10 的公开表:K3 本体在 FrontierCode 1.1 Main 是 44.2%、Terminal-Bench 4 只有 21.5%,同一张表里 Fable 5.1 是 50.9% 与 55.8% —— 厂商表,别当独立排名。

K3 会像某些新模型那样被下线吗?

AWS 为该条目写的是「至少 45 天 EOL 通知」,且当前没有确定 EOL 日期。这是生命周期条款,不是保证永久可用。

能同时用两条路吗?

可以,很多团队的做法是:AWS 侧满足数据驻留与统一账单,聚合侧做横向对比与兜底。前提是把限速、缓存语义和日志口径分别配好,别让同一套代码假设两边行为一致。

来源

AWS What's New《Kimi K3 by Moonshot AI is now generally available on Amazon Bedrock》2026-09-18,https://aws.amazon.com/about-aws/whats-new/2026/09/moonshot-ai-kimi-k3-on-amazon-bedrock/;Amazon Bedrock 模型卡《Moonshot AI — Kimi K3》,https://docs.aws.amazon.com/bedrock/latest/userguide/model-card-moonshot-ai-kimi-k3.html(两页均 2026-09-20 抓取);对照用的编码榜数字来自 Cognition《Introducing SWE-2》2026-09-10,https://cognition.com/blog/swe-2(厂商表)。QCode 目录与 30 天计价调用为本站内部核对。

先在同一份模板上比,再决定接哪条

kimi-k3 在 QCode 可调(2026-09-20 核对,近 30 天有计价调用),价格与限速以 /pricing 与实时目录为准。

接着看

与 Amazon、Moonshot AI 无隶属关系。本页 AWS 侧价格、缓存参数与生命周期条款全部转述 2026-09-20 抓取的公开文档,编码榜数字为厂商自报;QCode 不提供 AWS Bedrock 服务,也不代其报价。