Kimi K3 vs GPT-5.6 Sol
开源旗舰对闭源旗舰
Terminal-Bench 2.1(AA 口径)Sol 89.5、K3 88.3——史上最大开源权重模型和闭源旗舰只差 1.2 分。价格差了一个数量级。
要点
TB 2.1(AA 口径)
K3 88.3 对 Sol 89.5,差 1.2 分。vals.ai 统一 harness 口径为 80.90 / 85.77。
K3 参数规模
史上最大开源权重模型,Stable LatentMoE,896 专家每 token 激活 16 个。
K3 官方 API 价
每百万 token 输入/输出(缓存命中 $0.30)。Sol 官方 $5/$30。
上下文窗口
K3 原生 1M;Sol 400K。超长上下文 K3 占优。
两个模型各自的定位
Kimi K3(07-16 WAIC 发布,07-27 权重开源)是 Moonshot 的旗舰思考模型:2.8T MoE、1M 上下文、强制思考(low/high/max 三档,默认 max)。GPT-5.6 Sol 是 OpenAI 5.6 系列的旗舰档:闭源、400K、Codex 默认高端模型。一个是开源权重的天花板,一个是闭源 API 的标杆。
开源第一次贴身
K3 发布后在多个榜单与闭源旗舰贴身:Artificial Analysis 智能指数与 GLM-5.3 并列开源榜首(约 60 分,闭源旗舰 Sol 61);前端 Code Arena 以 1679 Elo 成为首个登顶的开源模型。权重开源 11 天内请求暴增,Moonshot 一度暂停 C 端订阅扩容。
时间线
Kimi K3 于 WAIC 发布,2.8T,史上最大开源权重模型。
K3 权重开源,请求暴增;同期 Sol 所属 5.6 系列降价(Luna -80%)。
K3 与 GLM-5.3 并列 AA 开源榜首;TB 2.1 上 K3 88.3 紧咬 Sol 89.5。
已确认 vs 注意
已确认
两者的参数、上下文、官方定价、榜单分数均有官方页或可复核榜单支撑;两者在 QCode 均有真实调用量。
注意
K3 强制思考(关不掉),简单任务的 token 消耗天然偏高;Sol 可以不开推理。比价格时按你的任务类型折算,别只看单价表。
按场景选
选 Kimi K3
要开源权重(可自托管)、超长上下文(1M)、或预算敏感的重思考任务。官方 API $3/$15。
选 GPT-5.6 Sol
要 Codex 生态、可变推理档位、Fast 模式(2.5x),或既有 OpenAI 工具链。$5/$30。
怎么自己验证
同一批真实任务两边各跑一遍:注意 K3 默认 max 思考(token 多但一次通过率高),Sol 可按任务调 effort。按「一次通过率 × 总 token 成本」折算,才是你的真实单价。
在 QCode 上
kimi-k3 与 gpt-5.6-sol 均在售(30 天内有真实调用)。同一把 key 切换,官方价乘服务费率;K3 因强制思考的 token 特性,建议先小批量实测再定主力。
常见问题
Kimi K3 和 GPT-5.6 Sol 哪个强?
TB 2.1(AA 口径)Sol 89.5 对 K3 88.3,差 1.2 分;K3 是开源模型第一次贴到这个距离。不同榜单口径数字不同,固定同一份榜再比。
K3 是开源的吗?
是,权重 2026-07-27 已开源(2.8T,史上最大)。自托管需要相当的显存,多数人走 API 更现实。
价格差多少?
官方 API:K3 $3/$15(命中 $0.30),Sol $5/$30。但 K3 强制思考会拉高 token 量,按任务类型折算后再比。
上下文各多大?
K3 1M token,Sol 400K。长仓库、长文档场景 K3 占优。
K3 的思考能关吗?
不能关,只有 low / high / max 三档,默认 max。简单问答用它偏贵,杂活建议路由到便宜模型。
QCode 上两个都能调吗?
都在售,同 key 切换。目录价以 /models 实时列示为准。
信息来源
Moonshot 官方发布(07-16)与权重开源(07-27)、Artificial Analysis 智能指数、vals.ai TB2.1 快照(08-22)、The Batch(08-21)、QCode /models(08-22)。
相关阅读
与 Moonshot / OpenAI 无隶属。榜单数字为 2026-08 快照。