2026-09-10 发布 · QCode 不提供

Cognition SWE-2:官方榜单、成本口径与它没写的那部分

Cognition 在 2026-09-10 发布 SWE-2,官方说法是「我们最强的编码模型」,从 Kimi K3(2.8T 参数)继续做 RL,主打能力与推理成本的帕累托前沿:FrontierCode 1.1 Main 50.0%、比 Fable 5.1 低不到 1 个点而便宜 64%。同一张表里 Terminal-Bench 4 只有 27.3%。这页把厂商写了什么、没写什么、以及 QCode 上能怎么做分开摆。

更新于 2026-09-20

#编码 agent#多 effort 档#厂商自报榜#QCode 不提供

官方表里的四个数字

50.0%

FrontierCode 1.1 Main

原文:achieving 50.0% on FrontierCode 1.1 Main, within one point of Fable 5.1 while being 64% cheaper。同一行还有 SWE-1.7 42.0%、Kimi K3 44.2%、Grok 4.6 48.0%、Fable 5.1 50.9%、GPT-6 Astra 53.3% —— 都是厂商表。

64%

相对 Fable 5.1 的自称降幅

官方原话是 being 64% cheaper(比 Fable 5.1 便宜 64%)。这是 Cognition 自己的对照口径,既没有第三方重跑,也没给出具体的每百万 token 单价。

27.3%

Terminal-Bench 4(同一张表的短板列)

同一行:SWE-2 27.3%、Kimi K3 21.5%、Grok 4.6 20.3%、Fable 5.1 55.8%、GPT-5.6 Sol 37.3%、GPT-6 Astra 57.9%、SWE-1.7 7.6%。发布贴自己写了这一行,本页不替它省略。

2.8T

底座参数量(Moonshot 口径)

原文:SWE-2 is post-trained from Kimi K3, a 2.8T-parameter model。2.8T 说的是底座 K3,不是 SWE-2 的总参数;Cognition 另写「把 RL 扩展到多万亿参数规模」。

SWE-2 是什么

SWE-2 是 Cognition(Devin 那家公司)2026-09-10 发布的编码模型,官方定义是「我们最强的编码模型」,卖点是跨多个 effort 档都有竞争力的 agentic coding 表现。技术上它不是从零训的:官方写「post-trained from Kimi K3」,也就是在月之暗面的开放权重模型上做后训练 RL,并说这一轮 RL 在许多榜上再加 5–6 分。发布当天先在 Devin Desktop 与 Devin CLI 里可用,Devin Web 与 Fusion 陆续推。它走的是「产品内订阅 + agent 编排」这条路线,不是「拿一把 API key 自己调」——发布贴里没有公开端点、没有每百万 token 单价、也没有 rate limit。

发布节奏

2026-09-10:Cognition 发布《Introducing SWE-2: Pushing the Pareto Frontier》,页面元数据日期为 2026-09-10;官方原句是 available starting today in Devin Desktop and CLI,Web 与 Fusion 陆续推出。本页核对日是 2026-09-20:那篇发布贴仍是这张表的唯一出处,没有第三方复现版。

三条时间线

2026-09-10

2026-09-10:Cognition 发布 SWE-2,官方表给 FrontierCode 1.1 Main 50.0%、DeepSWE 1.1 73.0%、Terminal-Bench 2.1 92.8%、Terminal-Bench 4 27.3%,并说比 Fable 5.1 便宜 64%。

2026-09-10

2026-09-10 同一篇里另一条:SWE-2 从 Kimi K3(2.8T)post-train 而来,沿用 SWE-1.7 的训练设施与配方,官方称 RL 仍有许多余量,在许多榜上加 5–6 分。

2026-09-20

2026-09-20 本页核对:QCode 公开模型目录里搜 SWE-2 / Devin / Cognition 均 0 命中 ⇒ 本站不提供,页面上任何地方都不写「可用」;对照用的编码能力页都指向在售模型。

官方写明 vs 还不能说

发布贴里写明的

截至 2026-09-20 那页仍然这样写:四项榜分(50.0% / 73.0% / 92.8% / 27.3%)、比 Fable 5.1 便宜 64%、底座是 Kimi K3(2.8T)、发布当天在 Devin Desktop 与 CLI 可用、在多个 effort 档上给分。这些都只是「官方写了」,不是独立测量。

别当成事实写的

截至 2026-09-20 没有的东西:公开 API 端点与模型 id、每百万 token 单价、rate limit、上下文长度、训练数据与许可、是否开放权重、企业条款。检索记录里流传的「订阅档免费用一个月」在抓回的那页正文里找不到 ⇒ 本页不写。「接近 GPT-6 Astra 但只有四分之一的成本」是厂商对照,不是独立评测;所有分数都出自 Cognition 自己那张表,也没有第三方重跑。

SWE-2 与「自己搭编码 agent」差在哪

Cognition SWE-2(产品内)

模型 + Devin 的 agent 编排在同一个产品里,发布当天在 Desktop 与 CLI 可用;代价是走订阅而不是按 token 计费——官方没给端点、单价、限速,所以「这次任务花了多少」只能按它自己的口径算。

在售通用模型 + 自建 harness

把编码任务跑在 QCode 在售的通用模型上:model id 换一行、按 token 计费、限速与账单在自己的控制台里;代价是 agent 编排、上下文管理与验证回路都得自己搭,官方那种「多 effort 档」要自己用采样与重试做近似。

要复刻这类能力,看三件事

第一是任务切分:官方说 SWE-2 跨多个 effort 档给分,自建路线没有这种内建档位,常见做法是把「定位问题 / 改代码 / 跑测试」拆成独立调用,简单步骤走低成本模型。第二是验证回路:发布贴里最实在的一句是「用前几个检查点训练一个迭代强化验证器的模型」,翻译到工程上就是——测试与 lint 必须自动化,否则任何模型的分都会掉。第三是成本口径:64% 是厂商给的对照,不是单价;要比较就在同一份仓库、同一批 issue 上跑,记下 token 数与失败重试次数,再对着账单算,别照抄宣传页。

QCode 上的实际情况

SWE-2 不提供。2026-09-20 查 QCode 公开模型目录,SWE-2 / Devin / Cognition 三个词都是 0 命中,30 天计价用量表里也没有这三项,所以本页不写「可用」、也不给价格。要把编码 agent 落到能计费的调用上,路径是在售通用模型 + schema/工具调用 + 外层校验与重试,按官方价乘服务费率计费;具体单价与限速看 /pricing 与实时目录。

常见问题

SWE-2 能在 QCode 上调用吗?

不能。2026-09-20 核对公开目录没有 SWE-2,也没有 Cognition/Devin 的任何服务;它目前只在 Devin 产品线里给(Desktop、CLI,Web 与 Fusion 陆续)。

那些榜单数字可信吗?

它们是厂商自报:五项分数与 64% 降幅都来自 Cognition 同一篇发布贴,第三方重跑结果截至 2026-09-20 没有。值得注意的是官方连短板也写了:Terminal-Bench 4 只有 27.3%。

它和 Kimi K3 是什么关系?

官方写 SWE-2 is post-trained from Kimi K3(2.8T)——底座是月之暗面的开放权重模型,Cognition 在其上做后训练 RL。所以「K3 的分数」和「SWE-2 的分数」是两回事,同表里 K3 本体在 FrontierCode 1.1 Main 是 44.2%、Terminal-Bench 4 是 21.5%。

有 API、单价、上下文长度吗?

发布贴里没有:没有公开端点与模型 id、没有每百万 token 单价、没有 rate limit,也没写上下文长度。本页不替它推断,需要这些数字的团队只能等官方补或者按产品订阅评估。

那我要做编码 agent,该走哪条路?

看你要的是「一个产品替我把流程跑完」还是「我要能计费、能换模型、能自己控上下文」。后者用在售通用模型 + 工具调用即可落地:改 model id、按 token 计费、日志与限速都在自己控制台。

便宜 64% 这个数能直接用吗?

不能当单价用。它是 Cognition 拿自己的成本口径与 Fable 5.1 比出来的相对值,既没有公开单价也没有第三方复算;同一句话里还夹着「接近 GPT-6 Astra 但只有四分之一的成本」,同样是厂商对照。要比就在自己的仓库上跑同一批任务。

来源

Cognition《Introducing SWE-2: Pushing the Pareto Frontier》,2026-09-10,https://cognition.com/blog/swe-2(2026-09-20 抓取);QCode 目录与用量为本站内部核对(prod 公开目录页快照 + 30 天计价用量表)。本页所有分数与降幅均为厂商自报。

不买 agent 产品,也能把编码任务跑在能计费的调用上

SWE-2 不在本站目录(2026-09-20 核对);能用的是在售通用模型 + 工具调用,按 token 计费。

接着看

与 Cognition、Moonshot AI 无隶属关系。本页所有分数、降幅与训练描述都是 2026-09-20 抓取自 Cognition 官方发布贴的转述,属厂商自报;QCode 不提供 SWE-2,也不评价 Devin 产品。