Выпущено 2026-09-10 · на QCode недоступно

Cognition SWE-2: таблица вендора, заявления о цене и то, чего в них нет

Cognition выпустила SWE-2 2026-09-10, назвав её своей самой сильной кодовой моделью; по официальному тексту это дообучение с RL на Kimi K3 (2.8T параметра) ради компромисса «возможности против стоимости инференса»: 50.0 % на FrontierCode 1.1 Main, в балле от Fable 5.1 при цене на 64 % ниже. В той же таблице Terminal-Bench 4 — 27.3 %. Здесь разделено: что вендор написал, чего не написал и что можно сделать у нас.

Обновлено 2026-09-20

#агентный код#уровни effort#данные вендора#нет на QCode

Четыре числа из официальной таблицы

50.0%

FrontierCode 1.1 Main

Дословно: achieving 50.0% on FrontierCode 1.1 Main, within one point of Fable 5.1 while being 64% cheaper. В той же строке: SWE-1.7 42.0 %, Kimi K3 44.2 %, Grok 4.6 48.0 %, Fable 5.1 50.9 %, GPT-6 Astra 53.3 % — всё из таблицы вендора.

64%

Заявленное снижение против Fable 5.1

В посте сказано being 64% cheaper. Это сравнение самого Cognition: ни независимого пересчёта, ни цены за миллион токенов за этим числом нет.

27.3%

Terminal-Bench 4 (слабая колонка той же таблицы)

Та же строка: SWE-2 27.3 %, Kimi K3 21.5 %, Grok 4.6 20.3 %, Fable 5.1 55.8 %, GPT-5.6 Sol 37.3 %, GPT-6 Astra 57.9 %, SWE-1.7 7.6 %. Эту строку опубликовал сам Cognition, мы её не убираем.

2.8T

Параметры базовой модели (данные Moonshot)

Оригинал: SWE-2 is post-trained from Kimi K3, a 2.8T-parameter model. 2.8T — это база K3, а не размер SWE-2; отдельно Cognition пишет про масштабирование RL до триллионов параметров.

Что такое SWE-2

SWE-2 — кодовая модель компании Cognition (автора Devin), выпущенная 2026-09-10 и названная в посте «самой продвинутой кодовой моделью»; сильные стороны — агентное программирование на нескольких уровнях усилий. С нуля её не учили: в тексте сказано post-trained from Kimi K3, то есть дообучение с RL поверх открытовесовой модели Moonshot, которое, по заявлению автора, добавляет 5–6 баллов во многих замерах. В день выпуска доступна в Devin Desktop и Devin CLI, Web и Fusion — по мере раскатки. Это путь «подписка в продукте + оркестрация агента»: публичного эндпоинта, цены за миллион токенов и лимитов в посте нет.

Хронология выпуска

2026-09-10: Cognition публикует «Introducing SWE-2: Pushing the Pareto Frontier»; метаданные страницы датированы 2026-09-10, в тексте — available starting today in Devin Desktop and CLI, Web и Fusion позже. Дата проверки этой страницы — 2026-09-20: источником таблицы по-прежнему остаётся единственной этот пост, независимого повтора нет.

Три записи с датами

2026-09-10

2026-09-10: Cognition выпускает SWE-2. Официальная таблица даёт 50.0 % на FrontierCode 1.1 Main, 73.0 % на DeepSWE 1.1, 92.8 % на Terminal-Bench 2.1, 27.3 % на Terminal-Bench 4 и «на 64 % дешевле Fable 5.1».

2026-09-10

Тот же пост 2026-09-10: SWE-2 дообучена на Kimi K3 (2.8T), инфраструктура и рецепт — от SWE-1.7; RL, по словам автора, ещё даёт запас и добавляет 5–6 баллов.

2026-09-20

2026-09-20, проверка для этой страницы: поиск по публичному каталогу моделей QCode по SWE-2 / Devin / Cognition ничего не находит ⇒ сервис не предоставляется, «доступно у нас» здесь не написано; ссылки про кодинг ведут на продаваемые модели.

Написано против неизвестного

Что прямо сказано в посте

По состоянию на 2026-09-20 страница по-прежнему утверждает: четыре результата (50.0 % / 73.0 % / 92.8 % / 27.3 %), «на 64 % дешевле» Fable 5.1, база Kimi K3 (2.8T), доступность в Devin Desktop и CLI в день релиза, замер на нескольких уровнях effort. Всё это — утверждения вендора, а не независимые измерения.

Что не стоит считать фактом

По состоянию на 2026-09-20 отсутствуют: публичный API-эндпоинт и id модели, цена за миллион токенов, лимители, длина контекста, данные обучения и лицензия, открытость весов, корпоративные условия. Ходящее в поиске «месяц бесплатно на Pro/Max/Teams» в полученном тексте не найдено ⇒ на странице не пишется. «В нескольких баллах от GPT-6 Astra при четверти стоимости» — тоже сравнение вендора; все цифры взяты из таблицы Cognition, независимого повтора нет.

SWE-2 против собственного coding-агента

Cognition SWE-2 (внутри продукта)

Модель и оркестрация Devin в одном продукте, доступны в Desktop и CLI с первого дня. Расплата — не токенная тарификация: эндпоинта, цены и лимитов нет, значит стоимость задачи считается только по их методике.

Продаваемые универсальные модели + свой контур

Кодовые задачи на моделях, которые QCode продаёт: одна строка model id, оплата за токены, лимиты и счета в своей консоли. Расплата — оркестрация, управление контекстом и контур проверки остаются на вас, а «уровни effort» приходится приближать сэмплированием и ретраями.

Три вещи, если нужен тот же результат

Первое — дробление задачи: вендор даёт оценки по уровням effort, в самодельном контуре таких внутренних ступеней нет, поэтому «найти проблему / править / прогнать тесты» разводят по отдельным вызовам, а простые шаги отдают дешёвому tier. Второе — контур проверки: самая конкретная фраза в посте про обучение модели, которая итеративно укрепляет верификаторы; в инженерном переводе это автоматические тесты и линт, без них падает оценка у любой модели. Третье — база расчёта: 64 % — сравнение вендора, а не цена. Сравнивайте на своих репозиториях и наборе задач, фиксируйте токены и ретраи, а потом читайте счёт; чужие баннеры не списывайте.

Что реально есть на QCode

SWE-2 не предоставляется. 2026-09-20 проверка публичного каталога моделей QCode: по SWE-2 / Devin / Cognition — 0 совпадений, и в таблице оплаченного трафика за 30 дней их тоже нет ⇒ ни «доступно», ни цены на странице нет. Чтобы агентные кодовые задачи легли в оплачиваемые вызовы, путь такой: продаваемая универсальная модель + схема/вызов инструментов + внешняя валидация и ретраи, оплата «официальная цена × сервисный коэффициент»; цены и лимиты — на /pricing и в живом каталоге.

Вопросы

Можно ли вызывать SWE-2 через QCode?

Нет. Проверка каталога 2026-09-20 не находит ни SWE-2, ни сервиса Cognition/Devin; модель доступна только внутри линейки Devin (Desktop, CLI, Web и Fusion по мере раскатки).

Достоверны ли цифры из таблицы?

Это данные вендора: пять результатов и 64 % взяты из одного поста Cognition, независимого повтора на 2026-09-20 нет. Отразим честно: слабую колонку опубликовали сами авторы — 27.3 % на Terminal-Bench 4.

При чём тут Kimi K3?

В посте прямо: SWE-2 is post-trained from Kimi K3 (2.8T). База — открытовесовая модель Moonshot, Cognition добавляет RL. Значит «баллы K3» и «баллы SWE-2» — разные строки: у K3 в той же таблице 44.2 % на FrontierCode 1.1 Main и 21.5 % на Terminal-Bench 4.

Есть API, цена, длина контекста?

В посте нет ни публичного эндпоинта с id, ни цены за миллион токенов, ни лимитов, ни длины контекста. Мы не достраиваем эти данные; нужным — ждать официальных цифр или оценивать подписку продукта.

Какой путь выбрать для своего coding-агента?

Зависит от того, нужен ли продукт, который сам ведёт цикл, или оплачиваемые вызовы с контролем модели и контекста. Второе ложится сегодня на продаваемые универсальные модели + вызовы инструментов: меняете model id, платите за токены, логи и лимиты остаются у вас.

Можно ли брать «на 64 % дешевле» как цену?

Как удельную цену — нет. Это сравнение собственной стоимости с Fable 5.1 без публичного прайса и без пересчёта третьими сторонами; в той же фразе «в нескольких баллах от GPT-6 Astra при четверти стоимости» — тоже рамка вендора. Считайте на своих задачах.

Источники

Cognition, «Introducing SWE-2: Pushing the Pareto Frontier», 2026-09-10, https://cognition.com/blog/swe-2 (получено 2026-09-20); каталог и трафик QCode — внутренняя проверка нашего сайта (снимок публичного каталога и таблица оплаченного трафика за 30 дней). Все оценки и проценты на странице — данные вендора.

Без продукта-агента кодовые задачи тоже ложатся на оплачиваемые вызовы

SWE-2 в нашем каталоге нет (проверка 2026-09-20); доступно — продаваемые модели + вызовы инструментов с оплатой за токены.

Читать дальше

Мы не связаны с Cognition и Moonshot AI. Все оценки, проценты и описания обучения на этой странице — пересказ поста Cognition, полученного 2026-09-20, то есть данные вендора; QCode не предлагает SWE-2 и не оценивает продукт Devin.