Cognition SWE-2: таблица вендора, заявления о цене и то, чего в них нет
Cognition выпустила SWE-2 2026-09-10, назвав её своей самой сильной кодовой моделью; по официальному тексту это дообучение с RL на Kimi K3 (2.8T параметра) ради компромисса «возможности против стоимости инференса»: 50.0 % на FrontierCode 1.1 Main, в балле от Fable 5.1 при цене на 64 % ниже. В той же таблице Terminal-Bench 4 — 27.3 %. Здесь разделено: что вендор написал, чего не написал и что можно сделать у нас.
Обновлено 2026-09-20
Четыре числа из официальной таблицы
FrontierCode 1.1 Main
Дословно: achieving 50.0% on FrontierCode 1.1 Main, within one point of Fable 5.1 while being 64% cheaper. В той же строке: SWE-1.7 42.0 %, Kimi K3 44.2 %, Grok 4.6 48.0 %, Fable 5.1 50.9 %, GPT-6 Astra 53.3 % — всё из таблицы вендора.
Заявленное снижение против Fable 5.1
В посте сказано being 64% cheaper. Это сравнение самого Cognition: ни независимого пересчёта, ни цены за миллион токенов за этим числом нет.
Terminal-Bench 4 (слабая колонка той же таблицы)
Та же строка: SWE-2 27.3 %, Kimi K3 21.5 %, Grok 4.6 20.3 %, Fable 5.1 55.8 %, GPT-5.6 Sol 37.3 %, GPT-6 Astra 57.9 %, SWE-1.7 7.6 %. Эту строку опубликовал сам Cognition, мы её не убираем.
Параметры базовой модели (данные Moonshot)
Оригинал: SWE-2 is post-trained from Kimi K3, a 2.8T-parameter model. 2.8T — это база K3, а не размер SWE-2; отдельно Cognition пишет про масштабирование RL до триллионов параметров.
Что такое SWE-2
SWE-2 — кодовая модель компании Cognition (автора Devin), выпущенная 2026-09-10 и названная в посте «самой продвинутой кодовой моделью»; сильные стороны — агентное программирование на нескольких уровнях усилий. С нуля её не учили: в тексте сказано post-trained from Kimi K3, то есть дообучение с RL поверх открытовесовой модели Moonshot, которое, по заявлению автора, добавляет 5–6 баллов во многих замерах. В день выпуска доступна в Devin Desktop и Devin CLI, Web и Fusion — по мере раскатки. Это путь «подписка в продукте + оркестрация агента»: публичного эндпоинта, цены за миллион токенов и лимитов в посте нет.
Хронология выпуска
2026-09-10: Cognition публикует «Introducing SWE-2: Pushing the Pareto Frontier»; метаданные страницы датированы 2026-09-10, в тексте — available starting today in Devin Desktop and CLI, Web и Fusion позже. Дата проверки этой страницы — 2026-09-20: источником таблицы по-прежнему остаётся единственной этот пост, независимого повтора нет.
Три записи с датами
2026-09-10: Cognition выпускает SWE-2. Официальная таблица даёт 50.0 % на FrontierCode 1.1 Main, 73.0 % на DeepSWE 1.1, 92.8 % на Terminal-Bench 2.1, 27.3 % на Terminal-Bench 4 и «на 64 % дешевле Fable 5.1».
Тот же пост 2026-09-10: SWE-2 дообучена на Kimi K3 (2.8T), инфраструктура и рецепт — от SWE-1.7; RL, по словам автора, ещё даёт запас и добавляет 5–6 баллов.
2026-09-20, проверка для этой страницы: поиск по публичному каталогу моделей QCode по SWE-2 / Devin / Cognition ничего не находит ⇒ сервис не предоставляется, «доступно у нас» здесь не написано; ссылки про кодинг ведут на продаваемые модели.
Написано против неизвестного
Что прямо сказано в посте
По состоянию на 2026-09-20 страница по-прежнему утверждает: четыре результата (50.0 % / 73.0 % / 92.8 % / 27.3 %), «на 64 % дешевле» Fable 5.1, база Kimi K3 (2.8T), доступность в Devin Desktop и CLI в день релиза, замер на нескольких уровнях effort. Всё это — утверждения вендора, а не независимые измерения.
Что не стоит считать фактом
По состоянию на 2026-09-20 отсутствуют: публичный API-эндпоинт и id модели, цена за миллион токенов, лимители, длина контекста, данные обучения и лицензия, открытость весов, корпоративные условия. Ходящее в поиске «месяц бесплатно на Pro/Max/Teams» в полученном тексте не найдено ⇒ на странице не пишется. «В нескольких баллах от GPT-6 Astra при четверти стоимости» — тоже сравнение вендора; все цифры взяты из таблицы Cognition, независимого повтора нет.
SWE-2 против собственного coding-агента
Cognition SWE-2 (внутри продукта)
Модель и оркестрация Devin в одном продукте, доступны в Desktop и CLI с первого дня. Расплата — не токенная тарификация: эндпоинта, цены и лимитов нет, значит стоимость задачи считается только по их методике.
Продаваемые универсальные модели + свой контур
Кодовые задачи на моделях, которые QCode продаёт: одна строка model id, оплата за токены, лимиты и счета в своей консоли. Расплата — оркестрация, управление контекстом и контур проверки остаются на вас, а «уровни effort» приходится приближать сэмплированием и ретраями.
Три вещи, если нужен тот же результат
Первое — дробление задачи: вендор даёт оценки по уровням effort, в самодельном контуре таких внутренних ступеней нет, поэтому «найти проблему / править / прогнать тесты» разводят по отдельным вызовам, а простые шаги отдают дешёвому tier. Второе — контур проверки: самая конкретная фраза в посте про обучение модели, которая итеративно укрепляет верификаторы; в инженерном переводе это автоматические тесты и линт, без них падает оценка у любой модели. Третье — база расчёта: 64 % — сравнение вендора, а не цена. Сравнивайте на своих репозиториях и наборе задач, фиксируйте токены и ретраи, а потом читайте счёт; чужие баннеры не списывайте.
Что реально есть на QCode
SWE-2 не предоставляется. 2026-09-20 проверка публичного каталога моделей QCode: по SWE-2 / Devin / Cognition — 0 совпадений, и в таблице оплаченного трафика за 30 дней их тоже нет ⇒ ни «доступно», ни цены на странице нет. Чтобы агентные кодовые задачи легли в оплачиваемые вызовы, путь такой: продаваемая универсальная модель + схема/вызов инструментов + внешняя валидация и ретраи, оплата «официальная цена × сервисный коэффициент»; цены и лимиты — на /pricing и в живом каталоге.
Вопросы
Можно ли вызывать SWE-2 через QCode?
Нет. Проверка каталога 2026-09-20 не находит ни SWE-2, ни сервиса Cognition/Devin; модель доступна только внутри линейки Devin (Desktop, CLI, Web и Fusion по мере раскатки).
Достоверны ли цифры из таблицы?
Это данные вендора: пять результатов и 64 % взяты из одного поста Cognition, независимого повтора на 2026-09-20 нет. Отразим честно: слабую колонку опубликовали сами авторы — 27.3 % на Terminal-Bench 4.
При чём тут Kimi K3?
В посте прямо: SWE-2 is post-trained from Kimi K3 (2.8T). База — открытовесовая модель Moonshot, Cognition добавляет RL. Значит «баллы K3» и «баллы SWE-2» — разные строки: у K3 в той же таблице 44.2 % на FrontierCode 1.1 Main и 21.5 % на Terminal-Bench 4.
Есть API, цена, длина контекста?
В посте нет ни публичного эндпоинта с id, ни цены за миллион токенов, ни лимитов, ни длины контекста. Мы не достраиваем эти данные; нужным — ждать официальных цифр или оценивать подписку продукта.
Какой путь выбрать для своего coding-агента?
Зависит от того, нужен ли продукт, который сам ведёт цикл, или оплачиваемые вызовы с контролем модели и контекста. Второе ложится сегодня на продаваемые универсальные модели + вызовы инструментов: меняете model id, платите за токены, логи и лимиты остаются у вас.
Можно ли брать «на 64 % дешевле» как цену?
Как удельную цену — нет. Это сравнение собственной стоимости с Fable 5.1 без публичного прайса и без пересчёта третьими сторонами; в той же фразе «в нескольких баллах от GPT-6 Astra при четверти стоимости» — тоже рамка вендора. Считайте на своих задачах.
Источники
Cognition, «Introducing SWE-2: Pushing the Pareto Frontier», 2026-09-10, https://cognition.com/blog/swe-2 (получено 2026-09-20); каталог и трафик QCode — внутренняя проверка нашего сайта (снимок публичного каталога и таблица оплаченного трафика за 30 дней). Все оценки и проценты на странице — данные вендора.
Без продукта-агента кодовые задачи тоже ложатся на оплачиваемые вызовы
SWE-2 в нашем каталоге нет (проверка 2026-09-20); доступно — продаваемые модели + вызовы инструментов с оплатой за токены.
Читать дальше
Claude Fable 5 на SWE-Bench Pro
Сравнение, к которому отсылает таблица SWE-2: откуда число и чем оно ограничено.
Выбор AI-моделей для кодинга: вторая половина 2026
Бюджет, сложность, контекст: как собрать агента на продаваемых моделях.
Гид по ценам QCode
Официальная цена × сервисный коэффициент, учёт кэша и ретраев.
Мы не связаны с Cognition и Moonshot AI. Все оценки, проценты и описания обучения на этой странице — пересказ поста Cognition, полученного 2026-09-20, то есть данные вендора; QCode не предлагает SWE-2 и не оценивает продукт Devin.