SWE-Bench Pro 2026 — реалистичный бенчмарк AI-моделей кодирования
Агрегированная доска от 08-18: лидируют Mythos 5 80.3, Fable 5 80.0 и Opus 5 79.2, а открытая Qwen3.8 Max 67.7 обходит GPT-5.6 Sol 64.6. Внимание к методике: это цифры агрегированной доски — самоотчёты вендоров и официальная доска Scale используют другие методики; разбор различий — на нашей странице «Три первых места».
SWE-Bench Pro vs Verified — сам бенчмарк
SWE-Bench Verified (популярен с 2024): ~500 верифицированных людьми задач на исправление GitHub-issues. SWE-Bench Pro (мейнстрим с 2026): тот же подход, но сложнее — длиннее контекст, больше изменяемых файлов, ближе к реальному потоку PR. Verified упёрся в 80% (5.2-Codex), у Pro ещё ~40 пунктов запаса — это канонический бенчмарк. Terminal-Bench 2.0 измеряет терминальных агентов; OSWorld — задачи в GUI; GDPval — профессиональные знания.
Эволюция баллов Q1-Q2 2026
Ранняя эволюция: GPT-5.2-Codex (2026-01) Verified 80.0% / Pro 56.4%; GPT-5.3-Codex (2026-02) Pro 56.8% (модель отключена в 2026-08); GPT-5.5 Pro 58.6%. Агрегированная доска от 08-18 (методика llm-stats / benchlm): Mythos 5 80.3, Fable 5 80.0, Opus 5 79.2, Qwen3.8 Max 67.7, GPT-5.6 Sol 64.6, GLM-5.2 62.1. Внимание: системная карта Anthropic заявляет для Fable 5 80.3 (наравне с Mythos), агрегированная доска фиксирует 80.0 — существуют обе цифры, разница в методике оценки.
Сравнение моделей по сценарию
По агрегированной доске от 08-18: лидируют Mythos 5 (80.3) > Fable 5 (80.0) > Opus 5 (79.2), а Qwen3.8 Max (67.7) обходит GPT-5.6 Sol (64.6). Подбор под сценарий: 1) длинные агентные / терминальные задачи → смотрите доску Terminal-Bench 2.1 (отдельная страница сайта); 2) глубокие рефакторинги Python → линейка Claude (Opus 5 / Fable 5); 3) открытые веса + цена → Qwen3.8 Max / GLM-5.2 / DeepSeek V4 Pro; 4) экосистема OpenAI → GPT-5.6 Sol. О путанице в методиках — «Три первых места SWE-bench Pro».
Единый доступ ко всем моделям через QCode
QCode.cc предоставляет единый прозрачный API-шлюз ко всем основным моделям кодирования изнутри Китая — Claude (Opus 4.7 / Sonnet), GPT (5.5 / семейство Codex), Gemini (3) и др. Одна подписка, тарификация по использованию. В Claude Code, Codex CLI, Cursor, Cline, Continue смена модели — это изменение base URL и model id.
FAQ
58.6% на SWE-Bench Pro — это много? Как читать?
Pro значительно сложнее Verified: Verified насыщена (80%+), на Pro лучшие самоотчёты вендоров — около 80, а цифры официального единого фреймворка Scale заметно ниже. Читая любой балл Pro, сначала задайте три вопроса: какая доска, какой scaffold, какой уровень effort — подробности в «Три первых места SWE-bench Pro».
Почему универсальный GPT-5.5 обходит специализированный 5.3-Codex на Pro?
Это картина первой половины 2026 года. Верх агрегированной доски от 08-18 теперь занимают три модели Claude (Mythos 5 / Fable 5 / Opus 5), а GPT-5.3-Codex отключена в 2026-08 (миграция на три уровня GPT-5.6). С 2026-09-03 вершина линейки OpenAI — GPT-6 Astra, но учтите: OpenAI не опубликовала для неё оценку SWE-bench Verified ни на странице модели, ни в системной карте, поэтому сопоставимого места на этой доске у неё нет. Не принимайте за официальные числа, которые ходят в других источниках.
Балл Opus 4.7 на Pro не опубликован — как оценивать?
На этой агрегированной доске от 2026-08-18 у Opus 4.7 нет заявленного производителем балла Pro, по очкам его сравнивать не стоит. Позиция перешла к Opus 5; по состоянию на 2026-09-29 последний Opus от Anthropic — Opus 5.5 (выпущен 2026-09-22, $4 / $20). Для выбора — трекер /claude-opus-5-2-status-tracker, характеристики и цены — на /claude-opus-5-5-guide.
Связанные руководства
Доступ ко всем основным моделям через QCode
Mythos 5 — ограниченная поставка; Fable 5 / Opus 5 / вся линейка GPT-5.6 / GLM-5.3 / Kimi K3 / DeepSeek V4 Pro доступны для вызовов через единый канал QCode с оплатой по факту использования.
Подключить план QCodeСоздать аккаунт QCode
Планы от ¥60 / $8.57. Один ключ для Claude, GPT и Gemini.