Бенчмарки и рейтинги
SWE-bench, Terminal-Bench и другие публичные результаты — и что они на самом деле означают.
Terminal-Bench 3.0: Полный Разбор
TB 3.0 vs 2.1, текущий рейтинг и продаваемые модели
Обновлено 2026-08-27
Индекс Интеллекта Artificial Analysis: Разбор
Полный разбор 9 взвешенных оценок и частых заблуждений
Обновлено 2026-08-27
Разбор лидерборда Terminal-Bench 2.1
Три рейтинга — три лидера: полный разбор разницы 83.8 / 89.5 / 85.77
Обновлено 2026-08-22
Три первых места SWE-bench Pro: разбор
80.3 / 80.0 / официальный борд: правда о разбиениях данных и scaffold
Обновлено 2026-08-22
Как самому оценить Ornith-1.5
Судить о новой модели по своей работе, а не по публичным рейтингам.
Обновлено 2026-08-20
Оценка Claude Fable 5 на SWE-Bench Pro: разбор
Откуда взялись 80,3%, спор между официальной методологией и независимым воспроизведением, и насколько на это стоит опираться
Обновлено 2026-08-08
От SWE-Bench к продакшену 2026: как бенчмарки (не) превращаются в скорость доставки
88% на SWE-Bench звучит отлично, но на ваших приватных репозиториях часто только 30%. Поймите разрыв и создайте собственный harness для верификации.
Обновлено 2026-07-13
Рейтинг моделей кодирования SWE-Bench Pro 2026: Opus 4.7 vs GPT-5.5 vs GPT-5.3-Codex
SWE-Bench Pro 2026: GPT-5.3-Codex 56.8% SOTA, GPT-5.5 58.6%, GPT-5.2 80% Verified, Opus 4.8 Fast Mode по умолчанию. Гайд по выбору модели.
Обновлено 2026-05-16