8 стр.

Бенчмарки и рейтинги

SWE-bench, Terminal-Bench и другие публичные результаты — и что они на самом деле означают.

Terminal-Bench 3.0: Полный Разбор

TB 3.0 vs 2.1, текущий рейтинг и продаваемые модели

Обновлено 2026-08-27

Индекс Интеллекта Artificial Analysis: Разбор

Полный разбор 9 взвешенных оценок и частых заблуждений

Обновлено 2026-08-27

Разбор лидерборда Terminal-Bench 2.1

Три рейтинга — три лидера: полный разбор разницы 83.8 / 89.5 / 85.77

Обновлено 2026-08-22

Три первых места SWE-bench Pro: разбор

80.3 / 80.0 / официальный борд: правда о разбиениях данных и scaffold

Обновлено 2026-08-22

Как самому оценить Ornith-1.5

Судить о новой модели по своей работе, а не по публичным рейтингам.

Обновлено 2026-08-20

Оценка Claude Fable 5 на SWE-Bench Pro: разбор

Откуда взялись 80,3%, спор между официальной методологией и независимым воспроизведением, и насколько на это стоит опираться

Обновлено 2026-08-08

От SWE-Bench к продакшену 2026: как бенчмарки (не) превращаются в скорость доставки

88% на SWE-Bench звучит отлично, но на ваших приватных репозиториях часто только 30%. Поймите разрыв и создайте собственный harness для верификации.

Обновлено 2026-07-13

Рейтинг моделей кодирования SWE-Bench Pro 2026: Opus 4.7 vs GPT-5.5 vs GPT-5.3-Codex

SWE-Bench Pro 2026: GPT-5.3-Codex 56.8% SOTA, GPT-5.5 58.6%, GPT-5.2 80% Verified, Opus 4.8 Fast Mode по умолчанию. Гайд по выбору модели.

Обновлено 2026-05-16