Вышла новая модель — как понять, стоит ли переходить
Публичные бенчмарки отвечают на вопрос «как она справляется со стандартными задачами». Вам нужен ответ на «как она справляется с моей кодовой базой». Эти два ответа часто расходятся.
Четыре принципа
Берите собственную работу
Двадцать реальных задач, которые вы недавно решали, предсказывают ценность модели для вас лучше любого публичного рейтинга.
Один набор задач для всех кандидатов
Сравнение моделей на разных задачах даёт бессмысленный вывод. Набор должен быть зафиксирован.
Скрывайте имена при оценке
Знание того, чей это вывод, заметно смещает суждение. Сначала закройте названия, потом ставьте оценки.
Один прогон ничего не доказывает
Прогоняйте каждую задачу трижды. Если три прогона сильно расходятся, сам вывод «она лучше» неустойчив.
Почему публичные бенчмарки здесь не помогают
Публичные бенчмарки решают задачу сопоставимости: фиксированный набор задач и фиксированная схема оценки позволяют поместить разные модели в одну систему координат. Для исследований это ценно, для выбора — ограниченно, по трём причинам. Задачи обычно не связаны с вашей кодовой базой и предметной областью; схема оценки может не соответствовать важным для вас измерениям качества; а по мере широкого использования вероятность попадания задач бенчмарка в обучающие данные со временем растёт. Высокий балл не означает «лучше для вас».
О только что вышедших моделях
В первые дни после выхода публичные оценки сильно колеблются: у ранних пользователей маленькие выборки и смещённое распределение задач, а перегрузка в момент запуска заставляет принимать проблемы задержек за проблемы качества. Если вы не спешите, оценка через одну-две недели даёт куда более устойчивую картину.
Шаги
Отберите и зафиксируйте двадцать реальных задач. Качество этого шага определяет ценность всей оценки.
Все кандидаты проходят один набор, по три прогона на задачу, с записью стоимости и времени.
Оцените вслепую по важным для вас измерениям, затем верните в картину стоимость.
Рейтинги сужают круг, ваши прогоны принимают решение
Что эта страница утверждает
Методика собственной оценки универсальна и не зависит от того, о какой модели речь: зафиксировать набор задач, сравнивать на одних и тех же задачах, оценивать вслепую, брать повторные выборки и фиксировать стоимость рядом. Это верно для любого выбора модели.
Чего эта страница не утверждает
Мы не проводили систематическую оценку Ornith-1.5, поэтому здесь нет ни цифр бенчмарков, ни мест в рейтингах, ни выводов вида «обходит такую-то модель». Такие числа легко искажаются при пересказе, а выбор модели стоит денег и времени — он не должен опираться на непроверенные цифры.
Две опоры для выбора
Смотреть публичные рейтинги
Бесплатно и быстро сужает круг кандидатов. Но не отвечает на «подходит ли моей работе» и сильно шумит в момент запуска.
Собрать небольшую собственную оценку
Около двух часов, вывод напрямую относится к вашей ситуации, а набор задач пригодится в следующий раз. Плата — время на подготовку набора.
Самооценка, которая укладывается в два часа
Шаг первый: возьмите двадцать задач, которые вы реально решали за последние две недели, отражающих ваше обычное распределение — не выбирайте только сложные, рутинной работы обычно больше. Шаг второй: зафиксируйте набор и прогоните на нём всех кандидатов. Шаг третий: уберите названия моделей перед оценкой и оценивайте по тем измерениям, которые вам действительно важны: пришлось ли переделывать, не сломалось ли что-то в другом месте, понят ли контекст. Шаг четвёртый: прогоните каждую задачу трижды и посмотрите на устойчивость. Шаг пятый: рядом фиксируйте стоимость. При близком качестве решают именно стоимость и скорость.
Есть ли Ornith-1.5 в QCode
Скажем прямо: QCode сейчас не предоставляет Ornith-1.5. Мы предоставляем семь семейств — Claude, GPT/Codex, Gemini, GLM, Kimi, DeepSeek и Qwen — по одному ключу. Если оценить нужно именно Ornith-1.5, воспользуйтесь официальным каналом её разработчика; метод с этой страницы применим и там. Если по итогам оценки вы решите остаться в перечисленных семействах, мы можем дать доступ с тарификацией по фиксированному суточному объёму и предсказуемой стоимостью.
Частые вопросы
Можно ли использовать Ornith-1.5 в QCode?
Сейчас нет. QCode предоставляет семейства Claude, GPT/Codex, Gemini, GLM, Kimi, DeepSeek и Qwen; Ornith-1.5 в их число не входит.
Почему на странице нет цифр бенчмарков?
Потому что мы их сами не измеряли. Публиковать непроверенные числа вредно для того, кто принимает решение о выборе, — а это решение стоит денег и времени.
Достаточно ли двадцати задач?
Для личного решения обычно достаточно, если эти двадцать действительно отражают ваше обычное распределение. Если кандидаты оказались очень близки, расширьте набор до пятидесяти.
Зачем скрывать названия моделей?
Потому что знание источника заметно смещает оценки. Особенно это выражено для только что вышедших моделей: одно лишь ожидание поднимает выставляемые баллы.
Не расточительно ли прогонять каждую задачу трижды?
Именно этот шаг экономит больше всего. Если три прогона сильно расходятся, вывод «она лучше» неустойчив, а решение о переходе, построенное на нём, обойдётся куда дороже.
А если оценка показала, что текущая модель устраивает?
Это ценный результат. Частый итог оценки — не «надо переходить», а «переходить не нужно», и это экономит вам стоимость миграции.
Источники
Возможности и доступность моделей определяются официальными заявлениями их разработчиков. Эта страница даёт только метод оценки и не повторяет сторонние цифры бенчмарков.
Оценка закончена — нужен предсказуемый доступ
Один ключ на семь семейств моделей с тарификацией по фиксированному суточному объёму.
Читайте также
Модели, доступные в QCode
Список доступных сейчас семейств.
Маршрутизация между моделями
Разные модели под разные типы задач.
Сравнение тарифов моделей
Как учесть стоимость при выборе.
Возможности и доступность сторонних моделей определяются официальными заявлениями их разработчиков. Эта страница не приводит цифр бенчмарков, только метод, который можно выполнить самому. Актуальный список семейств в QCode — на странице моделей сайта.