Разбор бенчмарка · Индекс интеллекта Artificial Analysis

Как считается индекс интеллекта Artificial Analysis
Средневзвешенное 9 тестов, веса опубликованы

Индекс интеллекта AA — это средневзвешенное 9 суб-оценок: Agents — 34%, кодинг и научные рассуждения — по 24%, общие способности — 18%; если одна и та же модель показывает разные баллы в разных рейтингах или в разное время, дело обычно в версии индекса или дате сбора данных, а не в самой модели.

#Индекс интеллекта AA#v4.1#9 взвешенных оценок#pass@1

Четыре ключевых факта

34%

Agents несёт наибольший вес

Среди 9 суб-оценок категория Agents имеет наибольшую долю, разделённую на GDPval-AA v2 (20%) и τ³-Banking (14%).

24% + 24%

Кодинг и научные рассуждения делят второе место

Кодинг — 24% (Terminal-Bench v2.1 — 16%, SciCode — 8%); научные рассуждения тоже 24% (Humanity's Last Exam — 12%, GPQA Diamond и CritPt — по 6%).

18%

Общие способности несут наименьший вес

Общие способности — 18% (AA-LCR — 6%, AA-Omniscience даёт 8% точности плюс 4% за отсутствие галлюцинаций).

pass@1

Метод оценки

Большинство суб-оценок используют pass@1 (правильно с первой попытки), агрегированное по нескольким повторным прогонам.

Полная таблица 9 суб-оценок и их весов

Индекс интеллекта AA v4.1 — это средневзвешенное девяти оценок: Agents — 34% (GDPval-AA v2 — 20%, τ³-Banking — 14%); кодинг — 24% (Terminal-Bench v2.1 — 16%, SciCode — 8%); научные рассуждения — 24% (Humanity's Last Exam — 12%, GPQA Diamond — 6%, CritPt — 6%); общие способности — 18% (AA-LCR — 6%, AA-Omniscience даёт 8% точности и 4% за отсутствие галлюцинаций). Оценка в основном идёт по pass@1 — модель должна ответить верно с первой попытки, результат агрегируется по нескольким повторным прогонам.

Почему одна и та же модель показывает разные баллы в разных местах

Две модели с одинаковым композитным баллом не обязательно имеют одинаковый профиль возможностей — это могут быть совершенно разные комбинации сильных сторон, которые случайно дали одинаковую взвешенную сумму. Кроме того, Artificial Analysis постоянно пересматривает версию индекса (сейчас v4.1, введена в июне 2026) и состав суб-оценок, и разные версии несут разные веса; даже при одной версии разные даты сбора данных отражают обновления самой модели и изменения в среде оценки, так что балл одной и той же модели может «плавать».

Хронология

Ранние версии

Artificial Analysis вводит индекс интеллекта как взвешенный композитный балл для сравнения возможностей моделей в целом.

06.2026

Вводится индекс v4.1, официально публикующий девять суб-оценок и их веса (Agents 34%, кодинг 24%, научные рассуждения 24%, общие способности 18%).

Продолжается

Состав суб-оценок и веса корректируются от версии к версии, поэтому баллы с разных дат сбора данных могут не совпадать полностью.

Подтверждено vs частое заблуждение

Подтверждено

Девять суб-оценок индекса интеллекта AA v4.1 и их веса (Agents 34%, кодинг 24%, научные рассуждения 24%, общие способности 18%, и их внутренние доли) публично задокументированы на официальной странице методологии Artificial Analysis; оценка в основном идёт по pass@1.

Частое заблуждение

Многие воспринимают композитный балл как ранжирование по одному измерению возможностей и напрямую заявляют «эта модель лучше той». Но композитный балл — результат взвешенной суммы девяти разнородных оценок; у двух моделей с близкими итоговыми баллами профиль сильных сторон в Agents, кодинге и научных рассуждениях может сильно различаться — судить только по итоговому баллу легко ошибочно.

Смотреть на композитный балл vs на суб-оценки

Только композитный балл

Подходит для быстрой грубой оценки уровня возможностей, но не показывает, в чём конкретно модель сильна или слаба.

Разбор по суб-оценкам

Если ваш сценарий явно тяготеет к Agents или кодингу, смотреть напрямую на соответствующую суб-оценку (например, компонент Terminal-Bench v2.1) точнее, чем на композитный балл.

Как правильно использовать этот индекс

Шаг 1: определите, какая из девяти категорий (Agents, кодинг, научные рассуждения или общие способности) ближе всего к вашему реальному сценарию, и в первую очередь смотрите на соответствующую суб-оценку, а не на композитный балл. Шаг 2: при сравнении моделей убедитесь, что оба балла взяты из одной версии индекса и одного сбора данных — сравнение между версиями или датами легко ввести в заблуждение. Шаг 3: относитесь к композитному баллу как к грубому фильтру, а не окончательному ответу — перед решением проведите небольшой тест на своей реальной задаче.

Что делать в QCode

Какое бы измерение индекса ни было важнее для вашего сценария, один ключ QCode подключает сразу несколько семейств моделей с высокими баллами, чтобы вы могли провести небольшое сравнение на своей реальной задаче, а не решать исключительно по одному композитному числу.

Частые вопросы

Как именно считается индекс интеллекта AA?

Это средневзвешенное девяти суб-оценок: Agents 34% (GDPval-AA v2 20% + τ³-Banking 14%), кодинг 24% (Terminal-Bench v2.1 16% + SciCode 8%), научные рассуждения 24% (HLE 12% + GPQA Diamond 6% + CritPt 6%), общие способности 18% (AA-LCR 6% + AA-Omniscience точность 8% + отсутствие галлюцинаций 4%).

Почему у одной и той же модели балл отличается от того, что я видел раньше?

Самые частые причины — обновление версии индекса (изменились веса или состав суб-оценок) или другая дата сбора данных (сама модель могла обновиться, либо изменилась среда оценки).

У двух моделей с одинаковым композитным баллом действительно равные возможности?

Не обязательно. Композитный балл — результат взвешенной суммы, так что две модели могут быть сильны и слабы в разных суб-областях и просто случайно выйти на похожий итог — их реальные профили возможностей могут сильно различаться.

Что означает pass@1?

Модели даётся одна попытка — засчитывается только если ответ верен с первого раза; большинство суб-оценок проводят несколько повторных прогонов и агрегируют результаты pass@1 в балл.

Terminal-Bench v2.1 — лишь часть суб-оценки кодинга, почему на других страницах сайта он рассматривается как самостоятельный рейтинг?

Terminal-Bench одновременно является независимым публичным рейтингом и компонентом категории кодинга в индексе AA (16 из 24 очков кодинга). Эти два взгляда не противоречат друг другу — просто разный уровень детализации.

На что ещё обратить внимание, выбирая модель по этому индексу?

Относитесь к индексу как к общему ориентиру, а не единственному критерию. Если задача конкретная, смотрите напрямую на балл соответствующей суб-оценки и подкрепите его небольшим тестом перед итоговым решением.

Источники

Девять суб-оценок индекса интеллекта AA v4.1, их веса, метод оценки (pass@1) и дата введения версии (июнь 2026) — с официальной страницы методологии Artificial Analysis. Проверено 27.08.2026.

Не решайте по одному композитному числу

Один ключ QCode подключает сразу несколько семейств моделей с высокими баллами для небольшого теста на вашей реальной задаче.

Читайте также

Разбор методологии индекса интеллекта Artificial Analysis на этой странице основан на их официальной публичной документации и не является официальной позицией QCode; конкретные веса и состав суб-оценок определяются актуальными данными официальной страницы Artificial Analysis.