Как считается индекс интеллекта Artificial Analysis
Средневзвешенное 9 тестов, веса опубликованы
Индекс интеллекта AA — это средневзвешенное 9 суб-оценок: Agents — 34%, кодинг и научные рассуждения — по 24%, общие способности — 18%; если одна и та же модель показывает разные баллы в разных рейтингах или в разное время, дело обычно в версии индекса или дате сбора данных, а не в самой модели.
Четыре ключевых факта
Agents несёт наибольший вес
Среди 9 суб-оценок категория Agents имеет наибольшую долю, разделённую на GDPval-AA v2 (20%) и τ³-Banking (14%).
Кодинг и научные рассуждения делят второе место
Кодинг — 24% (Terminal-Bench v2.1 — 16%, SciCode — 8%); научные рассуждения тоже 24% (Humanity's Last Exam — 12%, GPQA Diamond и CritPt — по 6%).
Общие способности несут наименьший вес
Общие способности — 18% (AA-LCR — 6%, AA-Omniscience даёт 8% точности плюс 4% за отсутствие галлюцинаций).
Метод оценки
Большинство суб-оценок используют pass@1 (правильно с первой попытки), агрегированное по нескольким повторным прогонам.
Полная таблица 9 суб-оценок и их весов
Индекс интеллекта AA v4.1 — это средневзвешенное девяти оценок: Agents — 34% (GDPval-AA v2 — 20%, τ³-Banking — 14%); кодинг — 24% (Terminal-Bench v2.1 — 16%, SciCode — 8%); научные рассуждения — 24% (Humanity's Last Exam — 12%, GPQA Diamond — 6%, CritPt — 6%); общие способности — 18% (AA-LCR — 6%, AA-Omniscience даёт 8% точности и 4% за отсутствие галлюцинаций). Оценка в основном идёт по pass@1 — модель должна ответить верно с первой попытки, результат агрегируется по нескольким повторным прогонам.
Почему одна и та же модель показывает разные баллы в разных местах
Две модели с одинаковым композитным баллом не обязательно имеют одинаковый профиль возможностей — это могут быть совершенно разные комбинации сильных сторон, которые случайно дали одинаковую взвешенную сумму. Кроме того, Artificial Analysis постоянно пересматривает версию индекса (сейчас v4.1, введена в июне 2026) и состав суб-оценок, и разные версии несут разные веса; даже при одной версии разные даты сбора данных отражают обновления самой модели и изменения в среде оценки, так что балл одной и той же модели может «плавать».
Хронология
Artificial Analysis вводит индекс интеллекта как взвешенный композитный балл для сравнения возможностей моделей в целом.
Вводится индекс v4.1, официально публикующий девять суб-оценок и их веса (Agents 34%, кодинг 24%, научные рассуждения 24%, общие способности 18%).
Состав суб-оценок и веса корректируются от версии к версии, поэтому баллы с разных дат сбора данных могут не совпадать полностью.
Подтверждено vs частое заблуждение
Подтверждено
Девять суб-оценок индекса интеллекта AA v4.1 и их веса (Agents 34%, кодинг 24%, научные рассуждения 24%, общие способности 18%, и их внутренние доли) публично задокументированы на официальной странице методологии Artificial Analysis; оценка в основном идёт по pass@1.
Частое заблуждение
Многие воспринимают композитный балл как ранжирование по одному измерению возможностей и напрямую заявляют «эта модель лучше той». Но композитный балл — результат взвешенной суммы девяти разнородных оценок; у двух моделей с близкими итоговыми баллами профиль сильных сторон в Agents, кодинге и научных рассуждениях может сильно различаться — судить только по итоговому баллу легко ошибочно.
Смотреть на композитный балл vs на суб-оценки
Только композитный балл
Подходит для быстрой грубой оценки уровня возможностей, но не показывает, в чём конкретно модель сильна или слаба.
Разбор по суб-оценкам
Если ваш сценарий явно тяготеет к Agents или кодингу, смотреть напрямую на соответствующую суб-оценку (например, компонент Terminal-Bench v2.1) точнее, чем на композитный балл.
Как правильно использовать этот индекс
Шаг 1: определите, какая из девяти категорий (Agents, кодинг, научные рассуждения или общие способности) ближе всего к вашему реальному сценарию, и в первую очередь смотрите на соответствующую суб-оценку, а не на композитный балл. Шаг 2: при сравнении моделей убедитесь, что оба балла взяты из одной версии индекса и одного сбора данных — сравнение между версиями или датами легко ввести в заблуждение. Шаг 3: относитесь к композитному баллу как к грубому фильтру, а не окончательному ответу — перед решением проведите небольшой тест на своей реальной задаче.
Что делать в QCode
Какое бы измерение индекса ни было важнее для вашего сценария, один ключ QCode подключает сразу несколько семейств моделей с высокими баллами, чтобы вы могли провести небольшое сравнение на своей реальной задаче, а не решать исключительно по одному композитному числу.
Частые вопросы
Как именно считается индекс интеллекта AA?
Это средневзвешенное девяти суб-оценок: Agents 34% (GDPval-AA v2 20% + τ³-Banking 14%), кодинг 24% (Terminal-Bench v2.1 16% + SciCode 8%), научные рассуждения 24% (HLE 12% + GPQA Diamond 6% + CritPt 6%), общие способности 18% (AA-LCR 6% + AA-Omniscience точность 8% + отсутствие галлюцинаций 4%).
Почему у одной и той же модели балл отличается от того, что я видел раньше?
Самые частые причины — обновление версии индекса (изменились веса или состав суб-оценок) или другая дата сбора данных (сама модель могла обновиться, либо изменилась среда оценки).
У двух моделей с одинаковым композитным баллом действительно равные возможности?
Не обязательно. Композитный балл — результат взвешенной суммы, так что две модели могут быть сильны и слабы в разных суб-областях и просто случайно выйти на похожий итог — их реальные профили возможностей могут сильно различаться.
Что означает pass@1?
Модели даётся одна попытка — засчитывается только если ответ верен с первого раза; большинство суб-оценок проводят несколько повторных прогонов и агрегируют результаты pass@1 в балл.
Terminal-Bench v2.1 — лишь часть суб-оценки кодинга, почему на других страницах сайта он рассматривается как самостоятельный рейтинг?
Terminal-Bench одновременно является независимым публичным рейтингом и компонентом категории кодинга в индексе AA (16 из 24 очков кодинга). Эти два взгляда не противоречат друг другу — просто разный уровень детализации.
На что ещё обратить внимание, выбирая модель по этому индексу?
Относитесь к индексу как к общему ориентиру, а не единственному критерию. Если задача конкретная, смотрите напрямую на балл соответствующей суб-оценки и подкрепите его небольшим тестом перед итоговым решением.
Источники
Девять суб-оценок индекса интеллекта AA v4.1, их веса, метод оценки (pass@1) и дата введения версии (июнь 2026) — с официальной страницы методологии Artificial Analysis. Проверено 27.08.2026.
Не решайте по одному композитному числу
Один ключ QCode подключает сразу несколько семейств моделей с высокими баллами для небольшого теста на вашей реальной задаче.
Читайте также
Terminal-Bench 3.0: полный разбор
Последняя версия серии Terminal-Bench, на которую ссылается компонент кодинга индекса AA.
Радар AI-моделей 2026
Наше собственное составное сравнение моделей — полезно сверить с индексом AA.
Рейтинг SWE-bench Pro 2026
Ещё один ведущий рейтинг, сфокусированный на кодинге.
Разбор методологии индекса интеллекта Artificial Analysis на этой странице основан на их официальной публичной документации и не является официальной позицией QCode; конкретные веса и состав суб-оценок определяются актуальными данными официальной страницы Artificial Analysis.