Как считается индекс интеллекта Artificial Analysis
v4.3.2: средневзвешенное 10 оценок, веса опубликованы
На 2026-10-07 актуальная версия AA Index (Artificial Analysis Intelligence Index) — v4.3.2: взвешенное среднее 10 оценок, Agents 30%, кодинг 20%, научные рассуждения 20%, общие способности 30%. Часто цитируемые 34% / 24% / 24% / 18% — это старые веса v4.1 из июня 2026 года. Если балл одной модели на разных сайтах отличается, обычно дело в версии индекса или дате сбора данных.
Обновлено 2026-10-07
Не только рейтинг: один ключ, чтобы самим протестировать Claude, GPT и китайские модели.
- Оплата по токенам — актуальные цены на /models
- Оплата через СБП, российскими картами, картами Visa / Mastercard / AMEX или криптовалютой
- Самообслуживание: после пополнения тариф активируется мгновенно
Четыре ключевых факта
Категория Agents
AA-Briefcase v1.1 — 15%, GDPval-AA v2.1 — 10%, AutomationBench-AA — 5%; по словам Artificial Analysis, веса делают упор на агентные задачи.
Кодинг и научные рассуждения
Кодинг — 20% (Terminal-Bench 4.0 10%, SciCode 10%); научные рассуждения — 20% (Humanity's Last Exam 10%, CritPt 10%). GPQA Diamond исключён из индекса в v4.2.
Общие способности
AA-Omniscience 15% (точность 10% + доля ответов без галлюцинаций 5%), GDP.pdf 10%, AA-LCR v1.1 5%. В v4.1 эта категория весила всего 18%.
Метод оценки
Terminal-Bench 4.0, SciCode, AA-LCR, HLE и CritPt оцениваются по pass@1; оценки категории Agents в основном используют Elo по попарным сравнениям жюри.
10 оценок v4.3.2 и их веса
На 2026-10-07 текущая версия индекса интеллекта AA, v4.3.2, — это взвешенное среднее 10 оценок в четырёх категориях: Agents 30% (AA-Briefcase v1.1 15%, GDPval-AA v2.1 10%, AutomationBench-AA 5%); кодинг 20% (Terminal-Bench 4.0 10%, SciCode 10%); общие способности 30% (AA-Omniscience 15%, из них точность 10% и доля ответов без галлюцинаций 5%; GDP.pdf 10%; AA-LCR v1.1 5%); научные рассуждения 20% (Humanity's Last Exam 10%, CritPt 10%). По словам Artificial Analysis, веса делают упор на агентные задачи. Способ подсчёта различается: Terminal-Bench 4.0, SciCode, AA-LCR, HLE и CritPt — pass@1; AA-Briefcase и GDPval-AA — Elo по попарным сравнениям; AutomationBench-AA — выполнение цели задачи.
Почему одна и та же модель показывает разные баллы в разных местах
Одинаковый сводный балл у двух моделей ещё не значит одинаковый профиль: разные сильные стороны могут дать одну и ту же взвешенную сумму. К тому же Artificial Analysis постоянно пересматривает индекс: в v4.1 (июнь 2026) веса были Agents 34%, кодинг 24%, научные рассуждения 24% и общие способности 18%; в сентябре 2026 вышли v4.2, v4.3, v4.3.1 и v4.3.2, и на 2026-10-07 актуальна v4.3.2 из 10 оценок. У разных версий разный состав и веса; даже в одной версии другая дата сбора данных отражает обновления модели, поэтому балл может плавать.
Хронология
Artificial Analysis вводит индекс интеллекта как взвешенный композитный балл для сравнения возможностей моделей в целом.
Вводится индекс v4.1, официально публикующий девять суб-оценок и их веса (Agents 34%, кодинг 24%, научные рассуждения 24%, общие способности 18%).
Сентябрь 2026: выходят v4.2, v4.3, v4.3.1 и v4.3.2. В v4.2 добавлены AA-Briefcase (15%) и GDP.pdf (10%), убран GPQA Diamond; в v4.3 τ³-Banking заменён на AutomationBench-AA, а Terminal-Bench 2.1 — на Terminal-Bench 4.0. Текущие веса категорий: Agents 30%, кодинг 20%, научные рассуждения 20%, общие способности 30%.
Подтверждено vs частое заблуждение
Подтверждено
На 2026-10-07 официальная страница методологии Artificial Analysis указывает: v4.3.2 включает 10 оценок; веса категорий — Agents 30%, кодинг 20%, научные рассуждения 20%, общие способности 30%; веса отдельных оценок — AA-Briefcase 15%, GDPval-AA 10%, AutomationBench-AA 5%, Terminal-Bench 4.0 10%, SciCode 10%, AA-LCR 5%, AA-Omniscience точность 10% и доля без галлюцинаций 5%, HLE 10%, GDP.pdf 10%, CritPt 10%. В истории версий v4.1 (июнь — август 2026) указана с весами 34% / 24% / 24% / 18%. По оценке Artificial Analysis, 95-процентный доверительный интервал индекса меньше ±1%.
Частое заблуждение
Многие воспринимают сводный балл как одномерный рейтинг и сразу делают вывод «кто сильнее», но это взвешенная сумма десяти разнородных оценок: у двух моделей с близкими итогами профиль по Agents, кодингу, научным рассуждениям и общим способностям может сильно различаться. Ещё одна частая ошибка — объяснять балл v4.3.2 весами v4.1 (34% / 24% / 24% / 18%): это разные схемы весов.
Смотреть на композитный балл vs на суб-оценки
Только композитный балл
Подходит для быстрой грубой оценки уровня возможностей, но не показывает, в чём конкретно модель сильна или слаба.
Разбор по суб-оценкам
Если ваш сценарий явно тяготеет к Agents или кодингу, смотрите сразу на соответствующую оценку (например, Terminal-Bench 4.0 в категории кодинга v4.3.2) — это точнее, чем сводный балл.
Как правильно использовать этот индекс
Шаг 1: определите, какая из четырёх категорий (Agents, кодинг, научные рассуждения или общие способности) ближе к вашей задаче, и опирайтесь на её оценки, а не на сводный балл. Шаг 2: сравнивая модели, убедитесь, что оба балла взяты из одной версии индекса (на 2026-10-07 это v4.3.2) и одного сбора данных — сравнения между версиями и датами легко прочитать неверно. Шаг 3: используйте сводный балл как грубый фильтр, а перед решением проведите небольшой тест на своей реальной задаче.
Что делать в QCode
На 2026-10-07 одним ключом QCode можно вызывать claude-opus-5-5, claude-sonnet-5-5, gpt-6.1-sol, deepseek-v4-pro, glm-5.3, qwen3.8-max, kimi-k3 и другие модели — и сравнить их на своей задаче, а не выбирать по одному сводному числу. Оплата по токенам; цены каждой модели — на /models, наличие моделей тоже смотрите на /models.
Частые вопросы
Как именно считается индекс интеллекта AA?
На 2026-10-07 v4.3.2 — взвешенное среднее 10 оценок: Agents 30% (AA-Briefcase 15% + GDPval-AA 10% + AutomationBench-AA 5%), кодинг 20% (Terminal-Bench 4.0 10% + SciCode 10%), общие способности 30% (AA-Omniscience точность 10% + без галлюцинаций 5% + GDP.pdf 10% + AA-LCR 5%), научные рассуждения 20% (HLE 10% + CritPt 10%).
Почему у одной и той же модели балл отличается от того, что я видел раньше?
Самые частые причины — обновление версии индекса (изменились веса или состав суб-оценок) или другая дата сбора данных (сама модель могла обновиться, либо изменилась среда оценки).
У двух моделей с одинаковым композитным баллом действительно равные возможности?
Не обязательно. Композитный балл — результат взвешенной суммы, так что две модели могут быть сильны и слабы в разных суб-областях и просто случайно выйти на похожий итог — их реальные профили возможностей могут сильно различаться.
Что означает pass@1?
У модели одна попытка, и задача засчитывается, только если первый ответ верен. В v4.3.2 по pass@1 оцениваются Terminal-Bench 4.0, SciCode, AA-LCR, HLE и CritPt; AA-Briefcase и GDPval-AA в категории Agents используют Elo по попарным сравнениям.
Terminal-Bench — лишь часть категории кодинга. Почему другие страницы сайта разбирают его как отдельный рейтинг?
Terminal-Bench — и самостоятельный публичный рейтинг, и часть категории кодинга индекса AA: в v4.3 Terminal-Bench 2.1 заменили на Terminal-Bench 4.0, который в v4.3.2 даёт 10% итога (весь кодинг — 20%). Artificial Analysis отмечает, что Terminal-Bench 2.1 остаётся в её Coding Index. Противоречия нет — это разные уровни детализации.
На что ещё обратить внимание, выбирая модель по этому индексу?
Относитесь к индексу как к общему ориентиру, а не единственному критерию. Если задача конкретная, смотрите напрямую на балл соответствующей суб-оценки и подкрепите его небольшим тестом перед итоговым решением.
Источники
Десять оценок v4.3.2, веса категорий и отдельных оценок, способы подсчёта и история версий от v4.1 до v4.3.2 взяты с официальной страницы методологии Artificial Analysis (Intelligence Benchmarking, включая Version History) и из описания индекса на главной странице сайта. Дата сбора: 2026-10-07. Старые веса v4.1 — по той же истории версий.
Не решайте по одному композитному числу
Один ключ QCode вызывает модели Claude, GPT, DeepSeek, GLM, Qwen и Kimi — проверьте их на своей реальной задаче.
Читайте также
Terminal-Bench 3.0: полный разбор
Подробный разбор Terminal-Bench 3.0; с v4.3 категория кодинга индекса AA использует Terminal-Bench 4.0.
Радар AI-моделей 2026
Наше собственное составное сравнение моделей — полезно сверить с индексом AA.
Рейтинг SWE-bench Pro 2026
Ещё один ведущий рейтинг, сфокусированный на кодинге.
Этот разбор методологии индекса интеллекта Artificial Analysis основан на её официальной документации (проверено 2026-10-07) и не является официальной позицией QCode. Веса и состав оценок — по официальной странице Artificial Analysis; наличие моделей — по /models.