Разбор бенчмарка · Индекс интеллекта AA v4.3.2 · проверено 2026-10-07

Как считается индекс интеллекта Artificial Analysis
v4.3.2: средневзвешенное 10 оценок, веса опубликованы

На 2026-10-07 актуальная версия AA Index (Artificial Analysis Intelligence Index) — v4.3.2: взвешенное среднее 10 оценок, Agents 30%, кодинг 20%, научные рассуждения 20%, общие способности 30%. Часто цитируемые 34% / 24% / 24% / 18% — это старые веса v4.1 из июня 2026 года. Если балл одной модели на разных сайтах отличается, обычно дело в версии индекса или дате сбора данных.

Обновлено 2026-10-07

Не только рейтинг: один ключ, чтобы самим протестировать Claude, GPT и китайские модели.

#Индекс интеллекта AA#v4.3.2#10 взвешенных оценок#pass@1

Четыре ключевых факта

30%

Категория Agents

AA-Briefcase v1.1 — 15%, GDPval-AA v2.1 — 10%, AutomationBench-AA — 5%; по словам Artificial Analysis, веса делают упор на агентные задачи.

20% + 20%

Кодинг и научные рассуждения

Кодинг — 20% (Terminal-Bench 4.0 10%, SciCode 10%); научные рассуждения — 20% (Humanity's Last Exam 10%, CritPt 10%). GPQA Diamond исключён из индекса в v4.2.

30%

Общие способности

AA-Omniscience 15% (точность 10% + доля ответов без галлюцинаций 5%), GDP.pdf 10%, AA-LCR v1.1 5%. В v4.1 эта категория весила всего 18%.

pass@1

Метод оценки

Terminal-Bench 4.0, SciCode, AA-LCR, HLE и CritPt оцениваются по pass@1; оценки категории Agents в основном используют Elo по попарным сравнениям жюри.

10 оценок v4.3.2 и их веса

На 2026-10-07 текущая версия индекса интеллекта AA, v4.3.2, — это взвешенное среднее 10 оценок в четырёх категориях: Agents 30% (AA-Briefcase v1.1 15%, GDPval-AA v2.1 10%, AutomationBench-AA 5%); кодинг 20% (Terminal-Bench 4.0 10%, SciCode 10%); общие способности 30% (AA-Omniscience 15%, из них точность 10% и доля ответов без галлюцинаций 5%; GDP.pdf 10%; AA-LCR v1.1 5%); научные рассуждения 20% (Humanity's Last Exam 10%, CritPt 10%). По словам Artificial Analysis, веса делают упор на агентные задачи. Способ подсчёта различается: Terminal-Bench 4.0, SciCode, AA-LCR, HLE и CritPt — pass@1; AA-Briefcase и GDPval-AA — Elo по попарным сравнениям; AutomationBench-AA — выполнение цели задачи.

Почему одна и та же модель показывает разные баллы в разных местах

Одинаковый сводный балл у двух моделей ещё не значит одинаковый профиль: разные сильные стороны могут дать одну и ту же взвешенную сумму. К тому же Artificial Analysis постоянно пересматривает индекс: в v4.1 (июнь 2026) веса были Agents 34%, кодинг 24%, научные рассуждения 24% и общие способности 18%; в сентябре 2026 вышли v4.2, v4.3, v4.3.1 и v4.3.2, и на 2026-10-07 актуальна v4.3.2 из 10 оценок. У разных версий разный состав и веса; даже в одной версии другая дата сбора данных отражает обновления модели, поэтому балл может плавать.

Хронология

Ранние версии

Artificial Analysis вводит индекс интеллекта как взвешенный композитный балл для сравнения возможностей моделей в целом.

06.2026

Вводится индекс v4.1, официально публикующий девять суб-оценок и их веса (Agents 34%, кодинг 24%, научные рассуждения 24%, общие способности 18%).

2026-09

Сентябрь 2026: выходят v4.2, v4.3, v4.3.1 и v4.3.2. В v4.2 добавлены AA-Briefcase (15%) и GDP.pdf (10%), убран GPQA Diamond; в v4.3 τ³-Banking заменён на AutomationBench-AA, а Terminal-Bench 2.1 — на Terminal-Bench 4.0. Текущие веса категорий: Agents 30%, кодинг 20%, научные рассуждения 20%, общие способности 30%.

Подтверждено vs частое заблуждение

Подтверждено

На 2026-10-07 официальная страница методологии Artificial Analysis указывает: v4.3.2 включает 10 оценок; веса категорий — Agents 30%, кодинг 20%, научные рассуждения 20%, общие способности 30%; веса отдельных оценок — AA-Briefcase 15%, GDPval-AA 10%, AutomationBench-AA 5%, Terminal-Bench 4.0 10%, SciCode 10%, AA-LCR 5%, AA-Omniscience точность 10% и доля без галлюцинаций 5%, HLE 10%, GDP.pdf 10%, CritPt 10%. В истории версий v4.1 (июнь — август 2026) указана с весами 34% / 24% / 24% / 18%. По оценке Artificial Analysis, 95-процентный доверительный интервал индекса меньше ±1%.

Частое заблуждение

Многие воспринимают сводный балл как одномерный рейтинг и сразу делают вывод «кто сильнее», но это взвешенная сумма десяти разнородных оценок: у двух моделей с близкими итогами профиль по Agents, кодингу, научным рассуждениям и общим способностям может сильно различаться. Ещё одна частая ошибка — объяснять балл v4.3.2 весами v4.1 (34% / 24% / 24% / 18%): это разные схемы весов.

Смотреть на композитный балл vs на суб-оценки

Только композитный балл

Подходит для быстрой грубой оценки уровня возможностей, но не показывает, в чём конкретно модель сильна или слаба.

Разбор по суб-оценкам

Если ваш сценарий явно тяготеет к Agents или кодингу, смотрите сразу на соответствующую оценку (например, Terminal-Bench 4.0 в категории кодинга v4.3.2) — это точнее, чем сводный балл.

Как правильно использовать этот индекс

Шаг 1: определите, какая из четырёх категорий (Agents, кодинг, научные рассуждения или общие способности) ближе к вашей задаче, и опирайтесь на её оценки, а не на сводный балл. Шаг 2: сравнивая модели, убедитесь, что оба балла взяты из одной версии индекса (на 2026-10-07 это v4.3.2) и одного сбора данных — сравнения между версиями и датами легко прочитать неверно. Шаг 3: используйте сводный балл как грубый фильтр, а перед решением проведите небольшой тест на своей реальной задаче.

Что делать в QCode

На 2026-10-07 одним ключом QCode можно вызывать claude-opus-5-5, claude-sonnet-5-5, gpt-6.1-sol, deepseek-v4-pro, glm-5.3, qwen3.8-max, kimi-k3 и другие модели — и сравнить их на своей задаче, а не выбирать по одному сводному числу. Оплата по токенам; цены каждой модели — на /models, наличие моделей тоже смотрите на /models.

Частые вопросы

Как именно считается индекс интеллекта AA?

На 2026-10-07 v4.3.2 — взвешенное среднее 10 оценок: Agents 30% (AA-Briefcase 15% + GDPval-AA 10% + AutomationBench-AA 5%), кодинг 20% (Terminal-Bench 4.0 10% + SciCode 10%), общие способности 30% (AA-Omniscience точность 10% + без галлюцинаций 5% + GDP.pdf 10% + AA-LCR 5%), научные рассуждения 20% (HLE 10% + CritPt 10%).

Почему у одной и той же модели балл отличается от того, что я видел раньше?

Самые частые причины — обновление версии индекса (изменились веса или состав суб-оценок) или другая дата сбора данных (сама модель могла обновиться, либо изменилась среда оценки).

У двух моделей с одинаковым композитным баллом действительно равные возможности?

Не обязательно. Композитный балл — результат взвешенной суммы, так что две модели могут быть сильны и слабы в разных суб-областях и просто случайно выйти на похожий итог — их реальные профили возможностей могут сильно различаться.

Что означает pass@1?

У модели одна попытка, и задача засчитывается, только если первый ответ верен. В v4.3.2 по pass@1 оцениваются Terminal-Bench 4.0, SciCode, AA-LCR, HLE и CritPt; AA-Briefcase и GDPval-AA в категории Agents используют Elo по попарным сравнениям.

Terminal-Bench — лишь часть категории кодинга. Почему другие страницы сайта разбирают его как отдельный рейтинг?

Terminal-Bench — и самостоятельный публичный рейтинг, и часть категории кодинга индекса AA: в v4.3 Terminal-Bench 2.1 заменили на Terminal-Bench 4.0, который в v4.3.2 даёт 10% итога (весь кодинг — 20%). Artificial Analysis отмечает, что Terminal-Bench 2.1 остаётся в её Coding Index. Противоречия нет — это разные уровни детализации.

На что ещё обратить внимание, выбирая модель по этому индексу?

Относитесь к индексу как к общему ориентиру, а не единственному критерию. Если задача конкретная, смотрите напрямую на балл соответствующей суб-оценки и подкрепите его небольшим тестом перед итоговым решением.

Источники

Десять оценок v4.3.2, веса категорий и отдельных оценок, способы подсчёта и история версий от v4.1 до v4.3.2 взяты с официальной страницы методологии Artificial Analysis (Intelligence Benchmarking, включая Version History) и из описания индекса на главной странице сайта. Дата сбора: 2026-10-07. Старые веса v4.1 — по той же истории версий.

Не решайте по одному композитному числу

Один ключ QCode вызывает модели Claude, GPT, DeepSeek, GLM, Qwen и Kimi — проверьте их на своей реальной задаче.

Читайте также

Этот разбор методологии индекса интеллекта Artificial Analysis основан на её официальной документации (проверено 2026-10-07) и не является официальной позицией QCode. Веса и состав оценок — по официальной странице Artificial Analysis; наличие моделей — по /models.

Сначала попробуйте, потом решайте

Не уверены, какой тариф выбрать? Начните со «Стартового» ($8.57/мес), а при апгрейде остаток старого тарифа вернётся на баланс.