Artificial Analysis 知能指数はどう計算されるか
v4.3.2:10 項目の加重平均、重み配分は公開されている
2026-10-07 時点で、AA Index(Artificial Analysis Intelligence Index)の現行版は v4.3.2 です。10 項目の加重平均で、Agents 30%、コーディング 20%、科学的推論 20%、汎用 30%。よく引用される 34% / 24% / 24% / 18% は 2026 年 6 月の v4.1 の旧配分です。同じモデルのスコアがサイトごとに違うのは、多くの場合、指数のバージョンかデータ取得時期の違いによるものです。
更新日 2026-10-07
ランキングの先へ。1 キーで Claude・GPT・中国系モデルを自分で計測。
- トークン従量課金・最新単価は /models
- カード(Visa / Mastercard / AMEX)・Apple Pay・Google Pay・暗号資産で支払い可能
- チャージ後すぐにセルフサービスで開通
4つの重要事実
Agents カテゴリ
AA-Briefcase v1.1 が 15%、GDPval-AA v2.1 が 10%、AutomationBench-AA が 5%。公式はエージェント型タスクを重視した配分だとしています。
コーディングと科学的推論
コーディング 20%(Terminal-Bench 4.0 10%、SciCode 10%)、科学的推論 20%(Humanity's Last Exam 10%、CritPt 10%)。GPQA Diamond は v4.2 で指数から外れました。
汎用カテゴリ
AA-Omniscience 15%(正答率 10% + 非ハルシネーション率 5%)、GDP.pdf 10%、AA-LCR v1.1 5%。v4.1 では汎用は 18% でした。
採点方法
Terminal-Bench 4.0、SciCode、AA-LCR、HLE、CritPt は pass@1 で採点。Agents の評価は主に審査パネルによる一対比較の Elo を使います。
v4.3.2 の10項目と重み一覧
2026-10-07 時点の現行版 AA 知能指数 v4.3.2 は、4 カテゴリ 10 項目の加重平均です。Agents 30%(AA-Briefcase v1.1 15%、GDPval-AA v2.1 10%、AutomationBench-AA 5%)、コーディング 20%(Terminal-Bench 4.0 10%、SciCode 10%)、汎用 30%(AA-Omniscience 15%、うち正答率 10% と非ハルシネーション率 5%、GDP.pdf 10%、AA-LCR v1.1 5%)、科学的推論 20%(Humanity's Last Exam 10%、CritPt 10%)。公式はエージェント型タスクを重視した配分だとしています。採点方法は項目ごとに異なり、Terminal-Bench 4.0、SciCode、AA-LCR、HLE、CritPt は pass@1、AA-Briefcase と GDPval-AA は一対比較の Elo、AutomationBench-AA は目標の達成度で採点します。
なぜ同じモデルのスコアが場所によって違って見えるのか
総合スコアが同じ 2 つのモデルでも、能力の内訳が同じとは限りません。異なる強みの組み合わせが、加重合計でたまたま同じ数字になることがあります。さらに Artificial Analysis は指数を継続的に改訂しています。2026 年 6 月の v4.1 は Agents 34%、コーディング 24%、科学的推論 24%、汎用 18% でした。2026 年 9 月に v4.2、v4.3、v4.3.1、v4.3.2 が続き、2026-10-07 時点の現行版は 10 項目の v4.3.2 です。バージョンが違えば項目も重みも違い、同じバージョンでもデータ取得時期が違えばモデル自体の更新が反映され、スコアは揺れます。
タイムライン
Artificial Analysis が、モデル横断の総合能力比較のための加重総合スコアとして知能指数を導入。
指数 v4.1 が導入され、9つのサブ評価とそれぞれの重み配分(Agents 34%、コーディング24%、科学的推論24%、汎用18%)が公式に明示された。
2026 年 9 月、v4.2、v4.3、v4.3.1、v4.3.2 が相次いで公開。v4.2 で AA-Briefcase(15%)と GDP.pdf(10%)を追加して GPQA Diamond を除外し、v4.3 で τ³-Banking を AutomationBench-AA に、Terminal-Bench 2.1 を Terminal-Bench 4.0 に置き換えました。現在のカテゴリ配分は Agents 30%、コーディング 20%、科学的推論 20%、汎用 30%。
確認済み vs よくある誤解
確認済み
2026-10-07 時点で、Artificial Analysis 公式の方法論ページには次のように書かれています。v4.3.2 は 10 項目で構成、カテゴリ配分は Agents 30%、コーディング 20%、科学的推論 20%、汎用 30%。項目別の重みは AA-Briefcase 15%、GDPval-AA 10%、AutomationBench-AA 5%、Terminal-Bench 4.0 10%、SciCode 10%、AA-LCR 5%、AA-Omniscience 正答率 10% と非ハルシネーション率 5%、HLE 10%、GDP.pdf 10%、CritPt 10%。バージョン履歴では v4.1(2026 年 6 月〜8 月)が 34% / 24% / 24% / 18%。公式は指数の 95% 信頼区間を ±1% 未満と見積もっています。
よくある誤解
総合スコアを一次元の能力ランキングとみなし、「どちらが強いか」をそのまま語る人は多いですが、総合スコアは性質の異なる 10 項目の加重合計です。合計が近い 2 つのモデルでも、Agents、コーディング、科学的推論、汎用での強弱は大きく違うことがあります。もう一つよくある誤読は、v4.1 の重み(34% / 24% / 24% / 18%)で v4.3.2 のスコアを解釈することです。2 つの配分は同じではありません。
総合スコアを見る vs 内訳を見る
総合スコアだけを見る
おおまかな能力の階層を素早く把握するのには向いているが、モデルが具体的にどこで強くどこで弱いかは分からない。
内訳に分解して見る
用途が Agents やコーディングに大きく寄っているなら、総合スコアよりも該当する項目(たとえば v4.3.2 のコーディングカテゴリにある Terminal-Bench 4.0)を直接見るほうが的確です。
この指数を正しく使う方法
ステップ 1:自分の用途が 4 カテゴリ(Agents、コーディング、科学的推論、汎用)のどれに近いかを決め、総合スコアより該当項目のスコアを優先します。ステップ 2:モデルを比べるときは、両者が同じ指数バージョン(2026-10-07 時点では v4.3.2)・同じデータ取得のものか確かめます。バージョンや時期をまたいだ比較は誤解を招きやすいです。ステップ 3:総合スコアは大まかな絞り込みに使い、最終判断の前に実際のタスクで小規模なテストを行います。
QCode 上での対処法
2026-10-07 時点で、QCode の 1 つのキーで claude-opus-5-5、claude-sonnet-5-5、gpt-6.1-sol、deepseek-v4-pro、glm-5.3、qwen3.8-max、kimi-k3 などを呼び出せます。総合スコア 1 つで決めず、自分のタスクで小規模に比べられます。課金はトークン単位で、各モデルの単価とモデルの提供状況は /models でご確認ください。
よくある質問
AA 知能指数は具体的にどう計算されますか?
2026-10-07 時点の v4.3.2 は 10 項目の加重平均です。Agents 30%(AA-Briefcase 15% + GDPval-AA 10% + AutomationBench-AA 5%)、コーディング 20%(Terminal-Bench 4.0 10% + SciCode 10%)、汎用 30%(AA-Omniscience 正答率 10% + 非ハルシネーション率 5% + GDP.pdf 10% + AA-LCR 5%)、科学的推論 20%(HLE 10% + CritPt 10%)。
同じモデルなのに、前回見たスコアと違うのはなぜですか?
最も多い理由は指数バージョンのアップグレード(重みやサブ評価構成の変更)や、データ取得時点の違い(モデル自体が更新されていたり、評価環境が調整されていたりする)だ。
総合スコアが同じ2つのモデルは、実力も本当に同じですか?
必ずしもそうではない。総合スコアは加重合計の結果であり、2つのモデルがそれぞれ異なるサブ項目で強み・弱みを持ちながら、加重後にたまたま近い数字になっているだけということも十分あり得る。実際の能力プロファイルは大きく異なる場合がある。
pass@1 とは何ですか?
回答のチャンスは 1 回だけで、最初の試行で正解したときだけ合格とする方式です。v4.3.2 では Terminal-Bench 4.0、SciCode、AA-LCR、HLE、CritPt が pass@1 で採点され、Agents カテゴリの AA-Briefcase と GDPval-AA は一対比較の Elo を使います。
Terminal-Bench はコーディングカテゴリの一部にすぎないのに、なぜ当サイトの他ページでは独立したランキングとして扱うのですか?
Terminal-Bench は独立した公開ランキングであると同時に、AA 知能指数のコーディングカテゴリの構成要素でもあります。v4.3 で Terminal-Bench 2.1 が Terminal-Bench 4.0 に置き換えられ、v4.3.2 では総合の 10%(コーディング全体は 20%)を占めます。公式によれば Terminal-Bench 2.1 は同社の Coding Index には残っています。2 つの見方は矛盾せず、分析の粒度が違うだけです。
この指数を見てモデルを選ぶ際、他に注意すべきことはありますか?
指数はあくまで総合的な参考であり、唯一の判断材料ではない。タスクが具体的なら、対応するサブ評価のスコアを直接見て、小規模な実測と組み合わせて最終判断することを勧める。
情報源
v4.3.2 の 10 項目、カテゴリ別と項目別の重み、採点方法、v4.1 から v4.3.2 までのバージョン履歴は、Artificial Analysis 公式の方法論ページ(Intelligence Benchmarking、Version History を含む)と公式トップページの指数の記載によります。取得日 2026-10-07。v4.1 の旧配分も同じバージョン履歴に基づきます。
関連記事
Terminal-Bench 3.0 完全解説
Terminal-Bench シリーズ 3.0 版の詳細な解説。AA 指数は v4.3 からコーディングカテゴリに Terminal-Bench 4.0 を使っています。
AI モデルレーダー 2026
サイト独自のモデル総合比較。AA 指数と照らし合わせて見られる。
SWE-bench Pro 2026 ランキング
コーディング能力に特化したもう1つの主要榜単。
本ページは Artificial Analysis 知能指数の方法論を公式の公開情報に基づいて解説したもので(確認日 2026-10-07)、QCode の公式見解ではありません。重みと評価項目の構成は Artificial Analysis 公式ページが優先し、モデルの提供状況は /models をご確認ください。