Artificial Analysis 智能指数怎么算的
v4.3.2:10 项评测加权平均,权重占比全公开
截至 2026-10-07,AA 智能指数(Artificial Analysis Intelligence Index)的当前版本是 v4.3.2:10 项评测的加权平均,Agents 30%、编程 20%、科学推理 20%、通用 30%。网上常见的 Agents 34% / 编程 24% / 科学推理 24% / 通用 18% 是 2026 年 6 月 v4.1 的旧权重;同一模型在不同地方分数不一样,多半是指数版本或抓取时间不同。
更新于 2026-10-07
榜单之外,用一把 key 自己测 Claude、GPT 与国产模型。
- 按 token 计费,实时单价见 /models
- 支付宝、微信支付、信用卡、加密货币均可付款
- 充值后自助开通、立刻生效
四个关键事实
Agents 大类
AA-Briefcase v1.1 占 15%、GDPval-AA v2.1 占 10%、AutomationBench-AA 占 5%;官方称权重侧重 agentic 任务。
编程与科学推理
编程 20%(Terminal-Bench 4.0 10%、SciCode 10%);科学推理 20%(Humanity's Last Exam 10%、CritPt 10%)。GPQA Diamond 已在 v4.2 移出指数。
通用能力
AA-Omniscience 15%(准确率 10% + 非幻觉率 5%)、GDP.pdf 10%、AA-LCR v1.1 5%。v4.1 时通用只占 18%。
评分方法
Terminal-Bench 4.0、SciCode、AA-LCR、HLE、CritPt 按 pass@1 计分;Agents 大类主要用评审团两两比较得出的 Elo。
v4.3.2 的 10 项评测与权重全表
截至 2026-10-07,AA 智能指数当前版本 v4.3.2 是 10 项评测的加权平均,分四大类:Agents 30%(AA-Briefcase v1.1 15%、GDPval-AA v2.1 10%、AutomationBench-AA 5%);编程 20%(Terminal-Bench 4.0 10%、SciCode 10%);通用 30%(AA-Omniscience 15%,其中准确率 10%、非幻觉率 5%;GDP.pdf 10%;AA-LCR v1.1 5%);科学推理 20%(Humanity's Last Exam 10%、CritPt 10%)。官方称权重侧重 agentic 任务。计分方式并不统一:Terminal-Bench 4.0、SciCode、AA-LCR、HLE、CritPt 按 pass@1;AA-Briefcase 与 GDPval-AA 用两两比较得出的 Elo;AutomationBench-AA 按目标完成度计分。
为什么同一模型在不同地方看到的分数不一样
两个模型综合分相同,不代表能力画像相同——它们可能是完全不同的能力组合,恰好加权求和后数字一样。另外,Artificial Analysis 会持续修订指数版本:2026 年 6 月的 v4.1 权重是 Agents 34%、编程 24%、科学推理 24%、通用 18%;2026 年 9 月陆续出了 v4.2、v4.3、v4.3.1、v4.3.2,截至 2026-10-07 当前是 10 项评测的 v4.3.2。不同版本的子测试与权重不同;即使版本相同,抓取时间不同、模型本身有更新,同一个模型的分数也会波动。
时间线
Artificial Analysis 推出智能指数,作为跨模型综合能力对比的加权评分体系。
引入指数 v4.1,明确公开九项子测试及各自权重占比(Agents 34%、编程 24%、科学推理 24%、通用 18%)。
2026 年 9 月官方连出 v4.2、v4.3、v4.3.1、v4.3.2:v4.2 加入 AA-Briefcase(15%)与 GDP.pdf(10%)、移除 GPQA Diamond;v4.3 用 AutomationBench-AA 替换 τ³-Banking、用 Terminal-Bench 4.0 替换 Terminal-Bench 2.1。当前大类权重为 Agents 30%、编程 20%、科学推理 20%、通用 30%。
已确认 vs 常见误解
已确认
截至 2026-10-07,Artificial Analysis 官方方法论页写明:v4.3.2 收录 10 项评测;四大类权重为 Agents 30%、编程 20%、科学推理 20%、通用 30%;单项权重为 AA-Briefcase 15%、GDPval-AA 10%、AutomationBench-AA 5%、Terminal-Bench 4.0 10%、SciCode 10%、AA-LCR 5%、AA-Omniscience 准确率 10% 与非幻觉率 5%、HLE 10%、GDP.pdf 10%、CritPt 10%。版本记录里 v4.1(2026 年 6 月至 8 月)的大类权重是 34% / 24% / 24% / 18%。官方称指数的 95% 置信区间小于 ±1%。
常见误解
很多人把综合分当成单一维度的能力排序,直接拿来说「谁比谁强」——但综合分是十项异质评测加权求和的结果,两个分数接近的模型,在 Agents、编程、科学推理、通用上的强弱分布可能完全不同。另一个常见误读是拿 v4.1 的权重(34% / 24% / 24% / 18%)去解释 v4.3.2 的分数,两套权重并不相同。
看综合分 vs 看分项
只看综合分
适合快速筛选一个大致的能力档位,但看不出模型具体强在哪、弱在哪。
拆开看分项
如果你的场景明确偏 Agents 或偏编程,直接看对应子测试(比如 v4.3.2 编程大类里的 Terminal-Bench 4.0)比看综合分更有针对性。
怎么正确使用这份指数
第一步,明确自己的场景更接近四大类里的哪一类(Agents、编程、科学推理还是通用),优先参考对应的子测试分数而不是综合分。第二步,比较模型时确认双方来自同一个指数版本(截至 2026-10-07 是 v4.3.2)、同一次数据抓取——跨版本、跨时间点的对比容易产生误导。第三步,把综合分当成粗筛工具而不是最终结论,具体决策前结合实际任务做一次小规模实测。
在 QCode 上怎么办
截至 2026-10-07,QCode 一把 key 可调 claude-opus-5-5、claude-sonnet-5-5、gpt-6.1-sol、deepseek-v4-pro、glm-5.3、qwen3.8-max、kimi-k3 等模型,可以用自己的任务在同一把 key 下做小规模对比,而不是只看一个综合分。按 token 计费,各模型单价见 /models,模型可用性以 /models 为准。
常见问题
AA 智能指数具体怎么算出来的?
截至 2026-10-07 的 v4.3.2 是 10 项评测的加权平均:Agents 30%(AA-Briefcase 15% + GDPval-AA 10% + AutomationBench-AA 5%)、编程 20%(Terminal-Bench 4.0 10% + SciCode 10%)、通用 30%(AA-Omniscience 准确率 10% + 非幻觉率 5% + GDP.pdf 10% + AA-LCR 5%)、科学推理 20%(HLE 10% + CritPt 10%)。
为什么同一个模型,我这次看到的分和上次不一样?
最常见的原因是指数版本升级(权重或子测试构成变了)或者数据抓取时间点不同(模型本身可能有过更新,测试环境也可能调整)。
综合分相同的两个模型,实力真的一样吗?
不一定。综合分是加权求和的结果,两个模型完全可能在不同子项上各有强弱,只是加权后数字凑巧接近,具体能力画像可能差异很大。
pass@1 是什么意思?
指模型只给一次回答机会,第一次就要答对才算通过。v4.3.2 里 Terminal-Bench 4.0、SciCode、AA-LCR、HLE、CritPt 这几项按 pass@1 计分;Agents 大类的 AA-Briefcase 与 GDPval-AA 用两两比较的 Elo,不是 pass@1。
Terminal-Bench 只是编程大类的一部分,为什么站内其它页把它当独立榜单讲?
Terminal-Bench 既是独立的公开榜单,也是 AA 智能指数编程大类的组成部分:v4.3 起用 Terminal-Bench 4.0 替换了 Terminal-Bench 2.1,在 v4.3.2 里占总分 10%(编程大类共 20%)。官方写明 Terminal-Bench 2.1 仍保留在其 Coding Index 里。两种视角并不矛盾,只是分析粒度不同。
看这份指数选模型,还需要注意什么?
指数是综合参考,不是唯一依据;如果你的任务场景很具体,建议直接看对应子测试的分数,并结合小规模实测再做最终决定。
信息来源
当前版本 v4.3.2 的 10 项评测、大类与单项权重、计分方式,以及 v4.1 到 v4.3.2 的版本记录,均来自 Artificial Analysis 官方方法论页(Intelligence Benchmarking,含 Version History)与官网首页的指数说明,抓取日期 2026-10-07。v4.1 的历史权重同样以该页版本记录为准。
相关阅读
Terminal-Bench 3.0 完整解读
Terminal-Bench 系列 3.0 版的详细解读;AA 指数 v4.3 起编程大类改用 Terminal-Bench 4.0。
AI 模型雷达 2026
站内自建的模型综合对比,可以和 AA 指数对照看。
SWE-bench Pro 2026 排行榜
另一个专注编程能力的头部榜单。
本页对 Artificial Analysis 智能指数方法论的解读基于其官方公开说明,核对日期 2026-10-07,不代表 QCode 官方立场;权重与子测试构成以 Artificial Analysis 官方页面为准;模型可用性以 /models 为准。