榜单解读 · AA 智能指数 v4.3.2 · 2026-10-07 核

Artificial Analysis 智能指数怎么算的
v4.3.2:10 项评测加权平均,权重占比全公开

截至 2026-10-07,AA 智能指数(Artificial Analysis Intelligence Index)的当前版本是 v4.3.2:10 项评测的加权平均,Agents 30%、编程 20%、科学推理 20%、通用 30%。网上常见的 Agents 34% / 编程 24% / 科学推理 24% / 通用 18% 是 2026 年 6 月 v4.1 的旧权重;同一模型在不同地方分数不一样,多半是指数版本或抓取时间不同。

更新于 2026-10-07

榜单之外,用一把 key 自己测 Claude、GPT 与国产模型。

#AA 智能指数#v4.3.2#10 项加权#pass@1

四个关键事实

30%

Agents 大类

AA-Briefcase v1.1 占 15%、GDPval-AA v2.1 占 10%、AutomationBench-AA 占 5%;官方称权重侧重 agentic 任务。

20% + 20%

编程与科学推理

编程 20%(Terminal-Bench 4.0 10%、SciCode 10%);科学推理 20%(Humanity's Last Exam 10%、CritPt 10%)。GPQA Diamond 已在 v4.2 移出指数。

30%

通用能力

AA-Omniscience 15%(准确率 10% + 非幻觉率 5%)、GDP.pdf 10%、AA-LCR v1.1 5%。v4.1 时通用只占 18%。

pass@1

评分方法

Terminal-Bench 4.0、SciCode、AA-LCR、HLE、CritPt 按 pass@1 计分;Agents 大类主要用评审团两两比较得出的 Elo。

v4.3.2 的 10 项评测与权重全表

截至 2026-10-07,AA 智能指数当前版本 v4.3.2 是 10 项评测的加权平均,分四大类:Agents 30%(AA-Briefcase v1.1 15%、GDPval-AA v2.1 10%、AutomationBench-AA 5%);编程 20%(Terminal-Bench 4.0 10%、SciCode 10%);通用 30%(AA-Omniscience 15%,其中准确率 10%、非幻觉率 5%;GDP.pdf 10%;AA-LCR v1.1 5%);科学推理 20%(Humanity's Last Exam 10%、CritPt 10%)。官方称权重侧重 agentic 任务。计分方式并不统一:Terminal-Bench 4.0、SciCode、AA-LCR、HLE、CritPt 按 pass@1;AA-Briefcase 与 GDPval-AA 用两两比较得出的 Elo;AutomationBench-AA 按目标完成度计分。

为什么同一模型在不同地方看到的分数不一样

两个模型综合分相同,不代表能力画像相同——它们可能是完全不同的能力组合,恰好加权求和后数字一样。另外,Artificial Analysis 会持续修订指数版本:2026 年 6 月的 v4.1 权重是 Agents 34%、编程 24%、科学推理 24%、通用 18%;2026 年 9 月陆续出了 v4.2、v4.3、v4.3.1、v4.3.2,截至 2026-10-07 当前是 10 项评测的 v4.3.2。不同版本的子测试与权重不同;即使版本相同,抓取时间不同、模型本身有更新,同一个模型的分数也会波动。

时间线

早期版本

Artificial Analysis 推出智能指数,作为跨模型综合能力对比的加权评分体系。

2026-06

引入指数 v4.1,明确公开九项子测试及各自权重占比(Agents 34%、编程 24%、科学推理 24%、通用 18%)。

2026-09

2026 年 9 月官方连出 v4.2、v4.3、v4.3.1、v4.3.2:v4.2 加入 AA-Briefcase(15%)与 GDP.pdf(10%)、移除 GPQA Diamond;v4.3 用 AutomationBench-AA 替换 τ³-Banking、用 Terminal-Bench 4.0 替换 Terminal-Bench 2.1。当前大类权重为 Agents 30%、编程 20%、科学推理 20%、通用 30%。

已确认 vs 常见误解

已确认

截至 2026-10-07,Artificial Analysis 官方方法论页写明:v4.3.2 收录 10 项评测;四大类权重为 Agents 30%、编程 20%、科学推理 20%、通用 30%;单项权重为 AA-Briefcase 15%、GDPval-AA 10%、AutomationBench-AA 5%、Terminal-Bench 4.0 10%、SciCode 10%、AA-LCR 5%、AA-Omniscience 准确率 10% 与非幻觉率 5%、HLE 10%、GDP.pdf 10%、CritPt 10%。版本记录里 v4.1(2026 年 6 月至 8 月)的大类权重是 34% / 24% / 24% / 18%。官方称指数的 95% 置信区间小于 ±1%。

常见误解

很多人把综合分当成单一维度的能力排序,直接拿来说「谁比谁强」——但综合分是十项异质评测加权求和的结果,两个分数接近的模型,在 Agents、编程、科学推理、通用上的强弱分布可能完全不同。另一个常见误读是拿 v4.1 的权重(34% / 24% / 24% / 18%)去解释 v4.3.2 的分数,两套权重并不相同。

看综合分 vs 看分项

只看综合分

适合快速筛选一个大致的能力档位,但看不出模型具体强在哪、弱在哪。

拆开看分项

如果你的场景明确偏 Agents 或偏编程,直接看对应子测试(比如 v4.3.2 编程大类里的 Terminal-Bench 4.0)比看综合分更有针对性。

怎么正确使用这份指数

第一步,明确自己的场景更接近四大类里的哪一类(Agents、编程、科学推理还是通用),优先参考对应的子测试分数而不是综合分。第二步,比较模型时确认双方来自同一个指数版本(截至 2026-10-07 是 v4.3.2)、同一次数据抓取——跨版本、跨时间点的对比容易产生误导。第三步,把综合分当成粗筛工具而不是最终结论,具体决策前结合实际任务做一次小规模实测。

在 QCode 上怎么办

截至 2026-10-07,QCode 一把 key 可调 claude-opus-5-5、claude-sonnet-5-5、gpt-6.1-sol、deepseek-v4-pro、glm-5.3、qwen3.8-max、kimi-k3 等模型,可以用自己的任务在同一把 key 下做小规模对比,而不是只看一个综合分。按 token 计费,各模型单价见 /models,模型可用性以 /models 为准。

常见问题

AA 智能指数具体怎么算出来的?

截至 2026-10-07 的 v4.3.2 是 10 项评测的加权平均:Agents 30%(AA-Briefcase 15% + GDPval-AA 10% + AutomationBench-AA 5%)、编程 20%(Terminal-Bench 4.0 10% + SciCode 10%)、通用 30%(AA-Omniscience 准确率 10% + 非幻觉率 5% + GDP.pdf 10% + AA-LCR 5%)、科学推理 20%(HLE 10% + CritPt 10%)。

为什么同一个模型,我这次看到的分和上次不一样?

最常见的原因是指数版本升级(权重或子测试构成变了)或者数据抓取时间点不同(模型本身可能有过更新,测试环境也可能调整)。

综合分相同的两个模型,实力真的一样吗?

不一定。综合分是加权求和的结果,两个模型完全可能在不同子项上各有强弱,只是加权后数字凑巧接近,具体能力画像可能差异很大。

pass@1 是什么意思?

指模型只给一次回答机会,第一次就要答对才算通过。v4.3.2 里 Terminal-Bench 4.0、SciCode、AA-LCR、HLE、CritPt 这几项按 pass@1 计分;Agents 大类的 AA-Briefcase 与 GDPval-AA 用两两比较的 Elo,不是 pass@1。

Terminal-Bench 只是编程大类的一部分,为什么站内其它页把它当独立榜单讲?

Terminal-Bench 既是独立的公开榜单,也是 AA 智能指数编程大类的组成部分:v4.3 起用 Terminal-Bench 4.0 替换了 Terminal-Bench 2.1,在 v4.3.2 里占总分 10%(编程大类共 20%)。官方写明 Terminal-Bench 2.1 仍保留在其 Coding Index 里。两种视角并不矛盾,只是分析粒度不同。

看这份指数选模型,还需要注意什么?

指数是综合参考,不是唯一依据;如果你的任务场景很具体,建议直接看对应子测试的分数,并结合小规模实测再做最终决定。

信息来源

当前版本 v4.3.2 的 10 项评测、大类与单项权重、计分方式,以及 v4.1 到 v4.3.2 的版本记录,均来自 Artificial Analysis 官方方法论页(Intelligence Benchmarking,含 Version History)与官网首页的指数说明,抓取日期 2026-10-07。v4.1 的历史权重同样以该页版本记录为准。

别只看一个综合分就下结论

同一把 QCode key 调 Claude、GPT、DeepSeek、GLM、Qwen、Kimi 等模型,用你的实际任务做小规模对比。

相关阅读

本页对 Artificial Analysis 智能指数方法论的解读基于其官方公开说明,核对日期 2026-10-07,不代表 QCode 官方立场;权重与子测试构成以 Artificial Analysis 官方页面为准;模型可用性以 /models 为准。

先体验,再决定

不确定选哪档?先买体验版(¥60/月),满意再升级,旧套餐剩余价值按比例退回余额。