榜单解读 · Artificial Analysis 智能指数

Artificial Analysis 智能指数怎么算的
9 项测试加权平均,权重占比全公开

AA 智能指数是 9 项子测试的加权平均:Agents 占 34%、编程与科学推理各占 24%、通用能力占 18%;同一个模型在不同榜单/不同时间点抓到的分数不一样,往往是因为指数版本或数据抓取时间不同。

#AA 智能指数#v4.1#9 项加权#pass@1

四个关键事实

34%

Agents 权重最高

9 项子测试里,Agents 类占比最高,其中 GDPval-AA v2 占 20%、τ³-Banking 占 14%。

24% + 24%

编程与科学推理并列第二

编程占 24%(Terminal-Bench v2.1 占 16%、SciCode 占 8%);科学推理同样占 24%(Humanity's Last Exam 12%、GPQA Diamond 与 CritPt 各 6%)。

18%

通用能力权重最低

通用能力占 18%(AA-LCR 占 6%、AA-Omniscience 的准确率占 8%、非幻觉率占 4%)。

pass@1

评分方法

多数子测试采用 pass@1(首次尝试即答对),跨多轮重复测试后再汇总得分。

9 项子测试与权重全表

AA 智能指数 v4.1 是九项评测的加权平均:Agents 大类占 34%,细分为 GDPval-AA v2(20%)与 τ³-Banking(14%);编程大类占 24%,细分为 Terminal-Bench v2.1(16%)与 SciCode(8%);科学推理大类占 24%,细分为 Humanity's Last Exam(12%)、GPQA Diamond(6%)与 CritPt(6%);通用能力大类占 18%,细分为 AA-LCR(6%)与 AA-Omniscience(准确率 8% + 非幻觉率 4%)。评分方式以 pass@1 为主——模型第一次尝试就要给出正确答案,跨多轮重复计算汇总。

为什么同一模型在不同地方看到的分数不一样

两个模型综合分相同,不代表能力画像相同——它们可能是完全不同的能力组合,恰好加权求和后数字一样。另外,Artificial Analysis 会持续修订指数版本(当前是 v4.1,2026 年 6 月引入)和具体的子测试构成,不同版本的权重分配不同;即使版本相同,数据抓取的时间点不同,模型本身的迭代和测试环境的变化也会让同一个模型的分数出现波动。

时间线

早期版本

Artificial Analysis 推出智能指数,作为跨模型综合能力对比的加权评分体系。

2026-06

引入指数 v4.1,明确公开九项子测试及各自权重占比(Agents 34%、编程 24%、科学推理 24%、通用 18%)。

持续中

子测试构成与权重会随版本迭代调整,不同数据抓取时间点的分数可能不完全一致。

已确认 vs 常见误解

已确认

AA 智能指数 v4.1 的九项子测试与权重占比(Agents 34%、编程 24%、科学推理 24%、通用 18%,及各自细分权重)由 Artificial Analysis 官方方法论页面公开说明;评分以 pass@1 为主。

常见误解

很多人把综合分当成单一维度的能力排序,直接拿来说「谁比谁强」——但综合分是九项异质测试加权求和的结果,两个分数接近的模型,具体在 Agents、编程、科学推理上的强弱分布可能完全不同,只看总分容易得出片面结论。

看综合分 vs 看分项

只看综合分

适合快速筛选一个大致的能力档位,但看不出模型具体强在哪、弱在哪。

拆开看分项

如果你的场景明确偏 Agents 或偏编程,直接看对应子测试(比如 Terminal-Bench v2.1 那一项)比看综合分更有针对性。

怎么正确使用这份指数

第一步,明确自己的场景更接近九项里的哪一类(Agents、编程、科学推理还是通用),优先参考对应的子测试分数而不是综合分。第二步,比较模型时确认双方是否来自同一个指数版本、同一次数据抓取——跨版本、跨时间点的对比容易产生误导。第三步,把综合分当成一个粗筛工具而不是最终结论,具体决策前最好结合实际任务做一次小规模实测。

在 QCode 上怎么办

不管你的场景更看重指数里的哪一项,QCode 一把密钥就能把综合分靠前的几个模型家族都接进来,按实际任务小规模测试对比,而不是只依赖一个综合数字做决定。

常见问题

AA 智能指数具体怎么算出来的?

是九项子测试的加权平均:Agents 34%(GDPval-AA v2 20% + τ³-Banking 14%)、编程 24%(Terminal-Bench v2.1 16% + SciCode 8%)、科学推理 24%(HLE 12% + GPQA Diamond 6% + CritPt 6%)、通用 18%(AA-LCR 6% + AA-Omniscience 准确率 8% + 非幻觉率 4%)。

为什么同一个模型,我这次看到的分和上次不一样?

最常见的原因是指数版本升级(权重或子测试构成变了)或者数据抓取时间点不同(模型本身可能有过更新,测试环境也可能调整)。

综合分相同的两个模型,实力真的一样吗?

不一定。综合分是加权求和的结果,两个模型完全可能在不同子项上各有强弱,只是加权后数字凑巧接近,具体能力画像可能差异很大。

pass@1 是什么意思?

指模型只给一次回答机会,第一次就要答对才算通过;多数子测试会跑多轮重复,再把 pass@1 的结果汇总成分数。

Terminal-Bench v2.1 只占编程分项的一部分,为什么站内其它页把它当独立榜单讲?

Terminal-Bench 既是一个独立的公开榜单,也是 AA 智能指数编程大类里的一个组成部分(占编程 24% 里的 16%);两种视角并不矛盾,只是分析的粒度不同。

看这份指数选模型,还需要注意什么?

指数是综合参考,不是唯一依据;如果你的任务场景很具体,建议直接看对应子测试的分数,并结合小规模实测再做最终决定。

信息来源

AA 智能指数 v4.1 的九项子测试构成与权重占比、评分方法(pass@1)、版本引入时间(2026 年 6 月),均来自 Artificial Analysis 官方方法论页面。本页内容于 2026-08-27 核对。

别只看一个综合分就下结论

QCode 一把密钥接入综合分靠前的多个模型家族,按你的实际任务做小规模实测对比。

相关阅读

本页对 Artificial Analysis 智能指数方法论的解读基于其官方公开说明,不代表 QCode 官方立场;具体权重与子测试构成以 Artificial Analysis 官方页面实时数据为准。