🏆 Scale AI 官方榜 · 2026-10-07 抓取

SWE-Bench Pro 2026 — AI 编程模型的真实基准

截至 2026-10-07,Scale AI 官方 SWE-Bench Pro 公开集(Public Dataset)榜单前两名为 Muse Spark 1.1*(61.50 ± 3.10)与 gpt-5.4 (xHigh)*(59.10 ± 3.56),Rank (UB) 均为 1;私有集(Private Dataset)前两名为 Muse Spark 1.1*(51.5)与 claude-opus-4-6 (thinking)*(47.1)。带 * 的条目,榜单注明 Run with mini-swe-agent harness。厂商自报分与聚合榜用的是别的口径,差异见站内《三个第一》。

SWE-Bench Pro vs Verified — 基准本身

SWE-Bench Verified(2024 年开始流行):人工验证的 GitHub issue 修复任务,~500 道。SWE-Bench Pro(2026 年起主流):在 Verified 基础上加强难度——更长上下文、更多文件改动、更接近真实 PR 工作流。Verified 分数 80% 已饱和(5.2-Codex),Pro 仍有 40 个百分点提升空间,是当前主流基准。Terminal-Bench 2.0 测终端代理任务;OSWorld 测 GUI 操作;GDPval 测专业知识任务。

2026 Q1-Q2 分数演进表

早期演进:GPT-5.2-Codex(2026-01)Verified 80.0% / Pro 56.4%;GPT-5.3-Codex(2026-02)Pro 56.8%(该型号已于 2026-08 下线);GPT-5.5 Pro 58.6%。08-18 聚合榜(llm-stats / benchlm 口径):Mythos 5 80.3、Fable 5 80.0、Opus 5 79.2、Qwen3.8 Max 67.7、GPT-5.6 Sol 64.6、GLM-5.2 62.1。注意:Anthropic 系统卡自报 Fable 5 为 80.3(与 Mythos 并列),聚合榜记 80.0——两个数字并存,差的是评测口径。

Scale AI 官方榜原文:公开集与私有集(2026-10-07)

以下照录 Scale AI 官方 SWE-Bench Pro 榜单(2026-10-07 抓取),不做换算,也不下选型结论。公开集(Public Dataset,官方写明 731 instances)前 6 条:Muse Spark 1.1* 61.50(榜单标 NEW)、gpt-5.4 (xHigh)* 59.10、Muse Spark* 55.00、claude-opus-4-6 (thinking)* 51.90、gemini-3.1-pro (thinking)* 46.10、claude-opus-4-5-20251101 45.89。私有集(Private Dataset,官方写明 276 instances,来自 18 个初创公司的私有代码库)前 4 条:Muse Spark 1.1* 51.5、claude-opus-4-6 (thinking)* 47.1、Muse Spark* 44.7、gpt-5.4(xHigh)* 43.4。图例原文:Rank (UB) 为 1 + the number of models whose lower CI bound exceeds this model’s upper CI bound;带 * 为 Run with mini-swe-agent harness;未置灰的条目 were run with an uncapped cost and with a turn limit of 250。

通过 QCode 统一接入所有主流模型

QCode.cc 提供统一 API 通路,国内透明接入 Claude(Opus 4.7 / Sonnet)、GPT(5.5 / Codex 系列)与国产模型等主流编码模型。一个套餐共享,按用量计费。在 Claude Code、Codex CLI、Cursor、Cline、Continue 等客户端中切模型只改 base URL 与 model id 即可,配置一次跑全部。

FAQ

SWE-Bench Pro 58.6% 高吗?怎么解读?

Pro 比 Verified 难得多:Verified 已饱和(80%+),Pro 的厂商自报头部成绩约 80、Scale 官方统一框架口径低一截。读任何 Pro 分数先问三件事:哪份榜、什么 scaffold、哪个 effort 档——详见《SWE-bench Pro 三个第一》。

为什么 GPT-5.5 反超专为编码优化的 5.3-Codex?

那是 2026 上半年的口径了。08-18 聚合榜头部已是 Claude 系三款(Mythos 5 / Fable 5 / Opus 5),且 GPT-5.3-Codex 已于 2026-08 下线(迁移到 GPT-5.6 三档)。2026-09-03 之后 OpenAI 线的顶配是 GPT-6 Astra;不过要注意,OpenAI 在模型页与系统卡里都没有给出它的 SWE-bench Verified 分,所以它在这张榜上没有可比的位置,别把别处流传的数字当成官方值。

Opus 4.7 SWE-Bench Pro 分数没公布,怎么选?

Opus 4.7 在这份 2026-08-18 聚合榜上没有厂商自报的 Pro 分,所以别拿分数比它。它那一档后来是 Opus 5;截至 2026-09-29,官方最新的 Opus 是 2026-09-22 发布的 Opus 5.5($4 / $20)。选型看状态页 /claude-opus-5-2-status-tracker,规格与价目见 /claude-opus-5-5-guide。

QCode 一站接入所有主流编码模型

claude-opus-5-5、claude-opus-5、claude-fable-5、gpt-6.1-sol、gpt-5.6-sol、glm-5.3、kimi-k3、deepseek-v4-pro 可以用同一把 QCode key 调用。按 token 计费,各模型单价见 /models。

开通 QCode

创建 QCode 账号

一把 key 覆盖 Claude、GPT 与国产模型,按 token 计费,实时单价见 /models。

先体验,再决定

不确定选哪档?先买体验版(¥60/月),满意再升级,旧套餐剩余价值按比例退回余额。