SWE-Bench Pro 2026 — AI コーディングモデルのリアルなベンチマーク
2026-10-07 時点で、Scale AI 公式の SWE-Bench Pro 公開セット(Public Dataset)ボードでは Muse Spark 1.1*(61.50 ± 3.10)と gpt-5.4 (xHigh)*(59.10 ± 3.56)がともに Rank (UB) 1 です。私有セット(Private Dataset)の上位 2 件は Muse Spark 1.1*(51.5)と claude-opus-4-6 (thinking)*(47.1)。* 付きの項目について、ボードには Run with mini-swe-agent harness と注記されています。ベンダーの自己申告値や集約ボードは別の口径です。違いはサイト内の「3つの首位」ページを参照してください。
SWE-Bench Pro vs Verified — ベンチマーク仕様
SWE-Bench Verified(2024 年から普及):人手検証済み GitHub issue 修復タスク約 500 問。SWE-Bench Pro(2026 年から主流):Verified より難易度向上——長コンテキスト、複数ファイル変更、実 PR ワークフローに近い。Verified は 80% で飽和(5.2-Codex 達成)、Pro はまだ 40 ポイント余地があり主流ベンチマーク。Terminal-Bench 2.0 はターミナルエージェント、OSWorld は GUI、GDPval は専門知識。
2026 Q1-Q2 スコア推移
初期の変遷:GPT-5.2-Codex(2026-01)Verified 80.0% / Pro 56.4%。GPT-5.3-Codex(2026-02)Pro 56.8%(このモデルは 2026-08 に提供終了)。GPT-5.5 Pro 58.6%。08-18 集約ボード(llm-stats / benchlm 口径):Mythos 5 80.3、Fable 5 80.0、Opus 5 79.2、Qwen3.8 Max 67.7、GPT-5.6 Sol 64.6、GLM-5.2 62.1。注意:Anthropic のシステムカードは Fable 5 を 80.3(Mythos と同点)と自己申告し、集約ボードは 80.0 と記録 —— 2 つの数字が併存しており、違いは評価口径です。
Scale AI 公式ボード原文:公開セットと私有セット(2026-10-07)
以下は 2026-10-07 に取得した Scale AI 公式 SWE-Bench Pro ボードをそのまま書き写したもので、換算も選定の結論も加えていません。公開セット(Public Dataset、公式記載 731 instances)の上位 6 件:Muse Spark 1.1* 61.50(NEW 表示)、gpt-5.4 (xHigh)* 59.10、Muse Spark* 55.00、claude-opus-4-6 (thinking)* 51.90、gemini-3.1-pro (thinking)* 46.10、claude-opus-4-5-20251101 45.89。私有セット(Private Dataset、公式記載 276 instances、スタートアップ 18 社の非公開コードベース由来)の上位 4 件:Muse Spark 1.1* 51.5、claude-opus-4-6 (thinking)* 47.1、Muse Spark* 44.7、gpt-5.4(xHigh)* 43.4。凡例の原文:Rank (UB) は 1 + the number of models whose lower CI bound exceeds this model’s upper CI bound、* は Run with mini-swe-agent harness、グレー表示でない項目は were run with an uncapped cost and with a turn limit of 250。
QCode 経由で全主要モデルへ統合アクセス
QCode.cc は中国国内から主要コーディングモデルへの透明な統一 API ゲートウェイ——Claude(Opus 4.7 / Sonnet)、GPT(5.5 / Codex 系)、中国系モデル等。1 つの契約で従量課金。Claude Code、Codex CLI、Cursor、Cline、Continue 等で base URL と model id を変えるだけでモデル切替可能。
FAQ
SWE-Bench Pro 58.6% は高い?どう読む?
Pro は Verified よりはるかに難しい:Verified は飽和済み(80%+)で、Pro ではベンダー自己申告のトップが約 80、Scale 公式の統一フレームワーク口径は一段低い。Pro のスコアを読む前にまず 3 つ確認:どのボードか、どの scaffold か、どの effort ティアか —— 詳しくは「SWE-bench Pro 三つの第一位」。
コード特化の 5.3-Codex を汎用 5.5 が Pro で上回るのはなぜ?
それは 2026 年上半期の口径です。08-18 集約ボードの上位はすでに Claude 系 3 モデル(Mythos 5 / Fable 5 / Opus 5)で、GPT-5.3-Codex は 2026-08 に提供終了(GPT-5.6 の 3 ティアへ移行)。2026-09-03 以降、OpenAI ラインの最上位は GPT-6 Astra です。ただし OpenAI はモデルページにもシステムカードにも SWE-bench Verified の値を出していないため、このボード上で比較できる位置はありません。他所で出回る数字を公式値として扱わないでください。
Opus 4.7 の Pro スコアが未公表ですが?
この 2026-08-18 の集約ボードに Opus 4.7 のメーカー自己申告の Pro スコアはありません。点数で比べないでください。対位はそのあと Opus 5 になり、2026-09-29 時点での Anthropic 最新の Opus は 2026-09-22 公開の Opus 5.5($4 / $20)です。選定は追跡ページ /claude-opus-5-2-status-tracker、仕様と価格は /claude-opus-5-5-guide を見てください。
QCode で全主要コーディングモデルへ一括接続
claude-opus-5-5、claude-opus-5、claude-fable-5、gpt-6.1-sol、gpt-5.6-sol、glm-5.3、kimi-k3、deepseek-v4-pro を 1 つの QCode key で呼び出せます。トークン単位の課金で、各モデルの単価は /models を参照してください。
QCode プランを開始