🏆 Официальный рейтинг Scale AI · снят 2026-10-07

SWE-Bench Pro 2026 — реалистичный бенчмарк AI-моделей кодирования

На 2026-10-07 официальный рейтинг Scale AI SWE-Bench Pro (Public Dataset) показывает Muse Spark 1.1* с 61.50 ± 3.10 и gpt-5.4 (xHigh)* с 59.10 ± 3.56, у обоих Rank (UB) 1; в закрытом наборе (Private Dataset) первые два места — Muse Spark 1.1* (51.5) и claude-opus-4-6 (thinking)* (47.1). Для записей со звёздочкой рейтинг указывает: Run with mini-swe-agent harness. Самоотчёты вендоров и агрегированные таблицы считаются по другой методике — см. нашу страницу «Три первых места».

SWE-Bench Pro vs Verified — сам бенчмарк

SWE-Bench Verified (популярен с 2024): ~500 верифицированных людьми задач на исправление GitHub-issues. SWE-Bench Pro (мейнстрим с 2026): тот же подход, но сложнее — длиннее контекст, больше изменяемых файлов, ближе к реальному потоку PR. Verified упёрся в 80% (5.2-Codex), у Pro ещё ~40 пунктов запаса — это канонический бенчмарк. Terminal-Bench 2.0 измеряет терминальных агентов; OSWorld — задачи в GUI; GDPval — профессиональные знания.

Эволюция баллов Q1-Q2 2026

Ранняя эволюция: GPT-5.2-Codex (2026-01) Verified 80.0% / Pro 56.4%; GPT-5.3-Codex (2026-02) Pro 56.8% (модель отключена в 2026-08); GPT-5.5 Pro 58.6%. Агрегированная доска от 08-18 (методика llm-stats / benchlm): Mythos 5 80.3, Fable 5 80.0, Opus 5 79.2, Qwen3.8 Max 67.7, GPT-5.6 Sol 64.6, GLM-5.2 62.1. Внимание: системная карта Anthropic заявляет для Fable 5 80.3 (наравне с Mythos), агрегированная доска фиксирует 80.0 — существуют обе цифры, разница в методике оценки.

Официальный рейтинг Scale AI дословно: публичный и закрытый наборы (2026-10-07)

Ниже — официальный рейтинг Scale AI SWE-Bench Pro в том виде, в каком он снят 2026-10-07, без пересчётов и без выводов о выборе модели. Public Dataset (по данным рейтинга, 731 instances), первые 6 строк: Muse Spark 1.1* 61.50 (с пометкой NEW), gpt-5.4 (xHigh)* 59.10, Muse Spark* 55.00, claude-opus-4-6 (thinking)* 51.90, gemini-3.1-pro (thinking)* 46.10, claude-opus-4-5-20251101 45.89. Private Dataset (276 instances из 18 закрытых кодовых баз стартапов), первые 4 строки: Muse Spark 1.1* 51.5, claude-opus-4-6 (thinking)* 47.1, Muse Spark* 44.7, gpt-5.4(xHigh)* 43.4. Легенда дословно: Rank (UB) — 1 + the number of models whose lower CI bound exceeds this model’s upper CI bound; звёздочка — Run with mini-swe-agent harness; записи без серой заливки were run with an uncapped cost and with a turn limit of 250.

Единый доступ ко всем моделям через QCode

QCode.cc предоставляет единый прозрачный API-шлюз ко всем основным моделям кодирования изнутри Китая — Claude (Opus 4.7 / Sonnet), GPT (5.5 / семейство Codex), китайские модели и др. Одна подписка, тарификация по использованию. В Claude Code, Codex CLI, Cursor, Cline, Continue смена модели — это изменение base URL и model id.

FAQ

58.6% на SWE-Bench Pro — это много? Как читать?

Pro значительно сложнее Verified: Verified насыщена (80%+), на Pro лучшие самоотчёты вендоров — около 80, а цифры официального единого фреймворка Scale заметно ниже. Читая любой балл Pro, сначала задайте три вопроса: какая доска, какой scaffold, какой уровень effort — подробности в «Три первых места SWE-bench Pro».

Почему универсальный GPT-5.5 обходит специализированный 5.3-Codex на Pro?

Это картина первой половины 2026 года. Верх агрегированной доски от 08-18 теперь занимают три модели Claude (Mythos 5 / Fable 5 / Opus 5), а GPT-5.3-Codex отключена в 2026-08 (миграция на три уровня GPT-5.6). С 2026-09-03 вершина линейки OpenAI — GPT-6 Astra, но учтите: OpenAI не опубликовала для неё оценку SWE-bench Verified ни на странице модели, ни в системной карте, поэтому сопоставимого места на этой доске у неё нет. Не принимайте за официальные числа, которые ходят в других источниках.

Балл Opus 4.7 на Pro не опубликован — как оценивать?

На этой агрегированной доске от 2026-08-18 у Opus 4.7 нет заявленного производителем балла Pro, по очкам его сравнивать не стоит. Позиция перешла к Opus 5; по состоянию на 2026-09-29 последний Opus от Anthropic — Opus 5.5 (выпущен 2026-09-22, $4 / $20). Для выбора — трекер /claude-opus-5-2-status-tracker, характеристики и цены — на /claude-opus-5-5-guide.

Доступ ко всем основным моделям через QCode

claude-opus-5-5, claude-opus-5, claude-fable-5, gpt-6.1-sol, gpt-5.6-sol, glm-5.3, kimi-k3 и deepseek-v4-pro вызываются одним ключом QCode. Оплата по токенам, цены моделей — на /models.

Подключить план QCode

Создать аккаунт QCode

Один ключ для Claude, GPT и китайских моделей, оплата по токенам — актуальные цены на /models.

Сначала попробуйте, потом решайте

Не уверены, какой тариф выбрать? Начните со «Стартового» ($8.57/мес), а при апгрейде остаток старого тарифа вернётся на баланс.