SWE-Bench Pro 2026 – Der realitätsnahe Benchmark für KI-Coding-Modelle
Stand 2026-10-07 führt das offizielle SWE-Bench-Pro-Board von Scale AI (Public Dataset) Muse Spark 1.1* mit 61.50 ± 3.10 und gpt-5.4 (xHigh)* mit 59.10 ± 3.56, beide mit Rank (UB) 1; im Private Dataset liegen Muse Spark 1.1* (51.5) und claude-opus-4-6 (thinking)* (47.1) vorn. Bei mit * markierten Einträgen vermerkt das Board: Run with mini-swe-agent harness. Herstellerangaben und aggregierte Ranglisten folgen anderen Methoden – siehe unsere Seite „Drei erste Plätze“.
SWE-Bench Pro vs. Verified – Der Benchmark im Vergleich
SWE-Bench Verified (ab 2024 populär): ca. 500 human-verifizierte GitHub-Issue-Fix-Aufgaben. SWE-Bench Pro (ab 2026 Mainstream): gleicher Ansatz, aber schwieriger – längerer Kontext, mehr Dateien betroffen, näher an echten PR-Workflows. Verified plateaute bei rund 80 % (5.2-Codex), Pro bietet noch ca. 40 Punkte Spielraum und ist nun der kanonische Benchmark. Terminal-Bench 2.0 misst Terminal-Agent-Aufgaben; OSWorld misst GUI-Steuerungs-Aufgaben; GDPval misst professionelles Fachwissen.
Score-Entwicklung Q1–Q2 2026
Frühe Entwicklung: GPT-5.2-Codex (2026-01) Verified 80.0 % / Pro 56.4 %; GPT-5.3-Codex (2026-02) Pro 56.8 % (dieses Modell wurde 2026-08 eingestellt); GPT-5.5 Pro 58.6 %. Die aggregierte Rangliste vom 18.08. (llm-stats / benchlm-Methodik): Mythos 5 80.3, Fable 5 80.0, Opus 5 79.2, Qwen3.8 Max 67.7, GPT-5.6 Sol 64.6, GLM-5.2 62.1. Hinweis: Anthropics System Card meldet Fable 5 eigenständig mit 80.3 (gleichauf mit Mythos), die aggregierte Rangliste verzeichnet 80.0 – beide Zahlen existieren; der Unterschied liegt in der Bewertungsmethodik.
Offizielles Scale-AI-Board im Wortlaut: Public und Private Set (2026-10-07)
Hier steht das offizielle SWE-Bench-Pro-Board von Scale AI so, wie es am 2026-10-07 abgerufen wurde – unverändert und ohne Modellempfehlung. Public Dataset (laut Board 731 instances), die ersten 6 Einträge: Muse Spark 1.1* 61.50 (als NEW markiert), gpt-5.4 (xHigh)* 59.10, Muse Spark* 55.00, claude-opus-4-6 (thinking)* 51.90, gemini-3.1-pro (thinking)* 46.10, claude-opus-4-5-20251101 45.89. Private Dataset (276 instances aus 18 privaten, proprietären Codebasen von Start-ups), die ersten 4 Einträge: Muse Spark 1.1* 51.5, claude-opus-4-6 (thinking)* 47.1, Muse Spark* 44.7, gpt-5.4(xHigh)* 43.4. Legende im Wortlaut: Rank (UB) ist 1 + the number of models whose lower CI bound exceeds this model’s upper CI bound; * bedeutet Run with mini-swe-agent harness; nicht ausgegraute Einträge were run with an uncapped cost and with a turn limit of 250.
Einheitlicher Zugang zu allen großen Modellen über QCode
QCode.cc bietet von China aus ein einheitliches, transparentes API-Gateway zu allen großen Coding-Modellen – Claude (Opus 4.7 / Sonnet), GPT (5.5 / Codex-Familie), chinesische Modelle und weitere. Ein Abo, abgerechnet nach Nutzung. In Claude Code, Codex CLI, Cursor, Cline oder Continue ist der Modellwechsel nur ein Ändern der Base-URL und Modell-ID – einmal konfigurieren, überall ausführen.
FAQ
Ist 58.6 % auf SWE-Bench Pro viel? Wie sollte ich es einordnen?
Pro ist deutlich schwieriger als Verified: Verified ist gesättigt (80 %+), während die besten Eigenmeldungen auf Pro bei rund 80 liegen und Scale's offizielle Zahlen aus dem einheitlichen Framework niedriger ausfallen. Bevor Sie einen Pro-Score lesen, stellen Sie drei Fragen: welche Rangliste, welches Scaffold, welche Effort-Stufe – Details auf „Drei erste Plätze bei SWE-Bench Pro“.
Warum schlägt das allgemeine GPT-5.5 auf Pro das coding-spezifische 5.3-Codex?
Das ist ein Bild der ersten Jahreshälfte 2026. Die Spitze der aggregierten Rangliste vom 18.08. besteht nun aus drei Claude-Modellen (Mythos 5 / Fable 5 / Opus 5), und GPT-5.3-Codex wurde 2026-08 eingestellt (Migration auf die drei GPT-5.6-Stufen). Seit 2026-09-03 ist das Top-Modell der OpenAI-Reihe GPT-6 Astra – beachten Sie jedoch, dass OpenAI weder auf der Modellseite noch in der System Card einen SWE-bench-Verified-Score dafür veröffentlicht hat, sodass es auf dieser Rangliste keine vergleichbare Position hat. Behandeln Sie anderswo kursierende Zahlen nicht als offiziell.
Opus 4.7's Pro-Score ist nicht veröffentlicht – wie soll ich es bewerten?
Auf dieser aggregierten Rangliste vom 2026-08-18 gibt es für Opus 4.7 keinen anbietergemeldeten Pro-Score, also ordnen Sie es nicht nach Score ein. Sein Rang wurde auf Opus 5 überführt; Stand 2026-09-29 ist das neueste Opus von Anthropic Opus 5.5 (veröffentlicht 2026-09-22, $4 / $20). Siehe den Tracker /claude-opus-5-2-status-tracker und die Spezifikationen unter /claude-opus-5-5-guide.
Weiterführende Anleitungen
Alle großen Coding-Modelle über QCode nutzen
claude-opus-5-5, claude-opus-5, claude-fable-5, gpt-6.1-sol, gpt-5.6-sol, glm-5.3, kimi-k3 und deepseek-v4-pro lassen sich mit einem QCode-Key aufrufen. Bezahlt wird pro Token; die Preise je Modell stehen unter /models.
QCode-Tarif jetzt startenQCode-Konto erstellen
Ein API-Key für Claude, GPT und chinesische Modelle, Bezahlung pro Token — aktuelle Preise unter /models.