8 Seiten

Benchmarks & Ranglisten

SWE-bench, Terminal-Bench und andere öffentliche Ergebnisse — und was sie wirklich aussagen.

SWE-Bench-Pro-Ranking, Stand 2026-10-07: offizielle Scale-AI-Boards für Public und Private Set im Wortlaut

Stand 2026-10-07 führen im offiziellen SWE-Bench-Pro-Board von Scale AI (Public Set) Muse Spark 1.1* mit 61.50 und gpt-5.4 (xHigh)* mit 59.10. Nur Originaltext.

Aktualisiert 2026-10-08

Ornith-1.5 selbst bewerten

Beurteilen Sie ein neues Modell anhand Ihrer eigenen Arbeit statt anhand öffentlicher Ranglisten.

Aktualisiert 2026-10-08

AA Index erklärt: v4.3.2-Gewichte und 10 Evals

Die 10 Evaluierungen und Kategoriegewichte, Stand 2026-10-07, im Vergleich zu den alten v4.1-Gewichten

Aktualisiert 2026-10-07

Terminal-Bench 3.0 erklärt

TB 3.0 vs. 2.1, aktuelle Rankings und welche Spitzenreiter verkäuflich sind

Aktualisiert 2026-09-21

Terminal-Bench-2.1-Leaderboard erklärt

Drei Boards, drei Sieger: Die Abweichung zwischen offiziell 83.8 / AA 89.5 / vals 85.77 vollständig erklärt

Aktualisiert 2026-09-21

Die drei ersten Plätze bei SWE-bench Pro erklärt

80.3 / 80.0 / das offizielle Board: die Wahrheit über Datensplits und Scaffolds

Aktualisiert 2026-08-22

Von SWE-Bench zur Produktion: Wie Benchmarks sich (nicht) auf die Auslieferungsgeschwindigkeit in 2026 übertragen

88 % auf SWE-Bench klingen großartig, aber auf Ihren privaten Repos oft nur 30 %. Verstehen Sie die Lücke und bauen Sie Ihr eigenes Verifikations-Harness.

Aktualisiert 2026-08-17

Claude Fable 5 und der SWE-Bench-Pro-Wert – erklärt

Woher die 80,3 % stammen, offizielle Methodik im Vergleich zu unabhängiger Reproduktion und wie stark der Wert in Ihre Entscheidung einfließen sollte

Aktualisiert 2026-08-15