Benchmarks & Ranglisten
SWE-bench, Terminal-Bench und andere öffentliche Ergebnisse — und was sie wirklich aussagen.
SWE-Bench-Pro-Ranking, Stand 2026-10-07: offizielle Scale-AI-Boards für Public und Private Set im Wortlaut
Stand 2026-10-07 führen im offiziellen SWE-Bench-Pro-Board von Scale AI (Public Set) Muse Spark 1.1* mit 61.50 und gpt-5.4 (xHigh)* mit 59.10. Nur Originaltext.
Aktualisiert 2026-10-08
Ornith-1.5 selbst bewerten
Beurteilen Sie ein neues Modell anhand Ihrer eigenen Arbeit statt anhand öffentlicher Ranglisten.
Aktualisiert 2026-10-08
AA Index erklärt: v4.3.2-Gewichte und 10 Evals
Die 10 Evaluierungen und Kategoriegewichte, Stand 2026-10-07, im Vergleich zu den alten v4.1-Gewichten
Aktualisiert 2026-10-07
Terminal-Bench 3.0 erklärt
TB 3.0 vs. 2.1, aktuelle Rankings und welche Spitzenreiter verkäuflich sind
Aktualisiert 2026-09-21
Terminal-Bench-2.1-Leaderboard erklärt
Drei Boards, drei Sieger: Die Abweichung zwischen offiziell 83.8 / AA 89.5 / vals 85.77 vollständig erklärt
Aktualisiert 2026-09-21
Die drei ersten Plätze bei SWE-bench Pro erklärt
80.3 / 80.0 / das offizielle Board: die Wahrheit über Datensplits und Scaffolds
Aktualisiert 2026-08-22
Von SWE-Bench zur Produktion: Wie Benchmarks sich (nicht) auf die Auslieferungsgeschwindigkeit in 2026 übertragen
88 % auf SWE-Bench klingen großartig, aber auf Ihren privaten Repos oft nur 30 %. Verstehen Sie die Lücke und bauen Sie Ihr eigenes Verifikations-Harness.
Aktualisiert 2026-08-17
Claude Fable 5 und der SWE-Bench-Pro-Wert – erklärt
Woher die 80,3 % stammen, offizielle Methodik im Vergleich zu unabhängiger Reproduktion und wie stark der Wert in Ihre Entscheidung einfließen sollte
Aktualisiert 2026-08-15