Бенчмарки и рейтинги
SWE-bench, Terminal-Bench и другие публичные результаты — и что они на самом деле означают.
Рейтинг SWE-Bench Pro на 2026-10-07: официальные таблицы Scale AI по публичному и закрытому наборам
На 2026-10-07 в официальном рейтинге Scale AI SWE-Bench Pro (публичный набор) лидируют Muse Spark 1.1* (61.50) и gpt-5.4 (xHigh)* (59.10). Только текст таблицы.
Обновлено 2026-10-08
Как самому оценить Ornith-1.5
Судить о новой модели по своей работе, а не по публичным рейтингам.
Обновлено 2026-10-08
AA Index: веса v4.3.2 и 10 оценок
10 оценок и веса категорий на 2026-10-07 в сравнении со старыми весами v4.1
Обновлено 2026-10-07
Terminal-Bench 3.0: Полный Разбор
TB 3.0 vs 2.1, текущий рейтинг и продаваемые модели
Обновлено 2026-09-21
Разбор лидерборда Terminal-Bench 2.1
Три рейтинга — три лидера: полный разбор разницы 83.8 / 89.5 / 85.77
Обновлено 2026-09-21
Три первых места SWE-bench Pro: разбор
80.3 / 80.0 / официальный борд: правда о разбиениях данных и scaffold
Обновлено 2026-08-22
От SWE-Bench к продакшену 2026: как бенчмарки (не) превращаются в скорость доставки
88% на SWE-Bench звучит отлично, но на ваших приватных репозиториях часто только 30%. Поймите разрыв и создайте собственный harness для верификации.
Обновлено 2026-08-17
Оценка Claude Fable 5 на SWE-Bench Pro: разбор
Откуда взялись 80,3%, спор между официальной методологией и независимым воспроизведением, и насколько на это стоит опираться
Обновлено 2026-08-15