8 стр.

Бенчмарки и рейтинги

SWE-bench, Terminal-Bench и другие публичные результаты — и что они на самом деле означают.

Рейтинг SWE-Bench Pro на 2026-10-07: официальные таблицы Scale AI по публичному и закрытому наборам

На 2026-10-07 в официальном рейтинге Scale AI SWE-Bench Pro (публичный набор) лидируют Muse Spark 1.1* (61.50) и gpt-5.4 (xHigh)* (59.10). Только текст таблицы.

Обновлено 2026-10-08

Как самому оценить Ornith-1.5

Судить о новой модели по своей работе, а не по публичным рейтингам.

Обновлено 2026-10-08

AA Index: веса v4.3.2 и 10 оценок

10 оценок и веса категорий на 2026-10-07 в сравнении со старыми весами v4.1

Обновлено 2026-10-07

Terminal-Bench 3.0: Полный Разбор

TB 3.0 vs 2.1, текущий рейтинг и продаваемые модели

Обновлено 2026-09-21

Разбор лидерборда Terminal-Bench 2.1

Три рейтинга — три лидера: полный разбор разницы 83.8 / 89.5 / 85.77

Обновлено 2026-09-21

Три первых места SWE-bench Pro: разбор

80.3 / 80.0 / официальный борд: правда о разбиениях данных и scaffold

Обновлено 2026-08-22

От SWE-Bench к продакшену 2026: как бенчмарки (не) превращаются в скорость доставки

88% на SWE-Bench звучит отлично, но на ваших приватных репозиториях часто только 30%. Поймите разрыв и создайте собственный harness для верификации.

Обновлено 2026-08-17

Оценка Claude Fable 5 на SWE-Bench Pro: разбор

Откуда взялись 80,3%, спор между официальной методологией и независимым воспроизведением, и насколько на это стоит опираться

Обновлено 2026-08-15