8 件

ベンチマークとランキング

SWE-bench や Terminal-Bench などの公開スコアと、それが実際に何を示しているのか。

SWE-Bench Pro ランキング(2026-10-07):Scale AI 公式の公開セットと私有セットのボード原文

2026-10-07 時点、Scale AI 公式 SWE-Bench Pro 公開セット上位は Muse Spark 1.1*(61.50)と gpt-5.4 (xHigh)*(59.10)、私有セットは Muse Spark 1.1*(51.5)。

更新日 2026-10-08

Ornith-1.5 を自分で評価する

公開ランキングではなく自分の仕事で新モデルを判断する方法。

更新日 2026-10-08

AA Index 解説:v4.3.2 の10項目と重み

2026-10-07 時点の10項目・カテゴリ配分と v4.1 旧配分の比較

更新日 2026-10-07

Terminal-Bench 3.0 完全解説

TB 3.0 vs 2.1 の違い、現在の榜単と販売中モデルの対応

更新日 2026-09-21

Terminal-Bench 2.1 ランキング解説

3つのランキングで3つの首位:公式 83.8 / AA 89.5 / vals 85.77 の差を完全解説

更新日 2026-09-21

SWE-bench Pro 3つの首位の口径全解説

80.3 / 80.0 / 公式ボード:データ分割と scaffold の真相

更新日 2026-08-22

SWE-Bench から本番へ 2026:ベンチマークが(またはしない)デリバリー速度への変換方法

SWE-Bench 88% は素晴らしいが、私有リポジトリではしばしば 30% 程度。ギャップを理解し、自分用の検証 harness を構築しましょう。

更新日 2026-08-17

Claude Fable 5 の SWE-Bench Pro スコア解説

80.3%の出所、公式基準 vs 独立再現の論争、参考にする際の限界

更新日 2026-08-15