8 篇
基准与榜单
SWE-bench、Terminal-Bench 等公开基准的成绩与它们实际能说明什么。
SWE-Bench Pro 排行(2026-10-07):Scale AI 官方公开集与私有集榜单原文
截至 2026-10-07,Scale AI 官方 SWE-Bench Pro 公开集榜单前两名为 Muse Spark 1.1*(61.50)与 gpt-5.4 (xHigh)*(59.10),私有集前两名为 Muse Spark 1.1*(51.5)与 claude-opus-4-6 (thinking)*(47.1)。本页照录榜单原文与图例,不做选型结论。
更新于 2026-10-08
Ornith-1.5 的自评估方法
不依赖公开跑分,自己判断新模型是否适合你的活。
更新于 2026-10-08
AA Index 解读:v4.3.2 的 10 项权重
截至 2026-10-07 的 10 项评测、四大类权重与 v4.1 旧权重对照
更新于 2026-10-07
Terminal-Bench 3.0 完整解读
TB 3.0 vs 2.1 区别、当前榜单与在售模型对应
更新于 2026-09-21
Terminal-Bench 2.1 榜单解读
三份榜单三个第一:官方 83.8 / AA 89.5 / vals 85.77 差异全解
更新于 2026-09-21
SWE-bench Pro 三个第一口径全解
80.3 / 80.0 / 官方榜:数据切分与 scaffold 的真相
更新于 2026-08-22
从 SWE-Bench 到生产:2026 基准如何(不)转化为交付速度
SWE-Bench 88% 听起来很酷,但在你的私有仓库里经常只有 30%。理解差距,构建自己的验证 harness 才是王道。
更新于 2026-08-17
Claude Fable 5 SWE-Bench Pro 分数解读
80.3% 分数来源、官方口径 vs 独立复现的争议,以及参考价值与局限
更新于 2026-08-15