8 件
ベンチマークとランキング
SWE-bench や Terminal-Bench などの公開スコアと、それが実際に何を示しているのか。
Terminal-Bench 3.0 完全解説
TB 3.0 vs 2.1 の違い、現在の榜単と販売中モデルの対応
更新日 2026-08-27
Artificial Analysis 知能指数解説
9項目の重み配分の完全解説とよくある誤解
更新日 2026-08-27
Terminal-Bench 2.1 ランキング解説
3つのランキングで3つの首位:公式 83.8 / AA 89.5 / vals 85.77 の差を完全解説
更新日 2026-08-22
SWE-bench Pro 3つの首位の口径全解説
80.3 / 80.0 / 公式ボード:データ分割と scaffold の真相
更新日 2026-08-22
Ornith-1.5 を自分で評価する
公開ランキングではなく自分の仕事で新モデルを判断する方法。
更新日 2026-08-20
Claude Fable 5 の SWE-Bench Pro スコア解説
80.3%の出所、公式基準 vs 独立再現の論争、参考にする際の限界
更新日 2026-08-08
SWE-Bench から本番へ 2026:ベンチマークが(またはしない)デリバリー速度への変換方法
SWE-Bench 88% は素晴らしいが、私有リポジトリではしばしば 30% 程度。ギャップを理解し、自分用の検証 harness を構築しましょう。
更新日 2026-07-13
SWE-Bench Pro 2026 コーディングモデルランキング:Opus 4.7 vs GPT-5.5 vs GPT-5.3-Codex
SWE-Bench Pro 2026:GPT-5.3-Codex 56.8% SOTA、GPT-5.5 58.6%、Opus 4.8 Fast Mode デフォルト。シナリオ別モデル選定ガイド。
更新日 2026-05-16