171Läufe
16Fehlschläge
18Tasks
1.38 MFresh-Tokens
9.07 MCache-Read

Speed — Median Wall-Zeit pro Task

Jede Zelle fährt dieselbe Task-Menge, Medianwerte sind daher direkt vergleichbar. Größter Effekt im ganzen Bench.

Opus 5low12.5 s
Opus 5high21.1 s
Sonnet 5low11.9 s
Sonnet 5high23.1 s
Fable 5low10.1 s
Fable 5high28.9 s
Haiku 4.5low8.4 s
Haiku 4.5high14.4 s

Output — Median Output-Tokens pro Task

Thinking-Tokens stecken im Output. high verdreifacht die Output-Menge fast auf allen Modellen.

Opus 5low681
Opus 5high1,439
Sonnet 5low562
Sonnet 5high1,407
Fable 5low538
Fable 5high1,351
Haiku 4.5low535
Haiku 4.5high914

Volume — Median Fresh-Input pro Task

Neue Tokens, die nicht im Cache lagen. Relevanter Hebel bei kurzen Sessions ohne Caching.

Opus 5low8,284
Opus 5high8,230
Sonnet 5low7,935
Sonnet 5high8,966
Fable 5low7,700
Fable 5high8,187
Haiku 4.5low7,453
Haiku 4.5high7,445

Limit Share — Geschätzter Anteil des 5h-Window-Limits pro Task

Nimmt ein fiktives Budget von 10M-Equivalent-Tokens pro 5h-Fenster an (nur zur relativen Orientierung!).

Opus 5low0.36 %
Opus 5high0.74 %
Sonnet 5low0.30 %
Sonnet 5high0.69 %
Fable 5low0.29 %
Fable 5high0.67 %
Haiku 4.5low0.28 %
Haiku 4.5high0.43 %

Alle 8 Kombinationen im Detail

ModellEffortMedian-ZeitPass RateTotal OutputTotal FreshLimit Share (est.)
Opus 5low12.5 s94.4 %6818,2840.36 %
Opus 5high21.1 s94.4 %1,4398,2300.74 %
Sonnet 5low11.9 s88.9 %5627,9350.30 %
Sonnet 5high23.1 s94.4 %1,4078,9660.69 %
Fable 5low10.1 s94.4 %5387,7000.29 %
Fable 5high28.9 s94.4 %1,3518,1870.67 %
Haiku 4.5low8.4 s77.8 %5357,4530.28 %
Haiku 4.5high14.4 s83.3 %9147,4450.43 %
Wichtiger Hinweis zur Pass Rate

Die Pass Rate ist auf kleinen synthetischen Headless-Tasks gemessen (Unit-Tests & Parsing) und bildet keine komplexe Software-Architektur ab. Sie ist bewusst rein indikativ.