CLAUDE BENCHMARKS · WERKSTREAM
Modell × Effort — Benchmark Dashboard
171 headless Testläufe über vier Modelle und zwei Effort-Stufen im direkten Vergleich.
Claude Code headless · Subscription-Auth · 171 Läufe · 18 Tasks · 4 Modelle
Speed — Median Wall-Zeit pro Task
Jede Zelle fährt dieselbe Task-Menge, Medianwerte sind daher direkt vergleichbar. Größter Effekt im ganzen Bench.
Output — Median Output-Tokens pro Task
Thinking-Tokens stecken im Output. high verdreifacht die Output-Menge fast auf allen Modellen.
Volume — Median Fresh-Input pro Task
Neue Tokens, die nicht im Cache lagen. Relevanter Hebel bei kurzen Sessions ohne Caching.
Limit Share — Geschätzter Anteil des 5h-Window-Limits pro Task
Nimmt ein fiktives Budget von 10M-Equivalent-Tokens pro 5h-Fenster an (nur zur relativen Orientierung!).
Alle 8 Kombinationen im Detail
| Modell | Effort | Median-Zeit | Pass Rate | Total Output | Total Fresh | Limit Share (est.) |
|---|---|---|---|---|---|---|
| Opus 5 | low | 12.5 s | 94.4 % | 681 | 8,284 | 0.36 % |
| Opus 5 | high | 21.1 s | 94.4 % | 1,439 | 8,230 | 0.74 % |
| Sonnet 5 | low | 11.9 s | 88.9 % | 562 | 7,935 | 0.30 % |
| Sonnet 5 | high | 23.1 s | 94.4 % | 1,407 | 8,966 | 0.69 % |
| Fable 5 | low | 10.1 s | 94.4 % | 538 | 7,700 | 0.29 % |
| Fable 5 | high | 28.9 s | 94.4 % | 1,351 | 8,187 | 0.67 % |
| Haiku 4.5 | low | 8.4 s | 77.8 % | 535 | 7,453 | 0.28 % |
| Haiku 4.5 | high | 14.4 s | 83.3 % | 914 | 7,445 | 0.43 % |
Die Pass Rate ist auf kleinen synthetischen Headless-Tasks gemessen (Unit-Tests & Parsing) und bildet keine komplexe Software-Architektur ab. Sie ist bewusst rein indikativ.