Auf einen Blick (Kurzfassung):

Andere Quellenlage als Artikel 1–5. Die übrigen Artikel geben ausschließlich offiziell dokumentierte Aussagen wieder. Dieser hier besteht aus eigenen Messungen auf einem Rechner, an einem Tag, mit zehn selbst geschriebenen Aufgaben. Reproduzierbar, aber nicht repräsentativ für deine Workloads.

Die Kurzfassung

Aufbau

Jede Zelle der Matrix ist ein eigener headless-Lauf in einem frischen Temp-Verzeichnis, das nur den Aufgabentext enthält:

claude -p "<Aufgabe>" \
  --safe-mode \
  --model claude-opus-5 \
  --effort low \
  --output-format json \
  --permission-mode bypassPermissions \
  --max-turns 25

Vier Entscheidungen, die das Ergebnis überhaupt erst aussagekräftig machen:

Der Vertrag für alle Aufgaben ist identisch: Der Agent schreibt solution.py, danach bewertet ein Prüfskript sie von außen und gibt einen Score zwischen 0 und 1 zurück. Zehn Aufgaben, gemischt: Algorithmik mit Laufzeitgrenze, ein Bugfix mit Endlosschleife, Regex plus Kalenderlogik inklusive Schaltjahren, ein Constraint-Rätsel, ein Parser mit Fehlerfällen, römische Zahlen mit Ablehnung nicht-kanonischer Formen, Wahrscheinlichkeitsrechnung und Telefonnummern-Normalisierung nach E.164.

Die Matrix

ModellEffortnPassScore øWall sOut-Tok øFresh-Tok ø
Opus 5low18160,9912,56825967
Opus 5high18181,0021,317358017
Sonnet 5low18150,917,58825980
Sonnet 5high18160,9113,219378038
Fable 5low18150,9815,810247020
Fable 5high18170,9921,716508113
Haiku 4.5low18150,9828,9474712777
Haiku 4.5high18160,9920,233219927

Fresh-Tokens = output + input + cache_creation, also alles außer Cache-Reads: das Volumen, das Modell und Effort tatsächlich erzeugen. Die Spalte ist bewusst statt total_cost_usd gewählt — warum, steht weiter unten.

Zwei Beobachtungen, die nicht ins Klischee passen. Erstens ist Haiku 4.5 hier das langsamste Modell, nicht das schnellste: 28,9 s Median auf low, weil es mit Abstand am meisten schreibt. Der Geschwindigkeitsvorteil kleiner Modelle gilt pro Token, nicht pro Aufgabe — und wer viermal so viele Tokens produziert, ist trotz schnellerer Tokenrate am Ende langsamer.

Zweitens ist bei Haiku 4.5 high günstiger als low (3321 gegen 4747 Output-Tokens). Bei allen drei 5er-Modellen steigt der Verbrauch mit dem Effort wie erwartet um Faktor 1,6 bis 2,5. Haiku 4.5 stammt aus der Vorgängergeneration; das Effort-Flag wird angenommen, aber die Skalierung greift dort nicht sauber.

Warum die Qualitätsspalte nichts entscheidet

Die Score-Spalte sieht nach Ranking aus. Sie ist keines. 16 Fehlschläge auf 144 Läufe, pro Zelle null bis drei — Fisher exakter Test:

VergleichFehlschlägep
Opus 5 high gegen Sonnet 5 low0/18 gegen 3/180,23
Effort low gegen high, gepoolt11/72 gegen 5/720,18

Beides weit von Signifikanz entfernt. Dazu kommt ein Deckeneffekt: Von neun ausgewerteten Aufgaben produzierten nur zwei überhaupt Fehlschläge. Die anderen sieben laufen bei jedem Modell durch und heben alle Mittelwerte gleichmäßig an — effektiv war das ein Zwei-Aufgaben-Benchmark.

Wer Modelle nach Qualität ranken will, braucht Aufgaben, an denen die stärkeren messbar besser sind — Reasoning-Tiefe statt Tipparbeit. Kandidaten aus dem zweiten Anlauf: unrestricted Damerau-Levenshtein (fast alle liefern die OSA-Variante), Misère-Nim (die Normal-Play-XOR-Regel ist dort falsch), ein Ausdrucksparser mit -2**2 == -4 und Trunkierung Richtung Null, SemVer-2.0-Precedence mit Prerelease-Ordering.

Wie viel Limit kostet ein Lauf?

Claude Code hat keinen headless auslesbaren Limit-Zähler — /usage ist nur interaktiv (siehe Artikel 2). Ein Proxy lässt sich trotzdem kalibrieren, wenn man einen Beobachtungspunkt hat.

Der lag hier vor: Nach dem Sweep zeigte /usage 75 % des 5-Stunden-Fensters. Die 171 Läufe summieren sich auf 20,28 cost-equivalent und dürften grob 70 Prozentpunkte davon ausmachen — die Hauptsession, in der der Sweep gesteuert wurde, ist gegen 171 volle Sessions Rauschen. Daraus folgt: ein Prozentpunkt ≈ 0,29 cost-equivalent, das volle Fenster ≈ 29.

Modell / Effort% des 5-h-Fensters pro LaufLäufe bis 100 %
Fable 5 high0,92108
Fable 5 low0,80124
Opus 5 high0,48209
Opus 5 low0,33300
Sonnet 5 high0,30335
Sonnet 5 low0,22459
Haiku 4.5 low0,15667
Haiku 4.5 high0,12866

Die Spannweite beträgt Faktor 7,7 zwischen der teuersten und der billigsten Zelle. Und die Rangfolge zeigt: das Modelltier dominiert die Effort-Stufe. Fable 5 auf low kostet mehr Limit als Opus 5 auf high, Opus 5 auf low mehr als Sonnet 5 auf high. Wer sparen will, wechselt zuerst das Modell, nicht die Effort-Stufe.

Drei Fehlerquellen, die diese Tabelle unschärfer machen, als sie aussieht. Erstens ein einziger Kalibrierpunkt — ±20 % sind plausibel. Zweitens ist die Limit-Formel nicht öffentlich; sie ist kostengewichtet, aber nicht nachweislich linear in total_cost_usd. Drittens die Cache-Kontamination unten. Die Größenordnung trägt, die zweite Nachkommastelle nicht.

Warum nicht einfach total_cost_usd?

Weil die Zahl von der Lauf-Reihenfolge abhängt, nicht nur vom Modell. Aus der Vorab-Probe:

fable-5 low   0,4081
fable-5 high  0,1545

Die Kosten sinken um Faktor 2,6, während der Effort steigt. Ursache ist nicht das Modell, sondern ob eine frühere Zelle den Prompt-Cache bereits gefüllt hatte: cache_creation kostet das 1,25-fache des Basispreises, cache_read ein Zehntel. Wer als Erster in einer Reihe läuft, zahlt den Aufbau; alle danach lesen billig. Das folgt dem Scheduling und der Parallelität des Sweeps — mit mehr Wiederholungen mittelt sich das nicht weg, weil es kein Rauschen ist, sondern ein systematischer Effekt.

Deshalb ranken die Tabellen oben nach Fresh-Tokens, und $ steht nur als Nebenspalte. Für den Limit-Schätzer ist die Summe über alle 171 Läufe verwendet — über den ganzen Sweep gemittelt fällt der Cache-Effekt weitgehend heraus, für eine Rangfolge einzelner Zellen taugt er nicht.

Was sich wann lohnt

AufgabeWahlBegründung aus den Daten
Mechanisch, klar spezifiziertHaiku 4.5 high0,12 % pro Lauf, viermal limitschonender als Opus 5 low. high statt low, weil Haiku bei low mehr Tokens produziert.
Standard-Coding, interaktivSonnet 5 low7,5 s Median — mit Abstand die schnellste Rückmeldung. Score 0,91, das schwächste im Feld; taugt dort, wo ein Fehler sofort auffällt.
Default für echte ArbeitOpus 5 low12,5 s bei Score 0,99 und 0,33 % pro Lauf. Die schnellste Zelle der starken Tier — low ist bei Opus 5 auffällig stark.
Schwer, korrektheitskritischOpus 5 highEinzige Zelle mit 18/18. Kostet 1,5× gegenüber low — bei 209 statt 300 Läufen pro Fenster günstig erkauft.
Fable 5nur wenn Opus 5 high scheitertDoppelter Limitverbrauch von Opus 5 high, kein messbarer Qualitätsvorsprung auf diesen Aufgaben. Bei langen autonomen Läufen kann das anders aussehen — dafür fehlen hier die Daten.

Zur Effort-Wahl: low → high kostet rund das 1,4-fache an Limit und das 1,6-fache an Zeit. Bei Opus 5 hebt es die Pass-Rate von 16/18 auf 18/18 — der einzige Ort in dieser Messung, an dem sich der Aufschlag sichtbar auszahlt. Bei Haiku 4.5 ist high ohnehin die günstigere Wahl.

Der eigentliche Hebel

Die gesamte Modellwahl bewegt sich innerhalb eines Faktors von etwa 7. Der Session-Overhead bewegt mehr.

Größe über alle 171 LäufeTokens
Output320 000
Cache-Creation1 054 000
Cache-Read9 075 000

Jeder Lauf zahlt 50 000 bis 75 000 Input-Tokens allein für System-Prompt und Tool-Definitionen — unabhängig davon, wie klein die Aufgabe ist. Der eigentliche Aufgabentext liegt bei rund 200 Tokens. Über 90 % des Verbrauchs ist Session-Overhead, nicht Denkarbeit. --safe-mode schaltet CLAUDE.md und Skills ab, aber nicht den Basis-Prompt.

Praktisch heißt das: Eine lange Session mit warmem Cache schlägt zwanzig kalte Kurzsessions deutlicher, als irgendein Modellwechsel es je könnte. Das deckt sich mit dem, was Artikel 3 zur Cache-Wärme und Artikel 4 zum Session-Start beschreiben — hier ist es einmal beziffert.

Was diese Messung nicht zeigt