Die vier Bugs in dieser Beispiel-API sind fuer aktuelle Claude-Modelle keine ernsthafte Huerde mehr – Fable 5, Haiku 4.5, Opus 4.8, Sonnet 5 loesen sie in unseren Testlaeufen durchgehend korrekt (4 von 4 Tests). Die interessante Frage ist deshalb nicht mehr ob, sondern wie effizient: Wie viel kostet die Loesung, wie viele Schritte braucht das Modell, und wie chirurgisch faellt der Code-Eingriff aus? Dieser Bericht vergleicht 12 automatisierte Testlaeufe genau dazu.

Methodik

Grundlage ist eine kleine Flask-Task-API (buggy-taskapi) mit vier bewusst eingebauten Bugs (Mutable-Default-Argument, ein String/Boolean-Vergleich, ein Pagination-Fehler und eine Division durch Null). Vor jedem Testlauf wird der Ausgangszustand zurueckgesetzt, damit alle Modelle exakt dieselbe Aufgabe mit identischem Prompt erhalten.

Claude Code laeuft dabei im Headless-Modus (claude -p) und behebt die Bugs eigenstaendig. Anschliessend verifiziert die Testsuite (pytest) das Ergebnis als Korrektheits-Gate: Nur Laeufe mit 4 von 4 bestandenen Tests (und unveraenderten Testdateien, damit kein Modell die Tests statt des Bugs anpasst) fliessen in den Effizienzvergleich ein. Innerhalb dieser gleichwertig korrekten Laeufe vergleichen wir Kosten und Laufzeit (aus der Claude-Code-CLI-Antwort sowie ergaenzend aus per OpenTelemetry an Prometheus gemeldeten Metriken) sowie die Anzahl der Turns (Denk-/Tool-Schritte bis zur Loesung), normiert auf die Kosten pro behobenem Bug.

Ergebnisse im Ueberblick

Kosten pro Testlauf

$0.00 $0.12 $0.25 $0.38 $0.50 Fable 5 #1: $0.46 (baseline-fable-20260710-224451.json) $0.46 Fable 5 #1 Fable 5 #2: $0.47 (baseline-fable-20260710-224632.json) $0.47 Fable 5 #2 Fable 5 #3: $0.47 (baseline-fable-20260710-224814.json) $0.47 Fable 5 #3 Haiku 4.5 #1: $0.06 (baseline-haiku-20260710-223213.json) $0.06 Haiku 4.5 #1 Haiku 4.5 #2: $0.05 (baseline-haiku-20260710-223348.json) $0.05 Haiku 4.5 #2 Haiku 4.5 #3: $0.06 (baseline-haiku-20260710-223507.json) $0.06 Haiku 4.5 #3 Opus 4.8 #1: $0.27 (baseline-opus-20260710-224014.json) $0.27 Opus 4.8 #1 Opus 4.8 #2: $0.23 (baseline-opus-20260710-224148.json) $0.23 Opus 4.8 #2 Opus 4.8 #3: $0.26 (baseline-opus-20260710-224313.json) $0.26 Opus 4.8 #3 Sonnet 5 #1: $0.17 (baseline-sonnet-20260710-223629.json) $0.17 Sonnet 5 #1 Sonnet 5 #2: $0.17 (baseline-sonnet-20260710-223745.json) $0.17 Sonnet 5 #2 Sonnet 5 #3: $0.18 (baseline-sonnet-20260710-223901.json) $0.18 Sonnet 5 #3
Kosten in USD pro Testlauf, laut Claude-Code-Abrechnung. Nur Laeufe mit bestandenem Korrektheits-Gate (4/4 Tests).

Turns bis zur Loesung

0 2 5 8 10 Fable 5 #1: 9 (baseline-fable-20260710-224451.json) 9 Fable 5 #1 Fable 5 #2: 9 (baseline-fable-20260710-224632.json) 9 Fable 5 #2 Fable 5 #3: 9 (baseline-fable-20260710-224814.json) 9 Fable 5 #3 Haiku 4.5 #1: 10 (baseline-haiku-20260710-223213.json) 10 Haiku 4.5 #1 Haiku 4.5 #2: 9 (baseline-haiku-20260710-223348.json) 9 Haiku 4.5 #2 Haiku 4.5 #3: 8 (baseline-haiku-20260710-223507.json) 8 Haiku 4.5 #3 Opus 4.8 #1: 10 (baseline-opus-20260710-224014.json) 10 Opus 4.8 #1 Opus 4.8 #2: 9 (baseline-opus-20260710-224148.json) 9 Opus 4.8 #2 Opus 4.8 #3: 10 (baseline-opus-20260710-224313.json) 10 Opus 4.8 #3 Sonnet 5 #1: 10 (baseline-sonnet-20260710-223629.json) 10 Sonnet 5 #1 Sonnet 5 #2: 8 (baseline-sonnet-20260710-223745.json) 8 Sonnet 5 #2 Sonnet 5 #3: 10 (baseline-sonnet-20260710-223901.json) 10 Sonnet 5 #3
Anzahl der Denk-/Tool-Schritte, bis die Testsuite komplett gruen war. Weniger Turns deutet auf eine direktere Loesung ohne Umwege hin.

Dauer pro Testlauf

0s 25s 50s 75s 100s Fable 5 #1: 51s (baseline-fable-20260710-224451.json) 51s Fable 5 #1 Fable 5 #2: 52s (baseline-fable-20260710-224632.json) 52s Fable 5 #2 Fable 5 #3: 52s (baseline-fable-20260710-224814.json) 52s Fable 5 #3 Haiku 4.5 #1: 44s (baseline-haiku-20260710-223213.json) 44s Haiku 4.5 #1 Haiku 4.5 #2: 32s (baseline-haiku-20260710-223348.json) 32s Haiku 4.5 #2 Haiku 4.5 #3: 31s (baseline-haiku-20260710-223507.json) 31s Haiku 4.5 #3 Opus 4.8 #1: 44s (baseline-opus-20260710-224014.json) 44s Opus 4.8 #1 Opus 4.8 #2: 36s (baseline-opus-20260710-224148.json) 36s Opus 4.8 #2 Opus 4.8 #3: 47s (baseline-opus-20260710-224313.json) 47s Opus 4.8 #3 Sonnet 5 #1: 29s (baseline-sonnet-20260710-223629.json) 29s Sonnet 5 #1 Sonnet 5 #2: 25s (baseline-sonnet-20260710-223745.json) 25s Sonnet 5 #2 Sonnet 5 #3: 26s (baseline-sonnet-20260710-223901.json) 26s Sonnet 5 #3
Wall-Clock-Dauer in Sekunden pro Testlauf, laut Claude-Code-CLI.

Kosten pro behobenem Bug

$0.000 $0.050 $0.100 $0.150 $0.200 Fable 5 #1: $0.115 (baseline-fable-20260710-224451.json) $0.115 Fable 5 #1 Fable 5 #2: $0.117 (baseline-fable-20260710-224632.json) $0.117 Fable 5 #2 Fable 5 #3: $0.117 (baseline-fable-20260710-224814.json) $0.117 Fable 5 #3 Haiku 4.5 #1: $0.015 (baseline-haiku-20260710-223213.json) $0.015 Haiku 4.5 #1 Haiku 4.5 #2: $0.013 (baseline-haiku-20260710-223348.json) $0.013 Haiku 4.5 #2 Haiku 4.5 #3: $0.014 (baseline-haiku-20260710-223507.json) $0.014 Haiku 4.5 #3 Opus 4.8 #1: $0.068 (baseline-opus-20260710-224014.json) $0.068 Opus 4.8 #1 Opus 4.8 #2: $0.058 (baseline-opus-20260710-224148.json) $0.058 Opus 4.8 #2 Opus 4.8 #3: $0.066 (baseline-opus-20260710-224313.json) $0.066 Opus 4.8 #3 Sonnet 5 #1: $0.043 (baseline-sonnet-20260710-223629.json) $0.043 Sonnet 5 #1 Sonnet 5 #2: $0.043 (baseline-sonnet-20260710-223745.json) $0.043 Sonnet 5 #2 Sonnet 5 #3: $0.044 (baseline-sonnet-20260710-223901.json) $0.044 Sonnet 5 #3
Kosten in USD geteilt durch die Anzahl behobener Bugs (hier immer 4, da nur Laeufe mit bestandenem Korrektheits-Gate einfliessen) - eine auf die Aufgabengroesse normierte Kostenkennzahl.

Generiert am 15.07.2026 aus 12 Testlaeufen (buggy-taskapi, Claude Code). Quellcode der Test-API mit den Bugs: github.com/obscademy/buggy-taskapi

Mehr zu LLM-Kosten & Observability?

In unseren Live-Online-Schulungen lernt ihr, wie ihr Kosten, Latenz und Qualität von LLM-Workflows wie Claude Code messt und im Griff behaltet.