Claude Code Modellvergleich: Effizienz bei automatisiertem Bugfixing
15. Juli 20265 min Lesezeit
Die vier Bugs in dieser Beispiel-API sind fuer aktuelle Claude-Modelle
keine ernsthafte Huerde mehr – Fable 5, Haiku 4.5, Opus 4.8, Sonnet 5 loesen sie in unseren Testlaeufen
durchgehend korrekt (4 von 4 Tests). Die interessante Frage ist deshalb nicht mehr
ob, sondern wie effizient: Wie viel kostet die Loesung, wie viele
Schritte braucht das Modell, und wie chirurgisch faellt der Code-Eingriff aus?
Dieser Bericht vergleicht 12 automatisierte Testlaeufe genau dazu.
Methodik
Grundlage ist eine kleine Flask-Task-API
(buggy-taskapi)
mit vier bewusst eingebauten Bugs (Mutable-Default-Argument, ein String/Boolean-Vergleich,
ein Pagination-Fehler und eine Division durch Null). Vor jedem Testlauf wird der
Ausgangszustand zurueckgesetzt, damit alle Modelle exakt dieselbe Aufgabe mit
identischem Prompt erhalten.
Claude Code laeuft dabei im Headless-Modus (claude -p) und behebt die
Bugs eigenstaendig. Anschliessend verifiziert die Testsuite (pytest) das
Ergebnis als Korrektheits-Gate: Nur Laeufe mit 4 von 4 bestandenen
Tests (und unveraenderten Testdateien, damit kein Modell die Tests statt des Bugs
anpasst) fliessen in den Effizienzvergleich ein. Innerhalb dieser gleichwertig
korrekten Laeufe vergleichen wir Kosten und Laufzeit
(aus der Claude-Code-CLI-Antwort sowie ergaenzend aus per OpenTelemetry an Prometheus
gemeldeten Metriken) sowie die Anzahl der Turns (Denk-/Tool-Schritte
bis zur Loesung), normiert auf die Kosten pro behobenem Bug.
Ergebnisse im Ueberblick
Fable 5: im Schnitt $0.4664 pro Lauf, 9.0 Turns bis zur Loesung (3 Testlauf/Testlaeufe, alle 4/4 Tests bestanden)
Haiku 4.5: im Schnitt $0.0561 pro Lauf, 9.0 Turns bis zur Loesung (3 Testlauf/Testlaeufe, alle 4/4 Tests bestanden)
Opus 4.8: im Schnitt $0.2567 pro Lauf, 9.7 Turns bis zur Loesung (3 Testlauf/Testlaeufe, alle 4/4 Tests bestanden)
Sonnet 5: im Schnitt $0.1726 pro Lauf, 9.3 Turns bis zur Loesung (3 Testlauf/Testlaeufe, alle 4/4 Tests bestanden)
Fable 5
Haiku 4.5
Opus 4.8
Sonnet 5
Kosten pro Testlauf
Kosten in USD pro Testlauf, laut Claude-Code-Abrechnung. Nur Laeufe
mit bestandenem Korrektheits-Gate (4/4 Tests).
Turns bis zur Loesung
Anzahl der Denk-/Tool-Schritte, bis die Testsuite komplett gruen war.
Weniger Turns deutet auf eine direktere Loesung ohne Umwege hin.
Dauer pro Testlauf
Wall-Clock-Dauer in Sekunden pro Testlauf, laut Claude-Code-CLI.
Kosten pro behobenem Bug
Kosten in USD geteilt durch die Anzahl behobener Bugs (hier immer 4,
da nur Laeufe mit bestandenem Korrektheits-Gate einfliessen) - eine auf die
Aufgabengroesse normierte Kostenkennzahl.
Generiert am 15.07.2026 aus 12 Testlaeufen
(buggy-taskapi, Claude Code). Quellcode der Test-API mit den Bugs:
github.com/obscademy/buggy-taskapi
Mehr zu LLM-Kosten & Observability?
In unseren Live-Online-Schulungen lernt ihr, wie ihr Kosten, Latenz und Qualität von LLM-Workflows wie Claude Code messt und im Griff behaltet.