Claude Code oder Codex: Entwicklungszeit und Kosten sinnvoll vergleichen
Ein praktischer Vergleich mit identischen Aufgaben, Abnahmekriterien und Prüfzeit. Mit Beispielauftrag und einer Rechnung pro akzeptiertem Ergebnis.

Auf dieser Seite
Ein Agent schreibt schnell Code, doch die Korrektur kann lange dauern. Messen Sie bei Claude Code und Codex deshalb die Zeit bis zu einer verwendbaren Änderung, einschließlich Ihrer Prüfung.
Beide Agenten arbeiten mit Projektdateien, verändern Code und führen Befehle aus. Das Terminal ist das textbasierte Fenster für solche Befehle. Die unterstützten Umgebungen finden Sie in der Claude-Code-Dokumentation und den Codex-Hinweisen.
Dieser Artikel behandelt dokumentierte Funktionen und eine Bewertungsmethode zum 5. Oktober 2026. Er berichtet keine selbst gemessenen Laufzeiten oder Erfolgsquoten.

Was sich zuletzt geändert hat
Anthropic stellte am 28. September Sonnet 5.5 vor. OpenAI präsentierte am 29. September GPT-6.1 Sol und wiederverwendbare Codex-Cloud-Umgebungen. Damit ändern sich sowohl Modelle als auch Arbeitsbedingungen. Anthropic, OpenAI
| Bereich | Prüffrage |
|---|---|
| Umgebung | Kann der Agent Ihr Projekt installieren, ausführen und testen? |
| Modell | Welche Version und Denkeinstellung werden verwendet? |
| Kontrolle | Sind Änderungen und Befehle gut nachvollziehbar? |
| Zusammenarbeit | Passt die Prüfung zu Ihrem Team? |
Die Denkeinstellung beeinflusst den Aufwand für Vorbereitung und Kontrolle. Gleich benannte Einstellungen verschiedener Produkte stehen nicht automatisch für dieselbe Rechenleistung. Halten Sie die Bedingungen fest.
Eine konkrete Aufgabe festlegen
Als Beispiel dient ein CSV-Download für eine bestehende Bestellübersicht. CSV speichert Tabellen als Text mit Trennzeichen. Beide Agenten erhalten denselben Auftrag:
Ergänze einen CSV-Export für die bestehende Bestellübersicht.
Übernimm die ausgewählten Filter auch in den Export.
Erhalte Umlaute, Kommas, Anführungszeichen und Zeilenumbrüche in Werten.
Lass Anmeldung und Bestellabfrage unverändert funktionieren.
Führe relevante Tests aus und erläutere Änderungen und Prüfergebnisse.
Keine unbeteiligten Designänderungen und kein Deployment.
Verwenden Sie getrennte Kopien derselben Projektversion. Laufzeitumgebung und Testbefehle sollten übereinstimmen. Kein Agent sollte die fertigen Änderungen des anderen sehen.
Tests prüfen das verlangte Verhalten. Nutzen Sie neben den vom Agenten geschriebenen Tests vorab festgelegte Fälle: leere Listen, Sonderzeichen und gefilterte Bestellungen.
Den Versuch dokumentieren
| Eintrag | Inhalt |
|---|---|
| Bedingungen | Werkzeugversion, Modell, Einstellung, Ausgangsversion |
| Gesamtzeit | Vom Auftrag bis zur Abnahme |
| Menschliche Zeit | Rückfragen, Prüfung und manuelle Korrekturen |
| Ergebnis | Erfüllte Kriterien und verbleibende Fehler |
| Verbrauch | Abokontingent oder tatsächliche API-Kosten |
Wiederholen Sie den Versuch mit mehreren ähnlichen Aufgaben und behalten Sie auch Fehlschläge in der Auswertung. Achten Sie darauf, dass alte Dateien oder Caches die Bedingungen nicht verändern.
Kosten je akzeptiertem Ergebnis berechnen
Die folgende Tabelle ist ein fiktives Rechenbeispiel, keine Messung der Produkte.
| Fiktives Werkzeug | Versuche | API-Gesamtkosten | Akzeptierte Ergebnisse | Kosten je Ergebnis |
|---|---|---|---|---|
| A | 10 | 4 US-Dollar | 8 | 0,50 US-Dollar |
| B | 10 | 3 US-Dollar | 5 | 0,60 US-Dollar |
Rechnen Sie „Gesamtkosten geteilt durch akzeptierte Ergebnisse“. Bei null akzeptierten Ergebnissen ist der Quotient nicht definiert; der Versuch gilt als erfolglos. Für die praktische Entscheidung kommen menschliche Prüfzeit und Infrastruktur hinzu.
Bei einem Abo sollten Sie keine API-Kosten erfinden. Erfassen Sie die innerhalb des Kontingents erledigten Aufgaben und Zusatzkäufe getrennt. OpenAI unterscheidet diese Abrechnungsarten ausdrücklich.
Beginnen Sie mit dem Agenten, der in Ihrer bestehenden Umgebung leichter zugänglich ist. Lassen Sie anschließend den anderen dieselbe Aufgabe erledigen. Erforderliches Verhalten und nachvollziehbare Änderungen liefern Ihnen eine Grundlage, die zu Ihrem Projekt passt.
Beispiel: Abnahmekriterien vor der Anweisung festlegen
Bereiten Sie für den CSV-Export drei kleine Beispielzeilen vor: mit Komma, Anführungszeichen und Zeilenumbruch. Ergänzen Sie einen Namen mit Umlaut und einen Filter, der nur eine Zeile auswählt. Welche Zeilen exportiert werden sollen, muss vor dem Start beider Agenten feststehen.
Laden Sie die Datei in der Anwendung herunter und lesen Sie sie mit einem CSV-Parser ein. Prüfen Sie anschließend die geänderten Dateien und Testergebnisse. Erfolgreiche Tests sind hilfreich, belegen aber nur die erfassten Fälle. Ungeprüfte Anmelde- oder Zugriffsabläufe sind dadurch nicht automatisch abgesichert. Bewahren Sie die Kriterien beim Ergebnis auf, damit eine andere Person die Prüfung wiederholen kann.
Häufige Fragen
Genügt die Zeit bis zum ersten sichtbaren Code?
Sie erfasst nur einen Teil der Arbeit. Messen Sie bis zur erfüllten Abnahme einschließlich Fehlersuche und Prüfung. Trennen Sie eigene Arbeitszeit von unbeaufsichtigter Wartezeit.
Reicht eine erfolgreiche Aufgabe für die Teamauswahl?
Behandeln Sie sie als ersten Hinweis. Wiederholen Sie den Vergleich mit mehreren typischen Aufgaben und gleichen Ausgangsbedingungen. Halten Sie auch Fehlschläge und nötige Hilfe fest.


