# Testen und iterieren

> Ändere einen funktionierenden Agenten, ohne ihn kaputtzumachen – was du einzeln nacheinander änderst, woran du erkennst, ob es geholfen hat, und wie du zurückkommst.

Einen Agenten verbesserst du schrittweise: eine Sache ändern, dieselbe Aufgabe ausführen, vergleichen. endue speichert [Revisionen](/de/docs/build/system-prompt/#revisionen-und-zurücksetzen) des Prompts, damit der Schritt „zurück“ immer möglich ist.

## Wann du so vorgehst

Immer dann, wenn ein Agent fast passt. Diese Seite soll den häufigsten Fehler verhindern: drei Änderungen auf einmal, der Agent wird in einer Hinsicht besser und in einer anderen schlechter, und nichts lässt sich mehr einer Ursache zuordnen.

## Eine Schleife, die funktioniert

1. **Leg dir eine Aufgabe zurecht, die du wiederholst.** Zwei oder drei echte Anfragen, die du schon einmal gestellt hast und deren gute Antwort du sofort erkennst. Das ist dein Testset. Ohne eines ist „besser“ nur ein Gefühl.
2. **Ändere eine Sache.** Den Prompt, das Modell oder eine Zuweisung, aber nicht alle drei.
3. **Führe dieselbe Aufgabe in einer neuen Unterhaltung aus.** Eine neue [Unterhaltung](/de/docs/work/conversations/) ist wichtig: Ein bestehender Thread bringt einen Verlauf mit, der die Antwort unabhängig von deiner Änderung beeinflusst.
4. **Vergleiche mit dem, was du vorher gesehen hast.** Sieh dir die Tool-Aufrufe an, nicht nur den finalen Text. Dort zeigt sich eine Prompt-Änderung meist zuerst.
5. **Behalte die Änderung oder geh zurück.** Ist das Ergebnis schlechter, stell die vorherige Prompt-Revision wieder her und versuch eine andere Änderung.

## Was du ändern kannst, der Reihe nach

Arbeite diese Liste von oben nach unten ab. Die Punkte weiter oben verändern die Ergebnisse bei gleichem Aufwand stärker.

| Maßnahme | Symptom |
| --- | --- |
| Im Prompt schärfer fassen, „wie ein gutes Ergebnis aussieht“ | Die Antwort stimmt, ist aber nicht brauchbar: falsches Format, falsche Tiefe, der Kern geht unter |
| Eine feste Regel hinzufügen | Er wiederholt einen bestimmten Fehler |
| Einen Connector oder Skill zuweisen | Er rät bei etwas, das er nachschlagen sollte |
| Eine [integrierte Tool-Gruppe](/de/docs/capabilities/built-in-tools/) ausschalten | Er greift zu einer Fähigkeit, die für diesen Agenten nur Rauschen ist |
| Den [Denkaufwand](/de/docs/build/models/#denkaufwand) erhöhen | Er überspringt bei langen Aufgaben Schritte |
| Das Modell wechseln | Alles oben Genannte stimmt, und er bewältigt die Aufgabe trotzdem nicht |
| In zwei Agenten aufteilen | Der Prompt ist so gewachsen, dass er zwei voneinander unabhängige Aufgaben abdeckt |

## Eine Ausführung zur Diagnose lesen

Die meisten Probleme vom Typ „Der Agent ist schlecht“ sind in der [Ausführung](/de/docs/work/runs/) selbst zu sehen.

- **Er hat keine Tools aufgerufen.** Er glaubt, er solle aus seinem vorhandenen Wissen antworten. Meist ein Problem des Prompts, manchmal eine fehlende Zuweisung.
- **Er hat das richtige Tool mit falschen Argumenten aufgerufen.** Ihm fehlt Kontext. Schreib ihn in den Prompt oder leg ihn im [Gedächtnis](/de/docs/capabilities/memory/) ab.
- **Er hat Tools in einer Schleife aufgerufen, ohne zum Ziel zu kommen.** Die Aufgabe ist zu ungenau beschrieben, oder der Denkaufwand ist für ihre Länge zu niedrig eingestellt.
- **Er hat dich etwas gefragt, das er wissen sollte.** Diese Information gehört in den Prompt oder ins Gedächtnis.

<Aside type="tip" title="Nachsteuern hilft auch bei der Diagnose">
  Wenn ein einziger Satz zum [Nachsteuern](/de/docs/work/steering/) eine Ausführung zuverlässig
  rettet, gehört dieser Satz in den Systemprompt. Eine Korrektur, die du immer wieder
  schickst, ist ein Fehler im Prompt, den du noch nicht behoben hast.
</Aside>

## Einschränkungen

- Es gibt kein eingebautes Evaluierungs-Framework und keine automatische Bewertung. Du vergleichst von Hand, anhand von Aufgaben, die du selbst auswählst.
- Es gibt keinen Entwurfsmodus: Ein Agent hat genau eine aktive Konfiguration, und Änderungen gelten ab seiner nächsten Ausführung. Willst du etwas Riskantes ausprobieren, ohne einen Agenten zu stören, auf den du dich verlässt, erstelle eine Kopie und experimentiere damit.
- Der Revisionsverlauf betrifft den Systemprompt. Andere Einstellungen wie Modell, Zuweisungen und Tool-Gruppen werden nicht versioniert, also notiere dir, was du geändert hast.

## Siehe auch

<CardGrid>
  <LinkCard
    title="Systemprompt und Revisionen"
    href="/de/docs/build/system-prompt/"
    description="Der Hebel, zu dem du am häufigsten greifst, und wie du Änderungen rückgängig machst."
  />
  <LinkCard
    title="Ausführungen"
    href="/de/docs/work/runs/"
    description="Nachlesen, was der Agent tatsächlich getan hat, Schritt für Schritt."
  />
  <LinkCard
    title="Ausführung nachsteuern"
    href="/de/docs/work/steering/"
    description="Eine laufende Ausführung korrigieren und was dir das verrät."
  />
</CardGrid>
