Zum Inhalt springen

Testen und iterieren

Als Markdown anzeigen

Einen Agenten verbesserst du schrittweise: eine Sache ändern, dieselbe Aufgabe ausführen, vergleichen. endue speichert Revisionen des Prompts, damit der Schritt „zurück“ immer möglich ist.

Immer dann, wenn ein Agent fast passt. Diese Seite soll den häufigsten Fehler verhindern: drei Änderungen auf einmal, der Agent wird in einer Hinsicht besser und in einer anderen schlechter, und nichts lässt sich mehr einer Ursache zuordnen.

  1. Leg dir eine Aufgabe zurecht, die du wiederholst. Zwei oder drei echte Anfragen, die du schon einmal gestellt hast und deren gute Antwort du sofort erkennst. Das ist dein Testset. Ohne eines ist „besser“ nur ein Gefühl.
  2. Ändere eine Sache. Den Prompt, das Modell oder eine Zuweisung, aber nicht alle drei.
  3. Führe dieselbe Aufgabe in einer neuen Unterhaltung aus. Eine neue Unterhaltung ist wichtig: Ein bestehender Thread bringt einen Verlauf mit, der die Antwort unabhängig von deiner Änderung beeinflusst.
  4. Vergleiche mit dem, was du vorher gesehen hast. Sieh dir die Tool-Aufrufe an, nicht nur den finalen Text. Dort zeigt sich eine Prompt-Änderung meist zuerst.
  5. Behalte die Änderung oder geh zurück. Ist das Ergebnis schlechter, stell die vorherige Prompt-Revision wieder her und versuch eine andere Änderung.

Arbeite diese Liste von oben nach unten ab. Die Punkte weiter oben verändern die Ergebnisse bei gleichem Aufwand stärker.

MaßnahmeSymptom
Im Prompt schärfer fassen, „wie ein gutes Ergebnis aussieht“Die Antwort stimmt, ist aber nicht brauchbar: falsches Format, falsche Tiefe, der Kern geht unter
Eine feste Regel hinzufügenEr wiederholt einen bestimmten Fehler
Einen Connector oder Skill zuweisenEr rät bei etwas, das er nachschlagen sollte
Eine integrierte Tool-Gruppe ausschaltenEr greift zu einer Fähigkeit, die für diesen Agenten nur Rauschen ist
Den Denkaufwand erhöhenEr überspringt bei langen Aufgaben Schritte
Das Modell wechselnAlles oben Genannte stimmt, und er bewältigt die Aufgabe trotzdem nicht
In zwei Agenten aufteilenDer Prompt ist so gewachsen, dass er zwei voneinander unabhängige Aufgaben abdeckt

Die meisten Probleme vom Typ „Der Agent ist schlecht“ sind in der Ausführung selbst zu sehen.

  • Er hat keine Tools aufgerufen. Er glaubt, er solle aus seinem vorhandenen Wissen antworten. Meist ein Problem des Prompts, manchmal eine fehlende Zuweisung.
  • Er hat das richtige Tool mit falschen Argumenten aufgerufen. Ihm fehlt Kontext. Schreib ihn in den Prompt oder leg ihn im Gedächtnis ab.
  • Er hat Tools in einer Schleife aufgerufen, ohne zum Ziel zu kommen. Die Aufgabe ist zu ungenau beschrieben, oder der Denkaufwand ist für ihre Länge zu niedrig eingestellt.
  • Er hat dich etwas gefragt, das er wissen sollte. Diese Information gehört in den Prompt oder ins Gedächtnis.
  • Es gibt kein eingebautes Evaluierungs-Framework und keine automatische Bewertung. Du vergleichst von Hand, anhand von Aufgaben, die du selbst auswählst.
  • Es gibt keinen Entwurfsmodus: Ein Agent hat genau eine aktive Konfiguration, und Änderungen gelten ab seiner nächsten Ausführung. Willst du etwas Riskantes ausprobieren, ohne einen Agenten zu stören, auf den du dich verlässt, erstelle eine Kopie und experimentiere damit.
  • Der Revisionsverlauf betrifft den Systemprompt. Andere Einstellungen wie Modell, Zuweisungen und Tool-Gruppen werden nicht versioniert, also notiere dir, was du geändert hast.