Das Kontextfenster
Ein Modell liest pro Anfrage eine feste Menge Text, sein Kontextfenster. Alles, was der Agent braucht, muss hineinpassen: seine Anweisungen, sein Gedächtnis, die Tools, die er aufrufen kann, deine Unterhaltung und deine Anhänge.
Das Eingabefeld zeigt, wie voll dieses Fenster ist, und das Kontext-Panel zeigt, womit es gefüllt ist.
Warum das wichtig ist
Abschnitt betitelt „Warum das wichtig ist“Je voller das Fenster, desto schlechter werden zwei Dinge:
- Ältere Nachrichten werden abgeschnitten. Der Agent sieht den Anfang eines langen Threads nicht mehr.
- Jeder Schritt kostet mehr. Bei jedem Schritt einer Ausführung wird der gesamte Kontext erneut gesendet. Eine umfangreiche Unterhaltung ist also langsamer und teurer.
Wenn ein Agent „vergisst, was wir am Anfang gesagt haben“, ist fast immer das Fenster voll und nicht das Gedächtnis kaputt.
Was den Platz belegt
Abschnitt betitelt „Was den Platz belegt“Das Panel teilt das Fenster in Segmente auf:
| Segment | Was es ist |
|---|---|
| Systemanweisungen | Der Rahmen, den endue um jede Ausführung legt |
| Identität | Name, Persönlichkeit und Profil des Agenten |
| Agentenanweisungen | Sein Systemprompt in der aktuellen Revision |
| Anweisungs-Skills | Skills, deren Inhalt eine dauerhafte Anleitung ist statt eines Befehls |
| Gedächtnis | Die Erinnerungen, die für diese Unterhaltung relevant sind |
| Tool-Definitionen | Das Schema jedes Tools, das der Agent aufrufen kann |
| Nachrichten der Unterhaltung | Was du und der Agent gesagt habt |
| Angehängte Medien | Anhänge, getrennt von den Nachrichten gezählt |
Tools werden noch feiner aufgeschlüsselt: Für jeden Skill, jeden Connector, jede Gruppe integrierter Tools und jedes Gerät siehst du, was das Anbieten der Definitionen kostet, wie viele Aufrufe es in der letzten Ausführung gab und wie viel die Ergebnisse ausmachten. Daran erkennst du den Unterschied zwischen „dieses Tool ist teuer anzubieten“ und „dieses Tool hat viel zurückgegeben“.
Gemessen oder prognostiziert
Abschnitt betitelt „Gemessen oder prognostiziert“Vor der ersten Ausführung gibt es nichts zu messen. Der Wert ist dann eine Prognose dessen, was die nächste Anfrage enthalten würde. Nach einer Ausführung zeigt er, was diese Anfrage tatsächlich enthielt.
Das Panel sagt dir, welchen der beiden Werte du gerade siehst. Dass eine Prognose später von der Messung abweicht, ist normal: Der Agent kann eine Erinnerung oder ein Tool-Ergebnis heranziehen, das nicht vorhersehbar war.
Ressourcen
Abschnitt betitelt „Ressourcen“Das Panel listet außerdem die Anhänge auf, die in dieser Unterhaltung geladen sind. Wählst du einen aus, scrollt die Ansicht zu der Nachricht, mit der er kam. So findest du „den Screenshot von vorhin“ in einem langen Thread am schnellsten.
Wenn das Fenster voll ist
Abschnitt betitelt „Wenn das Fenster voll ist“Ungefähr nach Wirkung geordnet:
- Starte eine neue Unterhaltung. Das wirkt mit Abstand am stärksten, denn ein neuer Thread schleppt keine der alten Nachrichten mit.
- Verschiebe dauerhafte Fakten vorher ins Gedächtnis oder ins Projekt, damit du im nächsten Thread nichts neu erklären musst.
- Entferne die Zuweisung von Tools, die der Agent nicht nutzt. Die Definitionen dieser Tools werden bei jedem Schritt erneut gesendet, egal ob sie aufgerufen werden oder nicht.
- Wähle ein Modell mit größerem Fenster. Die Modellauswahl zeigt die Größe jedes Modells. Das verschafft dir Platz, macht einen abschweifenden Thread aber nicht fokussierter.
Einschränkungen
Abschnitt betitelt „Einschränkungen“- Die Fenstergröße gibt das Modell vor. Wechselst du das Modell, ändert sich die Obergrenze.
- Beim Kürzen fallen die ältesten Nachrichten zuerst weg, ohne dass sie zusammengefasst werden.
- Die Aufschlüsselung spiegelt die letzte Ausführung wider. Änderungen, die du danach vornimmst (etwa ein Tool zuweisen oder den Prompt bearbeiten), erscheinen bei der nächsten.