# Das Kontextfenster

> Jedes Modell hat nur begrenzt Platz. Die Anzeige zeigt, wie viel davon diese Unterhaltung belegt, und das Panel zeigt, was den Platz einnimmt.

Ein Modell liest pro Anfrage eine feste Menge Text, sein **Kontextfenster**. Alles, was der Agent braucht, muss hineinpassen: seine Anweisungen, sein Gedächtnis, die Tools, die er aufrufen kann, deine Unterhaltung und deine Anhänge.

Das Eingabefeld zeigt, wie voll dieses Fenster ist, und das Kontext-Panel zeigt, womit es gefüllt ist.

## Warum das wichtig ist

Je voller das Fenster, desto schlechter werden zwei Dinge:

- **Ältere Nachrichten werden abgeschnitten.** Der Agent sieht den Anfang eines langen Threads nicht mehr.
- **Jeder Schritt kostet mehr.** Bei jedem Schritt einer [Ausführung](/de/docs/work/runs/) wird der gesamte Kontext erneut gesendet. Eine umfangreiche Unterhaltung ist also langsamer und teurer.

Wenn ein Agent „vergisst, was wir am Anfang gesagt haben“, ist fast immer das Fenster voll und nicht das Gedächtnis kaputt.

## Was den Platz belegt

Das Panel teilt das Fenster in Segmente auf:

| Segment | Was es ist |
| --- | --- |
| **Systemanweisungen** | Der Rahmen, den endue um jede Ausführung legt |
| **Identität** | Name, Persönlichkeit und Profil des Agenten |
| **Agentenanweisungen** | Sein [Systemprompt](/de/docs/build/system-prompt/) in der aktuellen Revision |
| **Anweisungs-Skills** | Skills, deren Inhalt eine dauerhafte Anleitung ist statt eines Befehls |
| **Gedächtnis** | Die [Erinnerungen](/de/docs/capabilities/memory/), die für diese Unterhaltung relevant sind |
| **Tool-Definitionen** | Das Schema jedes Tools, das der Agent aufrufen kann |
| **Nachrichten der Unterhaltung** | Was du und der Agent gesagt habt |
| **Angehängte Medien** | [Anhänge](/de/docs/work/attachments/), getrennt von den Nachrichten gezählt |

Tools werden noch feiner aufgeschlüsselt: Für jeden Skill, jeden Connector, jede Gruppe integrierter Tools und jedes Gerät siehst du, was das Anbieten der Definitionen kostet, wie viele Aufrufe es in der letzten Ausführung gab und wie viel die Ergebnisse ausmachten. Daran erkennst du den Unterschied zwischen *„dieses Tool ist teuer anzubieten“* und *„dieses Tool hat viel zurückgegeben“*.

## Gemessen oder prognostiziert

Vor der ersten [Ausführung](/de/docs/work/runs/) gibt es nichts zu messen. Der Wert ist dann eine **Prognose** dessen, was die nächste Anfrage enthalten würde. Nach einer Ausführung zeigt er, was diese Anfrage tatsächlich enthielt.

Das Panel sagt dir, welchen der beiden Werte du gerade siehst. Dass eine Prognose später von der Messung abweicht, ist normal: Der Agent kann eine Erinnerung oder ein Tool-Ergebnis heranziehen, das nicht vorhersehbar war.

## Ressourcen

Das Panel listet außerdem die Anhänge auf, die in dieser Unterhaltung geladen sind. Wählst du einen aus, scrollt die Ansicht zu der Nachricht, mit der er kam. So findest du *„den Screenshot von vorhin“* in einem langen Thread am schnellsten.

## Wenn das Fenster voll ist

Ungefähr nach Wirkung geordnet:

1. **Starte eine neue [Unterhaltung](/de/docs/work/conversations/).** Das wirkt mit Abstand am stärksten, denn ein neuer Thread schleppt keine der alten Nachrichten mit.
2. **Verschiebe dauerhafte Fakten vorher ins [Gedächtnis](/de/docs/capabilities/memory/) oder ins [Projekt](/de/docs/capabilities/projects/)**, damit du im nächsten Thread nichts neu erklären musst.
3. **Entferne die Zuweisung von Tools, die der Agent nicht nutzt.** Die Definitionen dieser Tools werden bei jedem Schritt erneut gesendet, egal ob sie aufgerufen werden oder nicht.
4. **Wähle ein Modell mit größerem Fenster.** Die Modellauswahl zeigt die Größe jedes Modells. Das verschafft dir Platz, macht einen abschweifenden Thread aber nicht fokussierter.

<Aside type="tip" title="Lange Threads kosten, auch wenn sie hineinpassen">
  Ein Schritt kostet den gesamten Kontext, nicht nur deinen neuen Satz. Zwei
  fokussierte Unterhaltungen kosten meist weniger und liefern bessere Antworten als
  eine, die drei Themen abgedeckt hat.
</Aside>

## Einschränkungen

- Die Fenstergröße gibt das Modell vor. Wechselst du das Modell, ändert sich die Obergrenze.
- Beim Kürzen fallen die ältesten Nachrichten zuerst weg, ohne dass sie zusammengefasst werden.
- Die Aufschlüsselung spiegelt die letzte Ausführung wider. Änderungen, die du danach vornimmst (etwa ein Tool zuweisen oder den Prompt bearbeiten), erscheinen bei der nächsten.

## Siehe auch

<CardGrid>
  <LinkCard
    title="Unterhaltungen"
    href="/de/docs/work/conversations/"
    description="Wann du einen neuen Thread beginnst, statt weiterzumachen."
  />
  <LinkCard
    title="Gedächtnis"
    href="/de/docs/capabilities/memory/"
    description="Fakten über Unterhaltungen hinweg mitnehmen, statt sie in einer einzelnen festzuhalten."
  />
  <LinkCard
    title="Ein Modell wählen"
    href="/de/docs/build/models/"
    description="Fenstergrößen und was jedes Modell pro Token kostet."
  />
</CardGrid>
