KI

Kontextfenster-Auslastungs-Rechner

Jedes Modell hat ein festes Kontextfenster, das sich Systemprompt, Chatverlauf, angehängte Dokumente und die Antwort teilen müssen. Wird es überschritten, bricht der Aufruf ab oder ältere Nachrichten fallen heraus. Dieser Rechner addiert deine Token-Bestandteile, zeigt die prozentuale Auslastung und sagt dir, wie viele Token noch frei sind, bevor es eng wird.

Wozu dient der Kontextfenster-Auslastungs-Rechner?

Jedes LLM hat ein festes Kontextfenster, das sich Systemprompt, bisheriger Chatverlauf, angehängte Dokumente und die reservierte Antwort teilen müssen. Wird das Limit überschritten, bricht der Aufruf ab oder ältere Nachrichten fallen heraus. Dieser Rechner addiert deine Token-Bestandteile, zeigt die prozentuale Auslastung und sagt dir, wie viele Token noch frei sind.

Setze ihn ein, bevor du lange Dokumente anhängst oder einen langen Gesprächsverlauf weiterführst. Der Status meldet sofort, ob alles passt oder ein Überlauf droht, und der Wert für maximal zusätzlichen Verlauf zeigt, wie viel Spielraum noch bleibt, ohne die reservierte Antwort zu gefährden.

Beispiele

  • Bei 200k-Fenster, 1.200 System-, 8.000 Verlaufs-, 40.000 Dokument- und 4.000 Antwort-Token sind rund 26,6 % belegt, etwa 146.800 Token bleiben frei.
  • Hängst du ein 180.000-Token-Dokument an, kippt der Status auf Überlauf, sobald die Summe 200k übersteigt.
  • Ein 8k-Fenster mit 6.000 Eingabe- und 4.000 Antwort-Token zeigt 125 % Auslastung und 2.000 Überlauf-Token.
  • Reservierst du 4.000 Antwort-Token in einem 200k-Fenster, sind das nur 2 % Antwort-Reserve.

Häufige Fragen zum Kontextfenster-Auslastungs-Rechner

Was zählt alles ins Kontextfenster?

Systemprompt, gesamter bisheriger Chatverlauf, alle angehängten Dokumente sowie der für die Antwort reservierte Platz. Diese Summe darf das Modelllimit nicht überschreiten.

Was passiert bei Überlauf?

Je nach Anbieter wird der Aufruf mit einem Fehler abgelehnt oder der älteste Teil des Verlaufs automatisch abgeschnitten, wodurch Informationen verloren gehen.

Warum muss ich Platz für die Antwort reservieren?

Die Ausgabe des Modells belegt ebenfalls Token im selben Fenster. Ohne Reserve bleibt für eine vollständige Antwort kein Platz und sie wird abgeschnitten.

Wie finde ich die Token-Zahl meiner Bestandteile?

Nutze einen Token-Schätzer oder die Tokenizer-Funktion deines Anbieters. Als Näherung gelten rund 3 bis 4 Zeichen pro Token.