KI

Token-Schätzer für Text

LLMs rechnen nicht in Wörtern, sondern in Token. Als grobe Faustregel gilt für englischen Text rund 4 Zeichen pro Token, für deutschen Text durch Umlaute und lange Komposita eher 3 bis 3,5. Dieser Schätzer rechnet deine Zeichen- oder Wortzahl in eine Token-Spanne um und zeigt direkt die ungefähren Kosten, damit du Prompts und Dokumente realistisch einplanen kannst.

Wozu dient der Token-Schätzer für Text?

LLMs zählen nicht Wörter, sondern Token. Dieser Schätzer rechnet deine Zeichenzahl in eine realistische Token-Anzahl um und zeigt zusätzlich eine untere und obere Spanne, weil die genaue Zerlegung vom Modell abhängt. Über die Sprachauswahl wird der passende Zeichen-pro-Token-Faktor gesetzt: Englisch rund 4, Deutsch wegen Umlauten und Komposita etwa 3,3 und Code etwa 3,6.

So planst du Prompts, Dokumente und Kontextfenster realistisch. Der Anteil am 200k-Kontextfenster zeigt sofort, ob ein langes Dokument noch hineinpasst, und die ungefähren Kosten pro 1M Token helfen, große Eingaben grob zu budgetieren, bevor du sie an die API schickst.

Beispiele

  • 4.000 Zeichen deutscher Text ergeben bei Faktor 3,3 rund 1.212 Token und kosten bei 3 USD pro 1M etwa 0,0036 USD.
  • Derselbe Text als Englisch (Faktor 4) sinkt auf etwa 1.000 Token.
  • Ein 500.000-Zeichen-Dokument auf Deutsch belegt rund 151.000 Token, also etwa 76 % eines 200k-Kontextfensters.
  • Bei 4.000 Zeichen passt der Text rund 825-mal in ein 1-Million-Token-Budget.

Häufige Fragen zum Token-Schätzer für Text

Wie genau ist die Schätzung?

Es ist eine Faustregel auf Zeichenbasis, daher wird eine Spanne ausgegeben. Die echte Token-Zahl hängt vom konkreten Tokenizer des Modells ab und kann um 10 bis 20 Prozent abweichen.

Warum verbraucht Deutsch mehr Token als Englisch?

Deutsche Texte enthalten Umlaute und lange zusammengesetzte Wörter, die in mehrere Token zerfallen. Daher liegt der Faktor mit etwa 3,3 Zeichen pro Token niedriger als die rund 4 im Englischen.

Warum ist der Faktor für Code anders?

Quellcode enthält viele Symbole, Klammern und kurze Bezeichner, die unterschiedlich tokenisiert werden. Der mittlere Faktor von 3,6 bildet das näherungsweise ab.

Zählen Input und Output zusammen?

Dieser Schätzer betrachtet nur den eingegebenen Text. Die Antwort des Modells erzeugt zusätzliche Output-Token, die separat abgerechnet werden.