Prompt-Caching-Ersparnis-Rechner
Viele LLM-Anbieter bieten Prompt-Caching: wiederkehrende Eingabe-Token wie ein langer Systemprompt oder ein angehängtes Dokument werden stark vergünstigt abgerechnet, nachdem sie einmal voll bezahlt wurden. Dieser Rechner zeigt, wie viel dir Caching bei deinem Wiederholungsmuster konkret spart.
Dieses Tool ist für Mitglieder
Dieses Premium-Tool schaltest du mit einem kostenlosen Konto frei — zusammen mit allen anderen Profi-Tools und den ganzen Wissen-Artikeln.
100 % kostenlos · keine Kreditkarte · sofort freigeschaltet
Wozu dient der Prompt-Caching-Ersparnis-Rechner?
Prompt-Caching ist einer der wirksamsten Hebel, um LLM-Kosten zu senken. Wiederkehrende Eingabe-Token wie ein langer Systemprompt, eine Werkzeugbeschreibung oder ein angehängtes Referenzdokument werden nach dem ersten vollen Bezahlen für eine gewisse Zeit stark vergünstigt abgerechnet, oft mit 75 bis 90 Prozent Rabatt auf die Treffer.
Dieser Rechner zeigt, wie viel dir Caching bei deinem konkreten Wiederholungsmuster spart. Entscheidend sind die Menge der cachebaren Token, deine Cache-Trefferquote und der gewährte Rabatt. Das Ergebnis vergleicht die Tages- und Monatskosten mit und ohne Cache und nennt die prozentuale Ersparnis. So erkennst du sofort, ob sich das Strukturieren deiner Prompts in einen festen, cachebaren Block lohnt.
Beispiele
- Großer Systemprompt: 2.000 Anfragen/Tag mit 5.000 cachebaren Token, 85 % Trefferquote, 90 % Rabatt, Preis
3 USD/1M senken die Monatskosten von rund 911 € auf etwa 277 €. - Ersparnis: Das entspricht gut
69 %weniger Input-Kosten, rund 633 €/Monat. - Trefferquote zählt: Sinkt die Quote auf 50 %, fällt die Ersparnis deutlich geringer aus, weil mehr Anfragen den vollen Preis zahlen.
- Kleiner Cache lohnt kaum: Bei nur 300 cachebaren von 5.500 Input-Token bleibt der Effekt klein.
Häufige Fragen zum Prompt-Caching-Ersparnis-Rechner
Was zählt als cachebare Token?
Alles, was über viele Anfragen identisch am Anfang des Prompts steht: Systemprompt, Werkzeug- und Funktionsdefinitionen, Few-Shot-Beispiele und feste Referenzdokumente. Variabler Text wie die aktuelle Nutzerfrage ist nicht cachebar.
Wie erreiche ich eine hohe Trefferquote?
Halte den cachebaren Block am Prompt-Anfang konstant und unverändert, sende Anfragen häufig genug innerhalb der Cache-Lebensdauer und vermeide es, frühe Token zwischen Aufrufen zu verändern, da das den Cache invalidiert.
Kostet das Schreiben in den Cache extra?
Bei einigen Anbietern ja: Das erstmalige Cachen kann etwas teurer sein als ein normaler Input-Token. Dieser Rechner modelliert vereinfacht den Rabatt auf Treffer; bei nennenswerten Schreibaufschlägen fällt die reale Ersparnis etwas geringer aus.
Wie lange bleibt etwas im Cache?
Das hängt vom Anbieter ab, oft wenige Minuten bis Stunden ab dem letzten Zugriff. Bei kontinuierlichem Traffic bleibt der Cache warm; bei seltenen Anfragen läuft er aus und muss neu aufgebaut werden.