KI

RAG-System-Kosten-Rechner

Ein RAG-System kombiniert mehrere Kostenblöcke: das einmalige Einbetten der Wissensbasis, die pro Anfrage abgefragten Kontext-Chunks und die eigentliche LLM-Antwort. Dieser Rechner addiert alle Bausteine zu einem Preis pro Anfrage und einem Monatsbudget, damit du dein RAG-Projekt sauber kalkulierst.

Wozu dient der RAG-System-Kosten-Rechner?

Ein RAG-System (Retrieval Augmented Generation) beantwortet Fragen, indem es passende Textausschnitte aus einer Wissensbasis abruft und sie dem LLM als Kontext mitgibt. Die laufenden Kosten pro Anfrage entstehen dabei vor allem durch diesen abgerufenen Kontext: Mehrere Chunks zu je einigen hundert Token werden als Input bezahlt, dazu kommen die Nutzerfrage und die generierte Antwort.

Dieser Rechner addiert alle Bausteine zu einem Preis pro Anfrage und rechnet auf Tages-, Monats- und Jahresbudget hoch. Besonders aufschlussreich ist der Anteil des Kontexts an den Input-Kosten, denn er ist meist der größte Hebel: Weniger oder kleinere Chunks senken die Kosten spürbar. So kalkulierst du dein RAG-Projekt sauber und erkennst, wo du optimieren kannst.

Beispiele

  • Standard-RAG: 1.000 Anfragen/Tag, 5 Chunks à 512 Token, 300 Token Frage, 500 Antwort-Token, Preise 3/15 USD ergeben rund 444 €/Monat.
  • Kontext dominiert: Die 2.560 Kontext-Token machen hier etwa 90 % der Input-Token aus.
  • Weniger Chunks sparen: Reduzierst du von 5 auf 3 Chunks, sinken Input-Kosten und Monatsbudget deutlich.
  • Pro Anfrage: Eine einzelne RAG-Anfrage kostet in diesem Beispiel nur etwa 0,01 €.

Häufige Fragen zum RAG-System-Kosten-Rechner

Was ist ein Chunk?

Ein Chunk ist ein zusammenhängender Textausschnitt aus deiner Wissensbasis, in den die Dokumente vor dem Embedding zerlegt werden, typisch 256 bis 1.024 Token. Pro Anfrage werden die relevantesten Chunks abgerufen und als Kontext mitgeschickt.

Warum ist der Kontext der größte Kostenfaktor?

Weil mehrere Chunks zu je hunderten Token bei jeder Anfrage als Input bezahlt werden, oft mehr als Frage und Antwort zusammen. Weniger oder kürzere Chunks und ein präziseres Retrieval senken die Kosten am wirksamsten.

Sind die Embedding-Kosten hier enthalten?

Nein, dieser Rechner deckt nur die laufenden Generierungskosten pro Anfrage ab. Die einmaligen Kosten für das Einbetten der Wissensbasis berechnest du mit dem Embedding-Kosten-Rechner separat.

Wie senke ich die Kosten pro RAG-Anfrage?

Rufe weniger Chunks ab, nutze kleinere Chunk-Größen, setze ein günstigeres Modell für einfache Fragen ein und aktiviere Prompt-Caching für wiederkehrende Systemanweisungen und häufig abgerufene Dokumente.