Lokales-LLM-Geschwindigkeits-Rechner
Die Geschwindigkeit lokaler LLMs ist bei der Textgenerierung meist durch die Speicherbandbreite der GPU begrenzt: Für jedes Token müssen alle aktiven Gewichte einmal gelesen werden. Dieser Rechner schätzt aus Modellgröße, Quantisierung und Bandbreite, wie viele Token pro Sekunde du erwarten kannst und wie lange eine typische Antwort dauert.
Dieses Tool ist für Mitglieder
Dieses Premium-Tool schaltest du mit einem kostenlosen Konto frei — zusammen mit allen anderen Profi-Tools und den ganzen Wissen-Artikeln.
100 % kostenlos · keine Kreditkarte · sofort freigeschaltet
Wozu dient der Lokales-LLM-Geschwindigkeits-Rechner?
Die Generierungsgeschwindigkeit lokaler LLMs ist meist durch die Speicherbandbreite der GPU begrenzt, denn für jedes neue Token müssen alle aktiven Gewichte einmal gelesen werden. Dieser Rechner schätzt aus Modellgröße, Quantisierung und Bandbreite die theoretische Token-pro-Sekunde-Rate und korrigiert sie mit einer Praxis-Effizienz, da reale Systeme die Bandbreite nie voll nutzen.
Setze ihn ein, bevor du Hardware kaufst oder ein Modell auswählst, um realistisch einzuschätzen, wie flüssig die Ausgabe sein wird. Die Antwortzeit für eine typische Antwortlänge und die Wörter pro Minute machen das Ergebnis greifbar, die Bewertung ordnet die Geschwindigkeit von flüssig bis langsam ein.
Beispiele
- Ein 8-Mrd.-Modell in 4 bit (4 GB) bei
1.000 GB/sBandbreite und 70 % Effizienz erreicht rund 175 Token/s, eine 500-Token-Antwort dauert etwa 2,9 Sekunden. - In FP16 (16 GB) sinkt dasselbe Modell auf rund 44 Token/s bei gleicher Bandbreite.
- Ein 70-Mrd.-Modell in 4 bit (35 GB) liefert bei 1.000 GB/s nur noch rund 20 Token/s, also brauchbar statt flüssig.
- Bei 2.000 GB/s verdoppelt sich die Rate gegenüber 1.000 GB/s, da die Bandbreite der begrenzende Faktor ist.
Häufige Fragen zum Lokales-LLM-Geschwindigkeits-Rechner
Warum begrenzt die Speicherbandbreite die Geschwindigkeit?
Bei der Token-für-Token-Generierung müssen für jedes Token alle aktiven Gewichte aus dem Speicher gelesen werden. Die Bandbreite bestimmt, wie schnell das geht, und ist meist der Engpass.
Was bedeutet die Praxis-Effizienz?
Reale Systeme erreichen die theoretische Bandbreite nie vollständig, typisch sind 60 bis 80 Prozent. Der Faktor korrigiert die theoretische Rate auf einen realistischen Erwartungswert.
Warum ist ein quantisiertes Modell schneller?
Weniger Bits pro Gewicht bedeuten eine kleinere Modellgröße, die pro Token aus dem Speicher gelesen wird. Dadurch steigt die Token-Rate fast proportional zur Verkleinerung.
Gilt das auch für den Prompt?
Nein, das Einlesen des Prompts ist rechengebunden und meist deutlich schneller. Der Rechner schätzt die Geschwindigkeit der Generierung neuer Token.