Token/s-Visualizer: Wie schnell ist schnell genug?
Benchmarks nennen Zahlen — hier fühlen Sie sie. Rate einstellen, Stream starten, zwei Geschwindigkeiten direkt vergleichen.
Streaming-Demo
Faustregeln: 1 deutsches Wort ≈ 1.5 Token; stilles Lesen ≈ 220 Wörter/Minute ≈ 5.5 Token/s. Hardware-Richtwerte sind grobe Größenordnungen (7B-Modell, 4-Bit) und ersetzen keinen Benchmark. Stand: 15.8.2026.
Was bedeuten die Raten in der Praxis?
So lange dauert eine typische Chat-Antwort von 500 Token (≈ 333 Wörter) bei den gängigen Setups:
| Setup (Richtwert) | Token/s | Dauer für 500 Token | Einordnung |
|---|---|---|---|
| Laptop-CPU 7B-Modell, 4-Bit-Quantisierung, reine CPU-Inferenz | 5 | 1 min 40 s | langsamer als Lesetempo — fühlt sich zäh an |
| Apple M-Serie 7B-Modell auf einem MacBook (Metal) | 25 | 20 s | angenehmes Chat-Tempo |
| Gaming-GPU 7B-Modell auf einer RTX 3090/4090 | 60 | 8,3 s | schneller als Lesetempo — flüssig |
| Cloud-API typische Streaming-Rate großer API-Anbieter | 90 | 5,6 s | schneller als Lesetempo — flüssig |
| Schnelle Inferenz auf Durchsatz optimierte Anbieter / kleine Modelle | 250 | 2 s | quasi sofort — für Batch & Agenten |
Zum Vergleich: Ihr eigenes Lesetempo liegt bei etwa 5.5 Token/s (220 Wörter/Minute).
Token, Geschwindigkeit & Hardware
Was ist ein Token?
Der kleinste Textbaustein, den ein Sprachmodell erzeugt — meist 3–5 Zeichen. Häufige deutsche Wörter sind ein einzelnes Token, lange Komposita zerfallen in mehrere. Als Faustregel entspricht ein deutsches Wort etwa 1,5 Token; 1.000 Token sind also rund 650–700 Wörter.
Wie viele Token pro Sekunde brauche ich?
Für einen Chat reicht es, wenn das Modell schneller schreibt, als Sie lesen: Bei ~220 Wörtern pro Minute Lesetempo sind das etwa 5–6 Token/s. Für das Zusammenfassen langer Dokumente, Codegenerierung oder Batch-Verarbeitung zählt dagegen jede Verzehnfachung — 500 Token dauern bei 5 Token/s 100 Sekunden, bei 250 Token/s zwei.
Wovon hängt die Generierungsgeschwindigkeit ab?
Vor allem von der Modellgröße (7B ist um ein Vielfaches schneller als 70B), der Quantisierung (4-Bit spart Speicherbandbreite), der Hardware (Speicherbandbreite der GPU ist meist der Flaschenhals) und der Kontextlänge. Bei API-Anbietern kommt die Auslastung der Server hinzu.
Ist Token/s dasselbe wie die Antwortzeit?
Nein. Die gefühlte Reaktionszeit setzt sich aus der Zeit bis zum ersten Token (Time to First Token, Prompt-Verarbeitung) und der Generierungsrate zusammen. Ein System kann schnell generieren, aber lange „nachdenken" — für Chats sind beide Werte wichtig.
Sind die Hardware-Richtwerte exakt?
Nein, es sind bewusst grobe Größenordnungen für ein 7B-Modell mit 4-Bit-Quantisierung. Modellgröße, Kontextlänge, Batchgröße und Softwarestack verschieben die Werte erheblich — der Visualizer soll vermitteln, wie sich eine Rate anfühlt, nicht ein Benchmark ersetzen.
KI, die im Alltag ankommt
Overfit baut KI-Produkte für Verwaltung und Mittelstand — von der semantischen Ausschreibungssuche bis zur automatischen Texterstellung.