← Alle Tools Kostenloses Tool

Token/s-Visualizer: Wie schnell ist schnell genug?

Benchmarks nennen Zahlen — hier fühlen Sie sie. Rate einstellen, Stream starten, zwei Geschwindigkeiten direkt vergleichen.

Streaming-Demo

5 Token/s · Stream A langsamer als Ihr Lesetempo (~5.5 Token/s)
Der Beispieltext (316 Token, ≈ 211 Wörter) erscheint hier im gewählten Tempo …
0 / 316 Token Gesamtdauer bei dieser Rate: 1 min 3 s
90 Token/s · Stream B schneller als Ihr Lesetempo (~5.5 Token/s)
Der Beispieltext (316 Token, ≈ 211 Wörter) erscheint hier im gewählten Tempo …
0 / 316 Token Gesamtdauer bei dieser Rate: 3,5 s

Faustregeln: 1 deutsches Wort ≈ 1.5 Token; stilles Lesen ≈ 220 Wörter/Minute ≈ 5.5 Token/s. Hardware-Richtwerte sind grobe Größenordnungen (7B-Modell, 4-Bit) und ersetzen keinen Benchmark. Stand: 15.8.2026.

Nachschlagen

Was bedeuten die Raten in der Praxis?

So lange dauert eine typische Chat-Antwort von 500 Token (≈ 333 Wörter) bei den gängigen Setups:

Setup (Richtwert) Token/s Dauer für 500 Token Einordnung
Laptop-CPU 7B-Modell, 4-Bit-Quantisierung, reine CPU-Inferenz 5 1 min 40 s langsamer als Lesetempo — fühlt sich zäh an
Apple M-Serie 7B-Modell auf einem MacBook (Metal) 25 20 s angenehmes Chat-Tempo
Gaming-GPU 7B-Modell auf einer RTX 3090/4090 60 8,3 s schneller als Lesetempo — flüssig
Cloud-API typische Streaming-Rate großer API-Anbieter 90 5,6 s schneller als Lesetempo — flüssig
Schnelle Inferenz auf Durchsatz optimierte Anbieter / kleine Modelle 250 2 s quasi sofort — für Batch & Agenten

Zum Vergleich: Ihr eigenes Lesetempo liegt bei etwa 5.5 Token/s (220 Wörter/Minute).

Häufige Fragen

Token, Geschwindigkeit & Hardware

Was ist ein Token?

Der kleinste Textbaustein, den ein Sprachmodell erzeugt — meist 3–5 Zeichen. Häufige deutsche Wörter sind ein einzelnes Token, lange Komposita zerfallen in mehrere. Als Faustregel entspricht ein deutsches Wort etwa 1,5 Token; 1.000 Token sind also rund 650–700 Wörter.

Wie viele Token pro Sekunde brauche ich?

Für einen Chat reicht es, wenn das Modell schneller schreibt, als Sie lesen: Bei ~220 Wörtern pro Minute Lesetempo sind das etwa 5–6 Token/s. Für das Zusammenfassen langer Dokumente, Codegenerierung oder Batch-Verarbeitung zählt dagegen jede Verzehnfachung — 500 Token dauern bei 5 Token/s 100 Sekunden, bei 250 Token/s zwei.

Wovon hängt die Generierungsgeschwindigkeit ab?

Vor allem von der Modellgröße (7B ist um ein Vielfaches schneller als 70B), der Quantisierung (4-Bit spart Speicherbandbreite), der Hardware (Speicherbandbreite der GPU ist meist der Flaschenhals) und der Kontextlänge. Bei API-Anbietern kommt die Auslastung der Server hinzu.

Ist Token/s dasselbe wie die Antwortzeit?

Nein. Die gefühlte Reaktionszeit setzt sich aus der Zeit bis zum ersten Token (Time to First Token, Prompt-Verarbeitung) und der Generierungsrate zusammen. Ein System kann schnell generieren, aber lange „nachdenken" — für Chats sind beide Werte wichtig.

Sind die Hardware-Richtwerte exakt?

Nein, es sind bewusst grobe Größenordnungen für ein 7B-Modell mit 4-Bit-Quantisierung. Modellgröße, Kontextlänge, Batchgröße und Softwarestack verschieben die Werte erheblich — der Visualizer soll vermitteln, wie sich eine Rate anfühlt, nicht ein Benchmark ersetzen.

KI, die im Alltag ankommt

Overfit baut KI-Produkte für Verwaltung und Mittelstand — von der semantischen Ausschreibungssuche bis zur automatischen Texterstellung.