// entscheidungsbaum / lokale KI-modelle
Quantisierung: Q4 vs Q5 vs Q8
Wer ein KI-Modell lokal betreiben will, stolpert sofort über Kürzel wie Q4_K_M, Q5_K_S, Q8_0. Das ist Quantisierung — und die Wahl entscheidet, ob ein Modell auf deine Grafikkarte passt. Diese Anleitung erklärt das Prinzip einfach und führt dich mit einem Entscheidungsbaum zur richtigen Stufe.
Wer ein KI-Modell lokal auf dem eigenen PC betreiben will, stolpert sofort über kryptische
Kürzel: Q4_K_M, Q5_K_S, Q8_0. Das ist Quantisierung — und die Wahl entscheidet, ob
ein Modell überhaupt auf deine Grafikkarte passt und wie gut es antwortet. Diese Anleitung
erklärt das Prinzip in einfachen Worten und führt dich mit einem Entscheidungsbaum zur
richtigen Stufe.
Erstellt von der FlowKI-Community. Erklärt das stabile Grundprinzip — die konkreten Modelle ändern sich, die Quantisierungs-Logik bleibt.
Was Quantisierung überhaupt ist
Ein Sprachmodell besteht aus Milliarden Zahlen (den „Gewichten"). Ursprünglich sind das sehr präzise Zahlen (16 Bit pro Gewicht). Das ist genau, aber riesig — ein 7-Milliarden- Modell braucht so schnell 14 GB und mehr.
Quantisierung rundet diese Zahlen gröber — statt 16 Bit nur noch 8, 5 oder 4 Bit pro Gewicht. Das Modell wird dramatisch kleiner und schneller, verliert aber ein wenig Genauigkeit. Die Kunst ist, so stark zu runden, dass es noch auf deine Hardware passt, ohne dass die Qualität spürbar leidet.
Analogie: Ein Foto von 50 MB auf 5 MB komprimieren. Bei moderater Kompression siehst du kaum einen Unterschied; übertreibst du es, wird es matschig. Q-Stufen sind nichts anderes als Kompressionsstufen für KI-Modelle.
Die Kürzel entschlüsselt
- Die Zahl (4, 5, 8) = Bits pro Gewicht. Kleiner = kleinere Datei, weniger Genauigkeit.
_K= die modernere „K-Quant"-Methode (bessere Qualität pro Bit als die alten Varianten). Nimm im Zweifel immer eine_K-Variante._S,_M,_L= Small, Medium, Large innerhalb einer Stufe (wie viel Präzision an wichtigen Stellen erhalten bleibt)._Mist meist der beste Kompromiss.Q8_0= 8 Bit, praktisch verlustfrei — die Ausnahme ohne K-Suffix.
Beispiel: Q4_K_M = 4 Bit, K-Quant-Methode, Medium — der beliebteste Allrounder.
Die drei Stufen im Vergleich
| Stufe | Größe (relativ) | Qualität | Wann sinnvoll |
|---|---|---|---|
| Q4 (z.B. Q4_K_M) | am kleinsten | gut, minimaler Verlust | Standard bei knappem VRAM — der beste Kompromiss für die meisten |
| Q5 (z.B. Q5_K_M) | mittel | sehr gut | wenn etwas mehr Speicher da ist und Qualität zählt |
| Q8 (Q8_0) | am größten | praktisch wie das Original | wenn Speicher reichlich ist und maximale Genauigkeit gefragt ist |
Faustregel für den Speicherbedarf: ein Modell mit N Milliarden Parametern braucht bei Q4 grob N × 0,6 GB, bei Q8 etwa N × 1,1 GB — plus etwas Reserve für den Kontext. Ein 7B-Modell in Q4 passt also grob in ~5–6 GB.
Der Entscheidungsbaum
Frage 1 — Wie viel VRAM (Grafikspeicher) hat deine GPU, bzw. wie viel RAM steht bereit? Das ist die harte Grenze: Passt das Modell nicht in den Speicher, läuft es gar nicht oder extrem langsam.
Frage 2 — Passt das gewünschte Modell in Q8 hinein? → Ja und Genauigkeit ist dir wichtig: nimm Q8_0. Praktisch keine Qualitätsverluste. → Nein: weiter zu Frage 3.
Frage 3 — Passt es in Q5? → Ja: nimm Q5_K_M. Sehr gute Qualität, moderater Speicherbedarf. → Nein: weiter zu Frage 4.
Frage 4 — Passt es in Q4? → Ja: nimm Q4_K_M. Der Standard-Kompromiss — läuft überall gut, minimaler Verlust. → Nein: Das Modell ist zu groß für deine Hardware. Wähle ein kleineres Modell (z.B. ein 7B/8B statt 13B) in Q4, statt ein zu großes stärker zu quetschen.
Zwei Faustregeln, die dir Ärger sparen
- Größeres Modell in Q4 schlägt kleineres Modell in Q8. Wenn du wählen musst, ist ein größeres Modell mit stärkerer Quantisierung meist besser als ein kleines, kaum quantisiertes. Erst die Modellgröße, dann die Q-Stufe.
- Unter Q4 wird es riskant. 3-Bit- und 2-Bit-Quantisierungen (Q3, Q2) sparen weiter Speicher, aber die Qualität fällt oft spürbar ab. Nur nutzen, wenn es gar nicht anders passt.
Womit du das umsetzt
Quantisierte Modelle im GGUF-Format lädst du z.B. mit Ollama, LM Studio oder llama.cpp. Auf Plattformen wie Hugging Face findest du zu fast jedem Modell fertige GGUF-Dateien in allen Q-Stufen — du lädst einfach die passende herunter.
Welche Q-Stufe läuft bei dir am besten? In der FlowKI-Community teilen andere ihre Hardware-Konfigurationen und Erfahrungswerte.
// weiter geht's in der community
Fragen, Feedback, eigene Ergänzungen?
Dieses Freebie ist ein Startpunkt, kein Endpunkt. Im deutschsprachigen FlowKI-Club-Discord besprichst du deine Fälle mit anderen KI-Praktikern, bekommst Updates zu den Sammlungen zuerst und kannst eigene Beiträge einbringen.
Zur FlowKI-Community →