# Quantisierung erklärt: Q4 vs Q5 vs Q8 — der Entscheidungsbaum

Wer ein KI-Modell lokal auf dem eigenen PC betreiben will, stolpert sofort über kryptische
Kürzel: `Q4_K_M`, `Q5_K_S`, `Q8_0`. Das ist Quantisierung — und die Wahl entscheidet, ob
ein Modell überhaupt auf deine Grafikkarte passt und wie gut es antwortet. Diese Anleitung
erklärt das Prinzip in einfachen Worten und führt dich mit einem Entscheidungsbaum zur
richtigen Stufe.

Erstellt von der [FlowKI-Community](https://flowki-club.de). Erklärt das stabile
Grundprinzip — die konkreten Modelle ändern sich, die Quantisierungs-Logik bleibt.

---

## Was Quantisierung überhaupt ist

Ein Sprachmodell besteht aus Milliarden Zahlen (den „Gewichten"). Ursprünglich sind das
sehr präzise Zahlen (16 Bit pro Gewicht). Das ist genau, aber riesig — ein 7-Milliarden-
Modell braucht so schnell 14 GB und mehr.

**Quantisierung rundet diese Zahlen gröber** — statt 16 Bit nur noch 8, 5 oder 4 Bit pro
Gewicht. Das Modell wird dramatisch kleiner und schneller, verliert aber ein wenig
Genauigkeit. Die Kunst ist, so stark zu runden, dass es noch auf deine Hardware passt,
ohne dass die Qualität spürbar leidet.

> **Analogie:** Ein Foto von 50 MB auf 5 MB komprimieren. Bei moderater Kompression siehst
> du kaum einen Unterschied; übertreibst du es, wird es matschig. Q-Stufen sind nichts
> anderes als Kompressionsstufen für KI-Modelle.

## Die Kürzel entschlüsselt

- **Die Zahl (4, 5, 8)** = Bits pro Gewicht. Kleiner = kleinere Datei, weniger Genauigkeit.
- **`_K`** = die modernere „K-Quant"-Methode (bessere Qualität pro Bit als die alten
  Varianten). Nimm im Zweifel immer eine `_K`-Variante.
- **`_S`, `_M`, `_L`** = Small, Medium, Large innerhalb einer Stufe (wie viel Präzision an
  wichtigen Stellen erhalten bleibt). `_M` ist meist der beste Kompromiss.
- **`Q8_0`** = 8 Bit, praktisch verlustfrei — die Ausnahme ohne K-Suffix.

Beispiel: `Q4_K_M` = 4 Bit, K-Quant-Methode, Medium — der beliebteste Allrounder.

## Die drei Stufen im Vergleich

| Stufe | Größe (relativ) | Qualität | Wann sinnvoll |
|---|---|---|---|
| **Q4** (z.B. Q4_K_M) | am kleinsten | gut, minimaler Verlust | Standard bei knappem VRAM — der beste Kompromiss für die meisten |
| **Q5** (z.B. Q5_K_M) | mittel | sehr gut | wenn etwas mehr Speicher da ist und Qualität zählt |
| **Q8** (Q8_0) | am größten | praktisch wie das Original | wenn Speicher reichlich ist und maximale Genauigkeit gefragt ist |

Faustregel für den Speicherbedarf: ein Modell mit *N* Milliarden Parametern braucht bei
Q4 grob *N × 0,6 GB*, bei Q8 etwa *N × 1,1 GB* — plus etwas Reserve für den Kontext. Ein
7B-Modell in Q4 passt also grob in ~5–6 GB.

## Der Entscheidungsbaum

**Frage 1 — Wie viel VRAM (Grafikspeicher) hat deine GPU, bzw. wie viel RAM steht bereit?**
Das ist die harte Grenze: Passt das Modell nicht in den Speicher, läuft es gar nicht oder
extrem langsam.

**Frage 2 — Passt das gewünschte Modell in Q8 hinein?**
→ **Ja und Genauigkeit ist dir wichtig:** nimm **Q8_0**. Praktisch keine Qualitätsverluste.
→ **Nein:** weiter zu Frage 3.

**Frage 3 — Passt es in Q5?**
→ **Ja:** nimm **Q5_K_M**. Sehr gute Qualität, moderater Speicherbedarf.
→ **Nein:** weiter zu Frage 4.

**Frage 4 — Passt es in Q4?**
→ **Ja:** nimm **Q4_K_M**. Der Standard-Kompromiss — läuft überall gut, minimaler Verlust.
→ **Nein:** Das Modell ist zu groß für deine Hardware. Wähle ein **kleineres Modell**
   (z.B. ein 7B/8B statt 13B) in Q4, statt ein zu großes stärker zu quetschen.

## Zwei Faustregeln, die dir Ärger sparen

1. **Größeres Modell in Q4 schlägt kleineres Modell in Q8.** Wenn du wählen musst, ist ein
   größeres Modell mit stärkerer Quantisierung meist besser als ein kleines, kaum
   quantisiertes. Erst die Modellgröße, dann die Q-Stufe.
2. **Unter Q4 wird es riskant.** 3-Bit- und 2-Bit-Quantisierungen (Q3, Q2) sparen weiter
   Speicher, aber die Qualität fällt oft spürbar ab. Nur nutzen, wenn es gar nicht anders
   passt.

## Womit du das umsetzt

Quantisierte Modelle im **GGUF**-Format lädst du z.B. mit **Ollama**, **LM Studio** oder
**llama.cpp**. Auf Plattformen wie Hugging Face findest du zu fast jedem Modell fertige
GGUF-Dateien in allen Q-Stufen — du lädst einfach die passende herunter.

Welche Q-Stufe läuft bei dir am besten? In der [FlowKI-Community](https://flowki-club.de)
teilen andere ihre Hardware-Konfigurationen und Erfahrungswerte.
