Warum dieser Artikel existiert
Viele Anleitungen für lokale KI-Modelle setzen 16 GB RAM voraus. Die Realität: Ein Großteil der Business-Laptops und Consumer-Notebooks hat 8 GB. Nach Betriebssystem, Browser und zwei geöffneten Programmen bleiben davon noch 4-5 GB nutzbar.
Dieser Artikel zeigt, welche Modelle in diesem Budget wirklich laufen — inklusive Setup, Performance-Erwartungen und den ehrlichen Grenzen dessen, was bei 8 GB möglich ist.
Wenn dein System 16 GB oder mehr hat, lies stattdessen Die besten lokalen KI-Modelle für 16/32/64/128 GB RAM. Für die grundlegende Einrichtung von Ollama siehe KI lokal in 20 Minuten.
Was bei 8 GB RAM technisch passiert
Ein Modell mit 3 Milliarden Parametern braucht in voller Präzision (FP16) etwa 6 GB RAM. Durch Quantisierung auf 4 Bit (Q4_K_M) schrumpft das auf rund 2-3 GB — ein Kompressionsfaktor von etwa 72%.
Das ist der Sweet Spot für 8-GB-Systeme: 1B- bis 4B-Modelle in Q4_K_M-Quantisierung. Alles darüber wird langsam oder swappt auf die Festplatte, was die Geschwindigkeit drastisch reduziert.
Hinweis zu den Zahlen: Die RAM-Angaben unten stammen aus den offiziellen Modell-Dokumentationen von Ollama, Hugging Face und Meta. Token/s-Werte sind illustrative Richtwerte aus Community-Tests, keine exakten Messungen auf diesem spezifischen System.
Die 5 besten Modelle für 8 GB RAM
Sortiert nach RAM-Bedarf, von kleinstem zu größtem.
1. Gemma 2 2B — der Leichteste
RAM-Bedarf: ~1,7 GB
Download-Größe: ~1,5 GB
Typische CPU-Geschwindigkeit: 40-60 tok/s
Wofür geeignet:
- Kurze Zusammenfassungen
- Einfache Chat-Aufgaben
- FAQ-Beantwortung
- Schnelle Übersetzungen
Installation:
ollama pull gemma2:2b
ollama run gemma2:2b
Qualität (subjektiv 1-10):
- Deutscher Text: 6
- Englischer Text: 7
- Coding: 4
- Reasoning: 4
- Zusammenfassungen: 7
Das kleinste brauchbare Modell für echte Aufgaben. Deutlich besser als TinyLlama, aber für Code oder komplexes Reasoning zu schwach.
2. Llama 3.2 1B — der schnellste Starter
RAM-Bedarf: ~1,3 GB
Download-Größe: ~1,3 GB
Typische CPU-Geschwindigkeit: 50-70 tok/s
Wofür geeignet:
- Mobile Geräte / sehr alte Laptops
- Einfachste Aufgaben
- Tests / Experimente
Installation:
ollama pull llama3.2:1b
ollama run llama3.2:1b
Qualität (subjektiv 1-10):
- Deutscher Text: 5
- Englischer Text: 6
- Coding: 3
- Reasoning: 3
- Zusammenfassungen: 6
Nur für sehr einfache Aufgaben. Wenn du zwischen 1B und 3B wählen kannst, nimm die 3B-Variante — der Qualitätssprung lohnt sich.
3. Llama 3.2 3B — die beste Balance
RAM-Bedarf: ~2,5 GB
Download-Größe: ~2 GB
Typische CPU-Geschwindigkeit: 10-12 tok/s
Wofür geeignet:
- Alltagschat
- Content-Zusammenfassungen
- Einfaches Debugging
- Dokument-Analysen (kurze Texte)
Installation:
ollama pull llama3.2:3b
ollama run llama3.2:3b
Qualität (subjektiv 1-10):
- Deutscher Text: 7
- Englischer Text: 8
- Coding: 5
- Reasoning: 5
- Zusammenfassungen: 8
Empfehlung: Das ist die Standardwahl für 8 GB RAM. Beste Kombination aus Geschwindigkeit, Qualität und Ressourcen-Bedarf.
4. Phi-4 Mini — der Performance-Champion
RAM-Bedarf: ~3 GB (Q4_K_M)
Download-Größe: ~2,8 GB
Typische CPU-Geschwindigkeit: 20-28 tok/s
Wofür geeignet:
- Mathematik
- Logik-Aufgaben
- Strukturierte Analysen
- Coding (einfache Scripts)
Installation:
ollama pull phi4:mini
ollama run phi4:mini
Qualität (subjektiv 1-10):
- Deutscher Text: 6
- Englischer Text: 8
- Coding: 7
- Reasoning: 8
- Zusammenfassungen: 6
Phi-4 ist spezialisiert auf strukturiertes Denken. Für kreative Texte schwächer als Llama 3.2 3B, für logische Aufgaben deutlich besser.
5. Qwen3.5 4B — der Coding-Spezialist
RAM-Bedarf: ~3,5 GB
Download-Größe: ~3 GB
Typische CPU-Geschwindigkeit: 8-12 tok/s
Wofür geeignet:
- Code-Vervollständigung
- Debugging
- Python/JavaScript-Hilfe
- Refactoring-Vorschläge
Installation:
ollama pull qwen3.5:4b
ollama run qwen3.5:4b
Qualität (subjektiv 1-10):
- Deutscher Text: 6
- Englischer Text: 7
- Coding: 8
- Reasoning: 6
- Zusammenfassungen: 6
Wenn du hauptsächlich Code schreibst und ein 8-GB-Limit hast, ist Qwen3.5 4B die beste Wahl.
Vergleichstabelle: Alle 5 Modelle
| Modell | Parameter | RAM (Q4_K_M) | Download | CPU tok/s | Beste Use-Cases | |--------|-----------|--------------|----------|-----------|-----------------| | Gemma 2 2B | 2B | 1,7 GB | 1,5 GB | 40-60 | Zusammenfassungen, FAQ, Speed | | Llama 3.2 1B | 1B | 1,3 GB | 1,3 GB | 50-70 | Mobile, einfachste Aufgaben | | Llama 3.2 3B | 3B | 2,5 GB | 2 GB | 10-12 | Allrounder — beste Balance | | Phi-4 Mini | 3,8B | 3 GB | 2,8 GB | 20-28 | Logik, Mathe, strukturiertes Denken | | Qwen3.5 4B | 4B | 3,5 GB | 3 GB | 8-12 | Coding, Debugging, Scripts |
Setup-Guide: Ollama in 15 Minuten
Schritt 1: Ollama installieren
Windows:
winget install Ollama.Ollama
macOS:
brew install ollama
Linux:
curl -fsSL https://ollama.com/install.sh | sh
Schritt 2: Erstes Modell laden
# Empfohlener Start: Llama 3.2 3B
ollama pull llama3.2:3b
# Modell starten
ollama run llama3.2:3b
Du bekommst ein interaktives Chat-Interface. Zum Beenden: /bye
Schritt 3: Mehrere Modelle parallel nutzen
Ollama lädt Modelle in den RAM, bis dieser voll ist. Danach entfernt es das älteste Modell automatisch.
Auf einem 8-GB-System kannst du typischerweise 1-2 Modelle gleichzeitig im Speicher halten. Der Wechsel zwischen bereits geladenen Modellen ist instant, das erste Laden dauert einige Sekunden.
# Modell 1: Chat
ollama run llama3.2:3b
# Neues Terminal, Modell 2: Code
ollama run qwen3.5:4b
Alternative: LM Studio (GUI)
Wer eine grafische Oberfläche bevorzugt:
- LM Studio herunterladen
- Installieren und starten
- Im Download-Tab: "llama-3.2-3b" suchen
- Variante mit "Q4_K_M" wählen → Download
- Im Chat-Tab: Modell auswählen → chatten
LM Studio zeigt RAM-Verbrauch live an und warnt, wenn ein Modell zu groß ist.
Was bei 8 GB nicht funktioniert
7B-Modelle — nur mit Kompromissen
Mistral 7B oder Llama 3.3 8B brauchen in Q4_K_M etwa 4-5 GB RAM. Technisch passt das knapp in 8 GB — praktisch wird es langsam:
- Du musst alle anderen Programme schließen
- Token/s sinkt auf 2-4 (statt 10+)
- Bei längeren Kontexten swappt das System
Fazit: 7B-Modelle sind auf 8-GB-Systemen nutzbar, aber nicht angenehm. Für gelegentliche Nutzung okay, für tägliche Arbeit zu zäh.
14B+ Modelle — komplett ausgeschlossen
Alles ab 14B (Qwen2.5-Coder 14B, Gemma2 27B) braucht mindestens 8-11 GB RAM. Auf einem 8-GB-System:
- Extrem langsam (< 1 tok/s)
- Konstantes Swapping
- System wird unbenutzbar
Siehe Die besten lokalen KI-Modelle für 16/32/64/128 GB RAM für höhere Klassen.
Multimodale Modelle (Vision)
LLaVA, Bakllava und andere Vision-Modelle brauchen deutlich mehr RAM als reine Text-Modelle. Die kleinste brauchbare Variante (LLaVA 7B) liegt schon außerhalb des 8-GB-Budgets.
Lange Kontexte (> 8k Tokens)
Die Modelle oben haben typisch 8k-128k Context-Windows. Praktisch nutzbar auf 8 GB:
- Llama 3.2 3B: 4k-8k Tokens
- Phi-4 Mini: 4k-16k Tokens
- Qwen3.5 4B: 4k-8k Tokens
Darüber wird der RAM-Bedarf exponentiell größer, weil der KV-Cache wächst.
Troubleshooting: Typische Probleme
Problem 1: "Model too large for available memory"
Ursache: Du versuchst ein 7B-Modell zu laden und hast zu viele andere Programme offen.
Lösung:
# 1. Alle Ollama-Modelle aus dem RAM werfen
ollama stop --all
# 2. Browser/IDE schließen
# 3. Modell erneut versuchen
ollama run llama3.2:3b
Problem 2: Extrem langsame Generierung (< 2 tok/s)
Ursache: System swappt auf Festplatte.
Kurzfristig:
- Kleineres Modell wählen (3B statt 7B)
- Context-Length reduzieren:
ollama run llama3.2:3b --context-length 2048
Langfristig:
- RAM aufrüsten auf 16 GB (meist 80-150€)
Problem 3: Modell gibt nur wirres Zeug aus
Ursache: Zu aggressive Quantisierung (Q2/Q3) oder kaputte Download.
Lösung:
# Modell neu laden
ollama rm llama3.2:3b
ollama pull llama3.2:3b
# Falls Problem bleibt: explizit Q4_K_M-Variante
ollama pull llama3.2:3b-q4-k-m
Problem 4: RAM-Verbrauch steigt mit der Zeit
Ursache: KV-Cache wächst bei langen Konversationen.
Lösung:
- Gespräch neu starten:
/byeundollama run <modell>erneut - Oder Ollama-Server neu starten:
ollama serve
Performance-Tuning für 8-GB-Systeme
1. Swap reduzieren (Linux)
# Aktuellen Wert prüfen
cat /proc/sys/vm/swappiness
# Auf 10 setzen (weniger aggressiv)
sudo sysctl vm.swappiness=10
2. Nur Q4_K_M verwenden
# ❌ Zu groß:
ollama pull llama3.2:3b-fp16
# ✅ Richtig:
ollama pull llama3.2:3b # lädt automatisch Q4_K_M
3. RAM-Monitoring
Linux/macOS:
watch -n 1 'free -h'
Windows: Task-Manager → Performance → Arbeitsspeicher
Wenn "Verfügbar" unter 1 GB fällt, ist das System am Limit.
4. Context-Length anpassen
Standardmäßig laden Modelle oft mit 4k-8k Context. Reduzieren spart RAM:
ollama run llama3.2:3b --context-length 2048
Das halbiert den KV-Cache-Bedarf. Für kurze Fragen völlig ausreichend.
Wie gut ist die Qualität wirklich?
Ein 3B-Modell ist kein Ersatz für GPT-4 oder Claude Opus. Realistischer Vergleich:
| Aufgabe | Llama 3.2 3B | GPT-4 | Bewertung | |---------|--------------|-------|-----------| | "Schreib mir eine E-Mail" | ✅ Gut genug | ✅✅ Perfekt | 80% der Cloud-Qualität | | "Erkläre Quantenphysik" | ⚠️ Oberflächlich | ✅✅ Tiefgehend | 40% der Cloud-Qualität | | "Debug diesen Python-Code" | ⚠️ Einfache Bugs | ✅✅ Komplexe Bugs | 50% der Cloud-Qualität | | "Fasse 10-seitiges PDF zusammen" | ❌ Zu lang | ✅✅ Kein Problem | Nicht machbar | | "Schreib ein Bash-Script" | ✅ Funktioniert | ✅✅ Robust + Tests | 70% der Cloud-Qualität |
Praktische Einordnung:
3B-Modelle decken Alltags-Fragen, einfaches Coding und kurze Texte ab. Für Research, komplexes Reasoning oder lange Dokumente brauchst du Cloud-Modelle oder größere lokale Setups.
Wann lohnt sich das RAM-Upgrade?
Kosten: RAM-Upgrade auf 16 GB kostet je nach Laptop 80-150€.
Was sich ändert:
- Llama 3.3 8B läuft flüssig (vs. hakelig bei 8 GB)
- Qwen2.5-Coder 14B wird nutzbar (bestes Coding-Modell)
- Gemma2 27B wird nutzbar (deutlich bessere Textqualität)
- Mehrere Modelle gleichzeitig ohne Performance-Einbruch
ROI-Rechnung:
Wenn du Ollama täglich nutzt und oft auf die RAM-Grenze stößt, rentiert sich das Upgrade in 2-3 Monaten an gesparter Frustration. Ansonsten: 3B-Modelle für Alltags-Aufgaben völlig ausreichend.
Entscheidungshilfe: Welches Modell für mich?
Dein Hauptzweck:
├─ Allrounder (Chat, Zusammenfassungen, gelegentlich Code)
│ → Llama 3.2 3B
│
├─ Coding (Python, JavaScript, Debugging)
│ → Qwen3.5 4B
│
├─ Mathematik, Logik, strukturierte Aufgaben
│ → Phi-4 Mini
│
├─ Maximale Geschwindigkeit, einfache Aufgaben
│ → Gemma 2 2B
│
└─ Minimaler RAM-Bedarf (sehr altes System)
→ Llama 3.2 1B
Alternative: Cloud-Modelle
Manchmal ist Cloud die bessere Wahl:
| Szenario | Lokal (8 GB) | Cloud | |----------|--------------|-------| | Kosten | Hardware-Investment (0-150€ Upgrade) | 20€/Monat (Claude Pro) | | Daten-Privatsphäre | ✅✅ Komplett lokal | ⚠️ Verlässt dein System | | Komplexe Aufgaben | ❌ Überfordert 3B-Modelle | ✅✅ GPT-4/Claude Opus | | Offline-Nutzung | ✅✅ Funktioniert | ❌ Internet nötig | | Geschwindigkeit | ⚠️ 10-12 tok/s | ✅ 30-80 tok/s |
Hybrid-Ansatz:
Viele Nutzer fahren am besten mit Lokal für Alltag + Cloud für komplexe Aufgaben. Siehe Lokale LLMs 2026: Ollama vs. MLX für Details.
Fazit: Was du mit 8 GB RAM erwarten kannst
Realistisch machbar:
- Chat-Assistenz auf Niveau "hilfreicher Junior"
- Einfache Code-Snippets und Debugging
- Zusammenfassungen bis 2-3 Seiten Text
- Übersetzungen (DE/EN)
- FAQ-Beantwortung
Nicht machbar:
- Komplexes Reasoning über mehrere Schritte
- Lange Dokumente (> 10 Seiten)
- Vision-Aufgaben (Bilder beschreiben)
- Multilinguale Übersetzungen (seltene Sprachen)
- Code-Reviews über große Codebases
Die beste Empfehlung für 8 GB: Starte mit Llama 3.2 3B. Wenn du hauptsächlich Code schreibst, teste zusätzlich Qwen3.5 4B. Beide zusammen passen in 8 GB, decken 80% der Alltagsaufgaben ab, und kosten dich nichts außer 5 GB Festplatte.
Für alles darüber hinaus: Entweder RAM aufrüsten oder Cloud-Modelle für die 20% Premium-Aufgaben nutzen.
Weiterführende Artikel:
- Die besten lokalen KI-Modelle für 16/32/64/128 GB RAM — wenn du mehr RAM hast oder upgraden willst
- KI lokal in 20 Minuten — grundlegende Ollama-Einrichtung
- Lokale LLMs 2026: Ollama vs. MLX — Tooling-Vergleich
Fragen? Eigene Setups? Komm in die Zone "Modelle & Benchmarks" im Discord — wir sammeln dort User-Erfahrungen für verschiedene Hardware-Konstellationen.
