flowki@club:~$ Coding, Automation & Security — auf Deutsch
MODELLE
KI-MODELLE
Lokale KI-Modelle mit nur 8 GB RAM — welche laufen wirklich?
FLOWKI · Nº 9797

Lokale KI-Modelle mit nur 8 GB RAM — welche laufen wirklich?

10 min Lesezeit
FlowKI RedaktionFlowKI Redaktion

Dieser Beitrag wurde recherchiert, mit KI-Unterstützung erstellt und redaktionell geprüft. Beruht ein Artikel auf einem selbst durchgeführten Test, kennzeichnen wir das ausdrücklich.

TeilenXLinkedInWhatsApp

Warum dieser Artikel existiert

Viele Anleitungen für lokale KI-Modelle setzen 16 GB RAM voraus. Die Realität: Ein Großteil der Business-Laptops und Consumer-Notebooks hat 8 GB. Nach Betriebssystem, Browser und zwei geöffneten Programmen bleiben davon noch 4-5 GB nutzbar.

Dieser Artikel zeigt, welche Modelle in diesem Budget wirklich laufen — inklusive Setup, Performance-Erwartungen und den ehrlichen Grenzen dessen, was bei 8 GB möglich ist.

Wenn dein System 16 GB oder mehr hat, lies stattdessen Die besten lokalen KI-Modelle für 16/32/64/128 GB RAM. Für die grundlegende Einrichtung von Ollama siehe KI lokal in 20 Minuten.

Was bei 8 GB RAM technisch passiert

Ein Modell mit 3 Milliarden Parametern braucht in voller Präzision (FP16) etwa 6 GB RAM. Durch Quantisierung auf 4 Bit (Q4_K_M) schrumpft das auf rund 2-3 GB — ein Kompressionsfaktor von etwa 72%.

Das ist der Sweet Spot für 8-GB-Systeme: 1B- bis 4B-Modelle in Q4_K_M-Quantisierung. Alles darüber wird langsam oder swappt auf die Festplatte, was die Geschwindigkeit drastisch reduziert.

Hinweis zu den Zahlen: Die RAM-Angaben unten stammen aus den offiziellen Modell-Dokumentationen von Ollama, Hugging Face und Meta. Token/s-Werte sind illustrative Richtwerte aus Community-Tests, keine exakten Messungen auf diesem spezifischen System.

Die 5 besten Modelle für 8 GB RAM

Sortiert nach RAM-Bedarf, von kleinstem zu größtem.

1. Gemma 2 2B — der Leichteste

RAM-Bedarf: ~1,7 GB
Download-Größe: ~1,5 GB
Typische CPU-Geschwindigkeit: 40-60 tok/s

Wofür geeignet:

  • Kurze Zusammenfassungen
  • Einfache Chat-Aufgaben
  • FAQ-Beantwortung
  • Schnelle Übersetzungen

Installation:

ollama pull gemma2:2b
ollama run gemma2:2b

Qualität (subjektiv 1-10):

  • Deutscher Text: 6
  • Englischer Text: 7
  • Coding: 4
  • Reasoning: 4
  • Zusammenfassungen: 7

Das kleinste brauchbare Modell für echte Aufgaben. Deutlich besser als TinyLlama, aber für Code oder komplexes Reasoning zu schwach.

2. Llama 3.2 1B — der schnellste Starter

RAM-Bedarf: ~1,3 GB
Download-Größe: ~1,3 GB
Typische CPU-Geschwindigkeit: 50-70 tok/s

Wofür geeignet:

  • Mobile Geräte / sehr alte Laptops
  • Einfachste Aufgaben
  • Tests / Experimente

Installation:

ollama pull llama3.2:1b
ollama run llama3.2:1b

Qualität (subjektiv 1-10):

  • Deutscher Text: 5
  • Englischer Text: 6
  • Coding: 3
  • Reasoning: 3
  • Zusammenfassungen: 6

Nur für sehr einfache Aufgaben. Wenn du zwischen 1B und 3B wählen kannst, nimm die 3B-Variante — der Qualitätssprung lohnt sich.

3. Llama 3.2 3B — die beste Balance

RAM-Bedarf: ~2,5 GB
Download-Größe: ~2 GB
Typische CPU-Geschwindigkeit: 10-12 tok/s

Wofür geeignet:

  • Alltagschat
  • Content-Zusammenfassungen
  • Einfaches Debugging
  • Dokument-Analysen (kurze Texte)

Installation:

ollama pull llama3.2:3b
ollama run llama3.2:3b

Qualität (subjektiv 1-10):

  • Deutscher Text: 7
  • Englischer Text: 8
  • Coding: 5
  • Reasoning: 5
  • Zusammenfassungen: 8

Empfehlung: Das ist die Standardwahl für 8 GB RAM. Beste Kombination aus Geschwindigkeit, Qualität und Ressourcen-Bedarf.

4. Phi-4 Mini — der Performance-Champion

RAM-Bedarf: ~3 GB (Q4_K_M)
Download-Größe: ~2,8 GB
Typische CPU-Geschwindigkeit: 20-28 tok/s

Wofür geeignet:

  • Mathematik
  • Logik-Aufgaben
  • Strukturierte Analysen
  • Coding (einfache Scripts)

Installation:

ollama pull phi4:mini
ollama run phi4:mini

Qualität (subjektiv 1-10):

  • Deutscher Text: 6
  • Englischer Text: 8
  • Coding: 7
  • Reasoning: 8
  • Zusammenfassungen: 6

Phi-4 ist spezialisiert auf strukturiertes Denken. Für kreative Texte schwächer als Llama 3.2 3B, für logische Aufgaben deutlich besser.

5. Qwen3.5 4B — der Coding-Spezialist

RAM-Bedarf: ~3,5 GB
Download-Größe: ~3 GB
Typische CPU-Geschwindigkeit: 8-12 tok/s

Wofür geeignet:

  • Code-Vervollständigung
  • Debugging
  • Python/JavaScript-Hilfe
  • Refactoring-Vorschläge

Installation:

ollama pull qwen3.5:4b
ollama run qwen3.5:4b

Qualität (subjektiv 1-10):

  • Deutscher Text: 6
  • Englischer Text: 7
  • Coding: 8
  • Reasoning: 6
  • Zusammenfassungen: 6

Wenn du hauptsächlich Code schreibst und ein 8-GB-Limit hast, ist Qwen3.5 4B die beste Wahl.

Vergleichstabelle: Alle 5 Modelle

| Modell | Parameter | RAM (Q4_K_M) | Download | CPU tok/s | Beste Use-Cases | |--------|-----------|--------------|----------|-----------|-----------------| | Gemma 2 2B | 2B | 1,7 GB | 1,5 GB | 40-60 | Zusammenfassungen, FAQ, Speed | | Llama 3.2 1B | 1B | 1,3 GB | 1,3 GB | 50-70 | Mobile, einfachste Aufgaben | | Llama 3.2 3B | 3B | 2,5 GB | 2 GB | 10-12 | Allrounder — beste Balance | | Phi-4 Mini | 3,8B | 3 GB | 2,8 GB | 20-28 | Logik, Mathe, strukturiertes Denken | | Qwen3.5 4B | 4B | 3,5 GB | 3 GB | 8-12 | Coding, Debugging, Scripts |

Setup-Guide: Ollama in 15 Minuten

Schritt 1: Ollama installieren

Windows:

winget install Ollama.Ollama

macOS:

brew install ollama

Linux:

curl -fsSL https://ollama.com/install.sh | sh

Schritt 2: Erstes Modell laden

# Empfohlener Start: Llama 3.2 3B
ollama pull llama3.2:3b

# Modell starten
ollama run llama3.2:3b

Du bekommst ein interaktives Chat-Interface. Zum Beenden: /bye

Schritt 3: Mehrere Modelle parallel nutzen

Ollama lädt Modelle in den RAM, bis dieser voll ist. Danach entfernt es das älteste Modell automatisch.

Auf einem 8-GB-System kannst du typischerweise 1-2 Modelle gleichzeitig im Speicher halten. Der Wechsel zwischen bereits geladenen Modellen ist instant, das erste Laden dauert einige Sekunden.

# Modell 1: Chat
ollama run llama3.2:3b

# Neues Terminal, Modell 2: Code
ollama run qwen3.5:4b

Alternative: LM Studio (GUI)

Wer eine grafische Oberfläche bevorzugt:

  1. LM Studio herunterladen
  2. Installieren und starten
  3. Im Download-Tab: "llama-3.2-3b" suchen
  4. Variante mit "Q4_K_M" wählen → Download
  5. Im Chat-Tab: Modell auswählen → chatten

LM Studio zeigt RAM-Verbrauch live an und warnt, wenn ein Modell zu groß ist.

Was bei 8 GB nicht funktioniert

7B-Modelle — nur mit Kompromissen

Mistral 7B oder Llama 3.3 8B brauchen in Q4_K_M etwa 4-5 GB RAM. Technisch passt das knapp in 8 GB — praktisch wird es langsam:

  • Du musst alle anderen Programme schließen
  • Token/s sinkt auf 2-4 (statt 10+)
  • Bei längeren Kontexten swappt das System

Fazit: 7B-Modelle sind auf 8-GB-Systemen nutzbar, aber nicht angenehm. Für gelegentliche Nutzung okay, für tägliche Arbeit zu zäh.

14B+ Modelle — komplett ausgeschlossen

Alles ab 14B (Qwen2.5-Coder 14B, Gemma2 27B) braucht mindestens 8-11 GB RAM. Auf einem 8-GB-System:

  • Extrem langsam (< 1 tok/s)
  • Konstantes Swapping
  • System wird unbenutzbar

Siehe Die besten lokalen KI-Modelle für 16/32/64/128 GB RAM für höhere Klassen.

Multimodale Modelle (Vision)

LLaVA, Bakllava und andere Vision-Modelle brauchen deutlich mehr RAM als reine Text-Modelle. Die kleinste brauchbare Variante (LLaVA 7B) liegt schon außerhalb des 8-GB-Budgets.

Lange Kontexte (> 8k Tokens)

Die Modelle oben haben typisch 8k-128k Context-Windows. Praktisch nutzbar auf 8 GB:

  • Llama 3.2 3B: 4k-8k Tokens
  • Phi-4 Mini: 4k-16k Tokens
  • Qwen3.5 4B: 4k-8k Tokens

Darüber wird der RAM-Bedarf exponentiell größer, weil der KV-Cache wächst.

Troubleshooting: Typische Probleme

Problem 1: "Model too large for available memory"

Ursache: Du versuchst ein 7B-Modell zu laden und hast zu viele andere Programme offen.

Lösung:

# 1. Alle Ollama-Modelle aus dem RAM werfen
ollama stop --all

# 2. Browser/IDE schließen

# 3. Modell erneut versuchen
ollama run llama3.2:3b

Problem 2: Extrem langsame Generierung (< 2 tok/s)

Ursache: System swappt auf Festplatte.

Kurzfristig:

  • Kleineres Modell wählen (3B statt 7B)
  • Context-Length reduzieren: ollama run llama3.2:3b --context-length 2048

Langfristig:

  • RAM aufrüsten auf 16 GB (meist 80-150€)

Problem 3: Modell gibt nur wirres Zeug aus

Ursache: Zu aggressive Quantisierung (Q2/Q3) oder kaputte Download.

Lösung:

# Modell neu laden
ollama rm llama3.2:3b
ollama pull llama3.2:3b

# Falls Problem bleibt: explizit Q4_K_M-Variante
ollama pull llama3.2:3b-q4-k-m

Problem 4: RAM-Verbrauch steigt mit der Zeit

Ursache: KV-Cache wächst bei langen Konversationen.

Lösung:

  • Gespräch neu starten: /bye und ollama run <modell> erneut
  • Oder Ollama-Server neu starten: ollama serve

Performance-Tuning für 8-GB-Systeme

1. Swap reduzieren (Linux)

# Aktuellen Wert prüfen
cat /proc/sys/vm/swappiness

# Auf 10 setzen (weniger aggressiv)
sudo sysctl vm.swappiness=10

2. Nur Q4_K_M verwenden

# ❌ Zu groß:
ollama pull llama3.2:3b-fp16

# ✅ Richtig:
ollama pull llama3.2:3b  # lädt automatisch Q4_K_M

3. RAM-Monitoring

Linux/macOS:

watch -n 1 'free -h'

Windows: Task-Manager → Performance → Arbeitsspeicher

Wenn "Verfügbar" unter 1 GB fällt, ist das System am Limit.

4. Context-Length anpassen

Standardmäßig laden Modelle oft mit 4k-8k Context. Reduzieren spart RAM:

ollama run llama3.2:3b --context-length 2048

Das halbiert den KV-Cache-Bedarf. Für kurze Fragen völlig ausreichend.

Wie gut ist die Qualität wirklich?

Ein 3B-Modell ist kein Ersatz für GPT-4 oder Claude Opus. Realistischer Vergleich:

| Aufgabe | Llama 3.2 3B | GPT-4 | Bewertung | |---------|--------------|-------|-----------| | "Schreib mir eine E-Mail" | ✅ Gut genug | ✅✅ Perfekt | 80% der Cloud-Qualität | | "Erkläre Quantenphysik" | ⚠️ Oberflächlich | ✅✅ Tiefgehend | 40% der Cloud-Qualität | | "Debug diesen Python-Code" | ⚠️ Einfache Bugs | ✅✅ Komplexe Bugs | 50% der Cloud-Qualität | | "Fasse 10-seitiges PDF zusammen" | ❌ Zu lang | ✅✅ Kein Problem | Nicht machbar | | "Schreib ein Bash-Script" | ✅ Funktioniert | ✅✅ Robust + Tests | 70% der Cloud-Qualität |

Praktische Einordnung:
3B-Modelle decken Alltags-Fragen, einfaches Coding und kurze Texte ab. Für Research, komplexes Reasoning oder lange Dokumente brauchst du Cloud-Modelle oder größere lokale Setups.

Wann lohnt sich das RAM-Upgrade?

Kosten: RAM-Upgrade auf 16 GB kostet je nach Laptop 80-150€.

Was sich ändert:

  • Llama 3.3 8B läuft flüssig (vs. hakelig bei 8 GB)
  • Qwen2.5-Coder 14B wird nutzbar (bestes Coding-Modell)
  • Gemma2 27B wird nutzbar (deutlich bessere Textqualität)
  • Mehrere Modelle gleichzeitig ohne Performance-Einbruch

ROI-Rechnung:
Wenn du Ollama täglich nutzt und oft auf die RAM-Grenze stößt, rentiert sich das Upgrade in 2-3 Monaten an gesparter Frustration. Ansonsten: 3B-Modelle für Alltags-Aufgaben völlig ausreichend.

Entscheidungshilfe: Welches Modell für mich?

Dein Hauptzweck:
├─ Allrounder (Chat, Zusammenfassungen, gelegentlich Code)
│  → Llama 3.2 3B
│
├─ Coding (Python, JavaScript, Debugging)
│  → Qwen3.5 4B
│
├─ Mathematik, Logik, strukturierte Aufgaben
│  → Phi-4 Mini
│
├─ Maximale Geschwindigkeit, einfache Aufgaben
│  → Gemma 2 2B
│
└─ Minimaler RAM-Bedarf (sehr altes System)
   → Llama 3.2 1B

Alternative: Cloud-Modelle

Manchmal ist Cloud die bessere Wahl:

| Szenario | Lokal (8 GB) | Cloud | |----------|--------------|-------| | Kosten | Hardware-Investment (0-150€ Upgrade) | 20€/Monat (Claude Pro) | | Daten-Privatsphäre | ✅✅ Komplett lokal | ⚠️ Verlässt dein System | | Komplexe Aufgaben | ❌ Überfordert 3B-Modelle | ✅✅ GPT-4/Claude Opus | | Offline-Nutzung | ✅✅ Funktioniert | ❌ Internet nötig | | Geschwindigkeit | ⚠️ 10-12 tok/s | ✅ 30-80 tok/s |

Hybrid-Ansatz:
Viele Nutzer fahren am besten mit Lokal für Alltag + Cloud für komplexe Aufgaben. Siehe Lokale LLMs 2026: Ollama vs. MLX für Details.

Fazit: Was du mit 8 GB RAM erwarten kannst

Realistisch machbar:

  • Chat-Assistenz auf Niveau "hilfreicher Junior"
  • Einfache Code-Snippets und Debugging
  • Zusammenfassungen bis 2-3 Seiten Text
  • Übersetzungen (DE/EN)
  • FAQ-Beantwortung

Nicht machbar:

  • Komplexes Reasoning über mehrere Schritte
  • Lange Dokumente (> 10 Seiten)
  • Vision-Aufgaben (Bilder beschreiben)
  • Multilinguale Übersetzungen (seltene Sprachen)
  • Code-Reviews über große Codebases

Die beste Empfehlung für 8 GB: Starte mit Llama 3.2 3B. Wenn du hauptsächlich Code schreibst, teste zusätzlich Qwen3.5 4B. Beide zusammen passen in 8 GB, decken 80% der Alltagsaufgaben ab, und kosten dich nichts außer 5 GB Festplatte.

Für alles darüber hinaus: Entweder RAM aufrüsten oder Cloud-Modelle für die 20% Premium-Aufgaben nutzen.


Weiterführende Artikel:

Fragen? Eigene Setups? Komm in die Zone "Modelle & Benchmarks" im Discord — wir sammeln dort User-Erfahrungen für verschiedene Hardware-Konstellationen.

Weiterlesen

Mehr aus Kategorie Modelle & Benchmarks

Alle Artikel der Kategorie
MODELLE

Die besten lokalen KI-Modelle für 16/32/64/128 GB RAM — gemessen

6 min · 19. Apr.

MODELLE

GPT-5 vs Claude Opus 4.7 — 50 reale Aufgaben im Vergleich

6 min · 19. Apr.

MODELLE

Ollama, MLX, llama.cpp — welches Setup für welches Budget

5 min · 16. Apr.