Wofür diese Kategorie existiert
Die meisten KI-Modell-Vergleiche im Netz zeigen dir MMLU-Scores, GSM8K-Prozente und HumanEval-Rankings. Synthetische Benchmarks, die dir nicht sagen, ob ein Modell deinen konkreten Workflow besser löst als ein anderes.
Diese Kategorie dreht das um: Reale Aufgaben aus echten Arbeitskontexten — Coding, Texten, Reasoning, Multimodal — als Kriterien für einen fairen Vergleich. Plus: Wenn du lokal arbeiten willst, nach RAM-Klassen sortierte Einordnungen mit einer Messvorlage und Quellen, nicht nur vage "funktioniert bei 16 GB"-Aussagen.
Das Besondere: Living Docs. Die Einordnungen werden bei neuen Modellen und relevanten Updates fachlich überprüft. Neue Messwerte kommen nur mit dokumentiertem Protokoll hinzu; du bekommst dadurch keine unmarkierte Momentaufnahme.
Für wen ist das relevant?
Drei Haupt-Zielgruppen:
- Du stehst vor der Cloud-vs.-lokal-Entscheidung und brauchst ehrliche Vor-/Nachteile statt Marketing-Blabla.
- Du willst lokal arbeiten, weißt aber nicht ob deine Hardware reicht oder welches Runtime-Framework (Ollama? LM Studio? MLX?) das richtige ist.
- Du zahlst bereits für Claude Pro oder ChatGPT Plus und fragst dich, ob die Konkurrenz für deinen Anwendungsfall besser ist.
Cloud-Frontier-Modelle: Der echte Vergleich
Die großen Cloud-Provider (OpenAI, Anthropic, Google) liefern sich ein ständiges Wettrüsten. Aber welches Modell ist wann wirklich besser? Synthetische Benchmarks zeigen oft Gleichstand bei 92% vs. 93% — in der Praxis sind die Unterschiede größer.
GPT-5 vs. Claude Opus 4.7 — Auswahlhilfe
GPT-5 vs Claude Opus 4.7 — 50 reale Aufgaben
Der Vergleich erklärt, wie du die beiden Modellfamilien für deinen Use-Case einordnest. Für einen eigenen Test eignen sich Aufgaben aus vier Kategorien:
- Coding: Refactoring, Bug-Fixing, API-Integration, komplexe Algorithmen
- Text: Technische Dokumentation, Sales-Copy, Übersetzungen, Struktur-Editing
- Reasoning: Multi-Step-Probleme, logische Ketten, Fehlererkennung in Argumenten
- Multimodal: Screenshot-Debugging, Diagramm-Analyse, Code aus Mockup
Jede Aufgabe sollte einzeln bewertet werden (besser/gleich/schlechter), mit Begründung. Ein Scoreboard ist nur sinnvoll, wenn Modellstand, Aufgaben, Prompts und Bewertungsregeln offengelegt sind.
Warum das wichtig ist: Modelle, Preise und Limits ändern sich. Entscheide anhand der aktuellen Anbieterinformationen und eines kleinen Tests mit deinen eigenen Aufgaben, nicht anhand einer zeitlosen Siegerbehauptung.
Lokale Modelle: Die Hardware-Frage
Cloud ist bequem, aber nicht für jeden die richtige Wahl: Datenschutz-Anforderungen, Offline-Nutzung, Kosten bei hoher Nutzung, oder einfach das Bedürfnis nach Kontrolle. Wer lokal arbeiten will, steht vor zwei Fragen:
- Welches Modell läuft auf meiner Hardware flüssig?
- Welches Runtime-Framework ist das richtige?
Die nächsten drei Artikel beantworten beide.
Die 8-GB-Lücke: Was funktioniert wirklich?
Lokale KI-Modelle mit nur 8 GB RAM — welche laufen wirklich?
Die meisten Guides starten bei 16 GB aufwärts. Die Realität: Viele Business-Laptops haben 8 GB. Nach Betriebssystem, Browser und zwei geöffneten Programmen bleiben davon 4-5 GB nutzbar.
Dieser Artikel stellt geeignete Modelle für 8-GB-Systeme vor: Llama 3.2 1B/3B, Gemma 2 2B, Phi-4 Mini und Qwen3.5 4B. Er trennt dokumentierte Modell- und Downloaddaten von Richtwerten und erklärt, welche Grenzen du auf deinem Gerät selbst prüfen musst.
Plus: Ollama- und LM-Studio-Setup-Guide, Performance-Tuning für 8-GB-Systeme, und Troubleshooting für typische Probleme (Swapping, langsame Generierung, kaputte Downloads).
Warum das wichtig ist: Die meisten "lokale LLMs"-Guides ignorieren die 8-GB-Klasse komplett. Wenn du ein älteres System hast oder einfach testen willst ob lokale Modelle für dich funktionieren, ist das dein Einstiegspunkt.
Mittelklasse bis High-End: 16 GB bis 128 GB
Beste lokale KI-Modelle für 16/32/64/128 GB RAM
Ab 16 GB wird es interessant: Llama 3.3 8B, Qwen2.5-Coder 14B, Gemma2 27B — Modelle, die qualitativ deutlich näher an GPT-4 liegen als die 3B-Einstiegsklasse.
Dieser Artikel ist nach RAM-Klassen strukturiert:
- 16 GB: Llama 3.3 8B (bester Allrounder), Qwen2.5-Coder 7B (Coding-Spezialist)
- 32 GB: Qwen2.5-Coder 14B (Coding) oder Gemma2 27B (alles andere), Alternative Mistral Nemo 12B
- 64 GB: Llama 3.3 70B (Q4-quantized), Alternative DeepSeek-R1 32B für Reasoning-lastige Aufgaben
- 128 GB: Llama 3.3 70B mit weniger aggressiver Quantisierung (Q8), oder Mistral Large 123B
Jedes Modell sollte nach RAM-Bedarf, Quantisierung (Q4_K_M vs. Q8) und Einsatzgebiet (Allrounder, Coding, Multimodal) verglichen werden. Token/s-Werte sind nur mit identischem Gerät, Prompt, Kontext und Runtime aussagekräftig.
Warum das wichtig ist: Wenn du bereits 16+ GB hast oder ein Upgrade planst, zeigt dir dieser Artikel welches Modell für deine RAM-Klasse das beste Preis-Leistungs-Verhältnis hat — und ob ein weiteres Upgrade von 32 auf 64 GB wirklich lohnt.
Tooling: Ollama vs. MLX vs. llama.cpp
Lokale LLMs 2026 — Ollama vs MLX Vergleich
Du hast die RAM-Frage geklärt und weißt, welches Modell du willst. Jetzt die zweite Frage: Mit welchem Runtime-Framework lädst du es?
Vier Haupt-Optionen:
- Ollama: CLI-Tool, einfachster Einstieg, automatisches Modell-Management
- LM Studio: GUI-App, übersichtlich für Nicht-Techniker, lokaler OpenAI-kompatibler API-Server
- llama.cpp: Low-Level, maximale Performance-Kontrolle, für Entwickler
- MLX: Mac-spezifisch, nutzt Apple Silicon optimal (M1/M2/M3)
Der Artikel vergleicht alle vier nach Setup-Aufwand, dokumentierten Eigenschaften, API-Kompatibilität und Einsatzgebieten. Plus: Welches Framework für welches Betriebssystem, und wann du mehrere parallel nutzen solltest.
Warum das wichtig ist: Die Wahl des Runtime-Frameworks beeinflusst Token/s, RAM-Verbrauch und wie einfach du Modelle wechseln kannst. Ollama ist zugänglich, MLX ist für Apple Silicon optimiert und llama.cpp gibt dir viel Kontrolle; welcher Weg passt, hängt von deinem Use-Case und Messsetup ab.
Wie wähle ich? Die Entscheidungslogik
Drei Kern-Fragen:
1. Cloud oder lokal?
Cloud wählen wenn:
- Du maximale Qualität für komplexe Aufgaben brauchst — die Vergleichshilfe zeigt, welche Kriterien du für GPT-5 und Opus 4.7 prüfen solltest
- Du wenig RAM hast (< 16 GB) und kein Upgrade willst
- Du mobil arbeitest und nicht überall große Modelle downloaden willst
- Du gelegentlich nutzt — Cloud-Free-Tier reicht oft für den Einstieg
Lokal wählen wenn:
- Du Datenschutz-Anforderungen hast (Firmen-Code, Kundendaten, DSGVO)
- Du offline arbeiten musst (Zug, Flugzeug, Regionen ohne Internet)
- Du die Hardware-Investition gegen ein Cloud-Abo rechnen willst — die RAM-Klassen-Guide hat dazu eine konkrete Kosten-Rechnung
- Du experimentieren willst (Prompt-Tuning, Fine-Tuning, Custom-Workflows)
Hybrid-Ansatz (viele fahren so):
- Lokal für Alltags-Aufgaben (Chat, einfaches Coding, Zusammenfassungen)
- Cloud für Premium-Aufgaben (komplexes Reasoning, lange Dokumente, Multimodal)
2. Welche RAM-Klasse?
Wenn du dich für lokal entschieden hast:
- 8 GB: Llama 3.2 1B/3B, Gemma 2 2B, Phi-4 Mini oder Qwen3.5 4B — für Alltags-Chat ausreichend, Details hier
- 16 GB: Llama 3.3 8B — erste echte Allrounder-Qualität, Details hier
- 32 GB: Qwen2.5-Coder 14B oder Gemma2 27B — Coding-Profi oder bessere Text-Qualität
- 64+ GB: Llama 3.3 70B oder Mistral Large 123B — näher an GPT-4-Niveau
Die meisten User starten bei 16 GB — das ist der Sweet Spot zwischen Investition und Qualität.
3. Welches Runtime-Framework?
- Du bist Nicht-Techniker: LM Studio (GUI, einfach)
- Du nutzt CLI gerne: Ollama (ein Befehl, Modell läuft)
- Du bist Entwickler: llama.cpp (maximale Kontrolle)
- Du hast einen Mac (M1/M2/M3): MLX (nutzt Apple Silicon optimal)
Der Framework-Vergleich zeigt dir die Unterschiede im Detail.
Living Docs: Was sich regelmäßig ändert
Diese Kategorie ist kein statisches Archiv. Wenn neue Modelle erscheinen oder bestehende Updates bekommen, werden die Artikel überprüft und bei belegbaren Änderungen nachgetragen:
- GPT-5 vs. Opus: Wenn GPT-6 oder Opus 5 erscheint, wird der Artikel auf die neuen Modelle aktualisiert
- RAM-Klassen: Wenn ein neues 8B-Modell Llama 3.3 8B schlägt, wird es in den Artikel eingetragen
- Framework-Vergleich: Wenn Ollama ein großes Update bekommt, werden Quellen und Vergleichsbedingungen aktualisiert; neue Messwerte kommen nur mit dokumentiertem Protokoll hinzu
Warum das wichtig ist: LLM-Entwicklung ist schnell. Ein Benchmark von vor 6 Monaten ist oft schon veraltet. Deshalb werden Quellen, Modellstände und Messbedingungen sichtbar datiert.
Nächste Schritte
Wenn du Cloud-Modelle vergleichen willst: Starte mit der Auswahlhilfe GPT-5 vs Claude Opus 4.7 und prüfe die Kriterien mit deinen eigenen Aufgaben.
Wenn du lokal arbeiten willst:
- Prüfe dein RAM:
About This Mac(Mac), Task-Manager > Performance (Windows),free -h(Linux) - 8 GB: 8-GB-Guide lesen
- 16+ GB: RAM-Klassen-Guide lesen
- Framework wählen: Ollama vs MLX
Wenn du beide Welten kombinieren willst: Viele User fahren mit Ollama + Llama 3.3 8B für Alltag und ChatGPT Plus / Claude Pro für Premium-Aufgaben am besten.
Fragen? Eigene Benchmark-Ergebnisse? Hardware-Setup das nicht in den Guides passt?
Komm in die Zone "KI-Grundlagen" im Discord — wir sammeln dort User-Erfahrungen, diskutieren neue Modelle, und helfen bei Setup-Problemen.





