KI-Modelle im Vergleich.
Modell-Benchmarks im Internet sind meist synthetisch (MMLU, GSM8K) und haben wenig Aussagekraft für Alltags-Entscheidungen. Diese Kategorie macht es umgekehrt: Reale Aufgaben aus echten Workflows — und vergleicht wie die Modelle dabei abschneiden.
Plus: lokale Modelle nach RAM-Klasse. Welches Modell läuft auf deinem 16-GB-Laptop und welches brauchst du wirklich einen 128-GB-Mac für.
Living Docs: Die Benchmark-Ergebnisse werden regelmäßig aktualisiert wenn neue Modelle erscheinen.



