TL;DR — Drei Modellfamilien dominieren die Open-Source-KI: Meta Llama (Allrounder), Alibaba Qwen (Code + Mehrsprachigkeit) und Mistral (effizient, europäisch). Welches du nehmen solltest, hängt von deinem Use Case, deiner Hardware und deiner Sprache ab. Dieser Artikel gibt dir die Entscheidungsgrundlage — mit konkreten Modellempfehlungen für 8 GB, 12 GB und 24 GB VRAM.
Drei Familien, drei Philosophien
Wenn du in LM Studio den Discover-Tab öffnest, erschlagen dich Hunderte Modelle. Aber hinter fast allen steckt eine von drei Modellfamilien:
Meta Llama — der Open-Source-Standard aus dem Hause Meta (Facebook). Llama 3.1 und 3.3 sind die aktuellen Versionen. Breit trainiert, starke Community, funktioniert in den meisten Sprachen solide. Die 70B-Variante ist der Benchmark, an dem sich alles misst.
Alibaba Qwen — die chinesische Alternative, die in vielen Benchmarks Llama überholt hat. Besonders stark bei Code, mathematischem Reasoning und Mehrsprachigkeit. Verfügbar in vielen Größen von 0.5B bis 72B.
Mistral AI — das europäische Pendant aus Paris. Mistral-Modelle sind auf Effizienz optimiert: Sie liefern mit weniger Parametern oft ähnliche Qualität wie größere Konkurrenten. Der europäische Ursprung macht sie interessant für DSGVO-bewusste Anwendungen.
Es gibt noch weitere Familien — Microsofts Phi, Googles Gemma, Yi von 01.AI — aber für den deutschsprachigen Markt sind Llama, Qwen und Mistral die relevantesten. Sie haben die breiteste Unterstützung in Tools wie LM Studio und Ollama und die aktivsten Communities.
Modellgrößen verstehen: Was bedeuten 7B, 14B, 70B?
Die Zahl vor dem „B” steht für Milliarden Parameter (Billions). Parameter sind die trainierten Gewichte des neuronalen Netzes — je mehr Parameter, desto mehr „Wissen” und Fähigkeiten hat das Modell theoretisch.
In der Praxis heißt das:
| Größe | Typisches Verhalten | VRAM (Q4) | Einsatz |
|---|---|---|---|
| 1–3B | Schnelle Antworten, aber oft oberflächlich oder fehlerhaft | 2–3 GB | Klassifizierung, Auto-Tagging, einfache Extraktion |
| 7–8B | Brauchbar für Routineaufgaben, schwächelt bei Nuancen | 4–6 GB | E-Mail-Entwürfe, Zusammenfassungen, einfacher Code |
| 13–14B | Spürbar besser bei komplexeren Aufgaben | 8–10 GB | Kundenkommunikation, Code-Reviews, Übersetzungen |
| 32–34B | Qualitätssprung bei Reasoning und Kreativität | 18–22 GB | Analyse, kreative Texte, komplexe Code-Aufgaben |
| 70–72B | Nahe an kommerziellen Modellen für viele Use Cases | 38–42 GB | Alles, was lokale Qualität auf Cloud-Niveau braucht |
Die wichtigste Erkenntnis: Der Sprung von 7B auf 14B ist deutlich spürbar. Der Sprung von 14B auf 32B ebenfalls. Von 32B auf 70B wird der Unterschied kleiner — du bezahlst viel VRAM für inkrementelle Verbesserungen.
Für Selbstständige und kleine Teams: Ein 14B-Modell ist oft der Sweet Spot. Es liefert brauchbare Qualität für die meisten Business-Aufgaben und läuft auf Hardware, die unter 1.000 Euro kostet.
Quantisierung erklärt — Q4, Q5, Q8
Quantisierung ist der Trick, der lokale KI erst praktikabel macht. Ohne Quantisierung braucht ein 70B-Modell über 140 GB Speicher (FP16). Quantisiert auf Q4 sind es noch ~40 GB. Das ist der Unterschied zwischen „brauche einen Server” und „läuft auf einer Gaming-GPU”.
Was passiert technisch? Statt die Gewichte als 16-Bit-Gleitkommazahlen (FP16) zu speichern, werden sie auf weniger Bits komprimiert:
| Quantisierung | Bits pro Gewicht | Speicher vs. FP16 | Qualitätsverlust |
|---|---|---|---|
| Q4_K_M | 4 Bit | ~25 % | Minimal, kaum merkbar |
| Q5_K_M | 5 Bit | ~31 % | Sehr gering |
| Q8_0 | 8 Bit | ~50 % | Praktisch keiner |
| FP16 | 16 Bit | 100 % | Referenz |
Meine Empfehlung: Nimm Q4_K_M als Standard. In meinen Tests mit Llama 3.3 70B konnte ich bei typischen Business-Texten (E-Mails, Zusammenfassungen, Kundenantworten) keinen relevanten Qualitätsunterschied zwischen Q4_K_M und Q8 feststellen. Der Speicherunterschied ist aber enorm.
GGUF vs. andere Formate: In LM Studio und Ollama wirst du hauptsächlich GGUF-Dateien sehen. Das ist das Standard-Format für quantisierte Modelle. Wenn du ein Modell herunterlädst, achte auf die GGUF-Variante mit dem passenden Quantisierungslevel.
Die drei Familien im Detail
Meta Llama — der Allrounder
Aktuelle Modelle: Llama 3.1 (8B, 70B, 405B) und Llama 3.3 (70B)
Stärken:
- Breites Allgemeinwissen und solides Instruction-Following
- Große Community — Probleme werden schnell gelöst, Fine-Tunes gibt es massenhaft
- Llama 3.3 70B ist der aktuelle Gold-Standard für lokale Allzweck-KI
- Deutsch funktioniert gut, nicht perfekt, aber für Business-Texte ausreichend
Schwächen:
- Bei Code hinter Qwen, besonders bei komplexeren Aufgaben
- Llama 3.1 8B ist für anspruchsvolle Aufgaben oft zu limitiert
- Die 405B-Variante ist für lokale Nutzung praktisch irrelevant (braucht ~250 GB VRAM)
Wann Llama wählen: Wenn du einen soliden Allrounder suchst, der für verschiedene Aufgaben brauchbar ist. Llama 3.3 70B ist das Modell, an dem ich alle anderen messe.
Bestes Modell pro Größe:
- 8B: Llama 3.1 8B Instruct — solider Einstieg
- 70B: Llama 3.3 70B Instruct — der Sweet Spot für lokale Qualität
Alibaba Qwen — der Code- und Sprachspezialist
Aktuelle Modelle: Qwen 2.5 (0.5B, 1.5B, 3B, 7B, 14B, 32B, 72B) und Qwen 2.5 Coder
Stärken:
- Hervorragend bei Code — Qwen 2.5 Coder ist speziell dafür trainiert
- Starke Mehrsprachigkeit: Deutsch, Englisch, Chinesisch, Französisch funktionieren alle gut
- Breite Größenpalette — von 0.5B für Edge-Geräte bis 72B für Qualitätsansprüche
- Mathematisches Reasoning deutlich besser als Llama in der gleichen Größenklasse
- 32B-Variante bietet ein exzellentes Qualität-Speicher-Verhältnis
Schwächen:
- Community kleiner als bei Llama — weniger Fine-Tunes, weniger Tutorials
- Bei kreativen Texten auf Deutsch manchmal etwas steif
- Lizenzbedingungen komplexer als bei Llama (Apache 2.0 vs. Qwen License)
Wann Qwen wählen: Wenn Code ein Hauptuse-Case ist, oder wenn du Modelle in verschiedenen Größen brauchst. Qwen 2.5 32B ist mein Go-To-Modell für Code-Reviews und Refactoring.
Bestes Modell pro Größe:
- 7B: Qwen 2.5 7B Instruct — stark für die Größe
- 14B: Qwen 2.5 14B Instruct — exzellenter Sweet Spot
- 32B: Qwen 2.5 32B Instruct — mein Favorit für Code
- 72B: Qwen 2.5 72B Instruct — wenn VRAM keine Rolle spielt
Mistral AI — der effiziente Europäer
Aktuelle Modelle: Mistral 7B, Mistral Small (22B), Mixtral 8x7B (MoE)
Stärken:
- Hohe Effizienz: Mistral Small (22B) liefert Qualität, die an 30B+-Modelle anderer Familien herankommt
- Europäisches Unternehmen — für EU-Compliance interessant
- Mixtral (Mixture of Experts) nutzt nur einen Teil der Parameter pro Anfrage — schneller bei gleichem Speicher
- Schnelle Inferenz, besonders gut für hohen Durchsatz und Agent-Loops
Schwächen:
- Deutsch ist schwächer als bei Llama und Qwen — Mistral optimiert primär für Englisch und Französisch
- Weniger Größenvarianten als Qwen — du hast 7B, ~22B und Mixtral, aber kein 14B oder 32B
- Community und Ökosystem kleiner als bei Llama
Wann Mistral wählen: Wenn Geschwindigkeit und Effizienz wichtiger sind als maximale Qualität. Mistral Small ist ideal für Klassifizierungsaufgaben, Auto-Tagging und schnelle Agent-Loops, bei denen du viele kurze Anfragen brauchst.
Bestes Modell pro Größe:
- 7B: Mistral 7B Instruct v0.3 — schnell und effizient
- 22B: Mistral Small 3 — bestes Preis-Leistungs-Verhältnis bei Mistral
- MoE: Mixtral 8x7B — wenn du viel VRAM hast und Throughput brauchst
Empfehlungen nach Use Case
Statt abstraktem Benchmark-Vergleich — hier konkrete Empfehlungen für typische Aufgaben:
Texte schreiben (E-Mails, Blog-Posts, Kundenkommunikation)
- 8 GB VRAM: Llama 3.1 8B Q4 — brauchbar für Entwürfe, die du überarbeitest
- 12 GB VRAM: Qwen 2.5 14B Q4 — deutlich bessere Qualität, weniger Nacharbeit
- 24 GB VRAM: Llama 3.3 70B Q4 — nahe an ChatGPT für deutschsprachige Texte
Code schreiben und reviewen
- 8 GB VRAM: Qwen 2.5 Coder 7B Q4 — spezialisiert und überraschend gut
- 12 GB VRAM: Qwen 2.5 14B Q4 — starker Allrounder mit Code-Fokus
- 24 GB VRAM: Qwen 2.5 32B Q5 — mein persönlicher Favorit für Code-Tasks
Analyse und Zusammenfassung
- 8 GB VRAM: Mistral 7B Q4 — schnelle Klassifizierung und Extraktion
- 12 GB VRAM: Qwen 2.5 14B Q4 — gutes Reasoning für mittellange Dokumente
- 24 GB VRAM: Llama 3.3 70B Q4 — für anspruchsvolle Analysen
Agent-Pipelines (viele kurze Anfragen)
- 8 GB VRAM: Mistral 7B Q4 — niedrige Latenz, schnelle Antworten
- 12 GB VRAM: Mistral Small 3 Q4 — bester Throughput in der Klasse
- 24 GB VRAM: Qwen 2.5 32B Q4 — wenn Qualität und Speed zusammenkommen sollen
Deutsch als Hauptsprache
Wenn du primär auf Deutsch arbeitest, ist die Reihenfolge klar:
- Qwen 2.5 — konsistent gutes Deutsch, besonders in den größeren Varianten
- Llama 3.3/3.1 — solides Deutsch, gelegentlich englische Einsprengsel
- Mistral — Deutsch funktioniert, aber mit spürbaren Schwächen bei Grammatik und Idiomatik
Hardware-Empfehlungen im Überblick
| VRAM | Beste Modelle | Erwartbare Qualität |
|---|---|---|
| 8 GB (RTX 4060, RX 7600) | 7B-Modelle, Q4 | Brauchbar für Routine |
| 12 GB (RTX 4070, RX 7700 XT) | 14B Q4, 7B Q8 | Gut für die meisten Business-Tasks |
| 16 GB (RTX 4070 Ti Super) | 14B Q8, 32B Q4 (knapp) | Sehr gut, flexibel |
| 24 GB (RTX 4090, RX 7900 XTX) | 32B Q5/Q8, 70B Q4 | Nahe an Cloud-Qualität |
Wenn du deinen Rechner speziell für lokale KI zusammenstellst, findest du eine vollständige Komponentenliste im Hardware-Guide. AMD-Nutzer finden spezifische Tipps in Folge 4: Lokale KI auf AMD.
Mein Setup: Was ich wann nutze
Für Transparenz — so sieht mein täglicher Modell-Workflow aus (auf einer AMD RX 7900 XTX mit 24 GB VRAM):
- Llama 3.3 70B Q4_K_M — für längere Texte, Brainstorming, wenn ich „Claude-ähnliche” Qualität lokal brauche. Läuft mit ~7 tok/s, also nicht schnell, aber die Qualität rechtfertigt das.
- Qwen 2.5 32B Q4_K_M — mein Hauptmodell für Code-Reviews, TypeScript-Refactoring, Datenbankabfragen. ~15 tok/s, guter Kompromiss.
- Mistral Small 3 Q4_K_M — für Agent-Loops und Klassifizierung. ~25 tok/s, perfekt wenn viele kurze Anfragen laufen.
- Llama 3.1 8B Q4_K_M — für schnelle Tests und wenn ich ein Prompt-Template debugge. ~80 tok/s, quasi Echtzeit.
Alle vier Modelle brauchen zusammen etwa 120 GB Festplattenspeicher. Im VRAM ist immer nur eins gleichzeitig geladen.
Nächste Schritte
Du weißt jetzt, welches Modell für deinen Use Case passt. Aber was, wenn du eine AMD-Grafikkarte hast und nicht sicher bist, ob das alles funktioniert?
→ Folge 4: Lokale KI auf AMD (RX 7900 XTX) — AMD-Setup, ROCm, Vulkan-Backend und Performance-Vergleich mit NVIDIA.
Weitere Artikel in dieser Serie:
- Folge 1: Dein eigenes ChatGPT — Warum lokale KI? — Motivation und Überblick
- Folge 2: LM Studio in 10 Minuten einrichten — Schritt-für-Schritt-Installation
- Hardware-Guide: KI-PC für lokale LLMs — Komponentenliste und Setup


