CHRISTIAN OHLE
Zurück zu Bauen

Bauen

Llama vs. Qwen vs. Mistral — Welches lokale Modell passt? (Folge 3)

Vergleich der drei großen Open-Source-Modellfamilien: Meta Llama, Alibaba Qwen und Mistral AI. Modellgrößen, Quantisierung, Stärken/Schwächen und konkrete Empfehlungen nach Use Case und Hardware.

9 Min Lesezeit llama vs qwen · llama vs mistral · qwen vs mistral · open source llm vergleich · lokales llm auswählen · bestes lokales ki modell · llama 3 deutsch · qwen 2.5 deutsch · mistral modell · ki modell empfehlung · quantisierung erklärt · llm vram bedarf
Hero-Image: Llama vs. Qwen vs. Mistral — Welches lokale Modell passt? (Folge 3)

TL;DR — Drei Modellfamilien dominieren die Open-Source-KI: Meta Llama (Allrounder), Alibaba Qwen (Code + Mehrsprachigkeit) und Mistral (effizient, europäisch). Welches du nehmen solltest, hängt von deinem Use Case, deiner Hardware und deiner Sprache ab. Dieser Artikel gibt dir die Entscheidungsgrundlage — mit konkreten Modellempfehlungen für 8 GB, 12 GB und 24 GB VRAM.

Video

Drei Familien, drei Philosophien

Wenn du in LM Studio den Discover-Tab öffnest, erschlagen dich Hunderte Modelle. Aber hinter fast allen steckt eine von drei Modellfamilien:

Meta Llama — der Open-Source-Standard aus dem Hause Meta (Facebook). Llama 3.1 und 3.3 sind die aktuellen Versionen. Breit trainiert, starke Community, funktioniert in den meisten Sprachen solide. Die 70B-Variante ist der Benchmark, an dem sich alles misst.

Alibaba Qwen — die chinesische Alternative, die in vielen Benchmarks Llama überholt hat. Besonders stark bei Code, mathematischem Reasoning und Mehrsprachigkeit. Verfügbar in vielen Größen von 0.5B bis 72B.

Mistral AI — das europäische Pendant aus Paris. Mistral-Modelle sind auf Effizienz optimiert: Sie liefern mit weniger Parametern oft ähnliche Qualität wie größere Konkurrenten. Der europäische Ursprung macht sie interessant für DSGVO-bewusste Anwendungen.

Es gibt noch weitere Familien — Microsofts Phi, Googles Gemma, Yi von 01.AI — aber für den deutschsprachigen Markt sind Llama, Qwen und Mistral die relevantesten. Sie haben die breiteste Unterstützung in Tools wie LM Studio und Ollama und die aktivsten Communities.

Modellgrößen verstehen: Was bedeuten 7B, 14B, 70B?

Die Zahl vor dem „B” steht für Milliarden Parameter (Billions). Parameter sind die trainierten Gewichte des neuronalen Netzes — je mehr Parameter, desto mehr „Wissen” und Fähigkeiten hat das Modell theoretisch.

In der Praxis heißt das:

GrößeTypisches VerhaltenVRAM (Q4)Einsatz
1–3BSchnelle Antworten, aber oft oberflächlich oder fehlerhaft2–3 GBKlassifizierung, Auto-Tagging, einfache Extraktion
7–8BBrauchbar für Routineaufgaben, schwächelt bei Nuancen4–6 GBE-Mail-Entwürfe, Zusammenfassungen, einfacher Code
13–14BSpürbar besser bei komplexeren Aufgaben8–10 GBKundenkommunikation, Code-Reviews, Übersetzungen
32–34BQualitätssprung bei Reasoning und Kreativität18–22 GBAnalyse, kreative Texte, komplexe Code-Aufgaben
70–72BNahe an kommerziellen Modellen für viele Use Cases38–42 GBAlles, was lokale Qualität auf Cloud-Niveau braucht

Die wichtigste Erkenntnis: Der Sprung von 7B auf 14B ist deutlich spürbar. Der Sprung von 14B auf 32B ebenfalls. Von 32B auf 70B wird der Unterschied kleiner — du bezahlst viel VRAM für inkrementelle Verbesserungen.

Für Selbstständige und kleine Teams: Ein 14B-Modell ist oft der Sweet Spot. Es liefert brauchbare Qualität für die meisten Business-Aufgaben und läuft auf Hardware, die unter 1.000 Euro kostet.

Quantisierung erklärt — Q4, Q5, Q8

Quantisierung ist der Trick, der lokale KI erst praktikabel macht. Ohne Quantisierung braucht ein 70B-Modell über 140 GB Speicher (FP16). Quantisiert auf Q4 sind es noch ~40 GB. Das ist der Unterschied zwischen „brauche einen Server” und „läuft auf einer Gaming-GPU”.

Was passiert technisch? Statt die Gewichte als 16-Bit-Gleitkommazahlen (FP16) zu speichern, werden sie auf weniger Bits komprimiert:

QuantisierungBits pro GewichtSpeicher vs. FP16Qualitätsverlust
Q4_K_M4 Bit~25 %Minimal, kaum merkbar
Q5_K_M5 Bit~31 %Sehr gering
Q8_08 Bit~50 %Praktisch keiner
FP1616 Bit100 %Referenz

Meine Empfehlung: Nimm Q4_K_M als Standard. In meinen Tests mit Llama 3.3 70B konnte ich bei typischen Business-Texten (E-Mails, Zusammenfassungen, Kundenantworten) keinen relevanten Qualitätsunterschied zwischen Q4_K_M und Q8 feststellen. Der Speicherunterschied ist aber enorm.

GGUF vs. andere Formate: In LM Studio und Ollama wirst du hauptsächlich GGUF-Dateien sehen. Das ist das Standard-Format für quantisierte Modelle. Wenn du ein Modell herunterlädst, achte auf die GGUF-Variante mit dem passenden Quantisierungslevel.

Die drei Familien im Detail

Meta Llama — der Allrounder

Aktuelle Modelle: Llama 3.1 (8B, 70B, 405B) und Llama 3.3 (70B)

Stärken:

  • Breites Allgemeinwissen und solides Instruction-Following
  • Große Community — Probleme werden schnell gelöst, Fine-Tunes gibt es massenhaft
  • Llama 3.3 70B ist der aktuelle Gold-Standard für lokale Allzweck-KI
  • Deutsch funktioniert gut, nicht perfekt, aber für Business-Texte ausreichend

Schwächen:

  • Bei Code hinter Qwen, besonders bei komplexeren Aufgaben
  • Llama 3.1 8B ist für anspruchsvolle Aufgaben oft zu limitiert
  • Die 405B-Variante ist für lokale Nutzung praktisch irrelevant (braucht ~250 GB VRAM)

Wann Llama wählen: Wenn du einen soliden Allrounder suchst, der für verschiedene Aufgaben brauchbar ist. Llama 3.3 70B ist das Modell, an dem ich alle anderen messe.

Bestes Modell pro Größe:

  • 8B: Llama 3.1 8B Instruct — solider Einstieg
  • 70B: Llama 3.3 70B Instruct — der Sweet Spot für lokale Qualität

Alibaba Qwen — der Code- und Sprachspezialist

Aktuelle Modelle: Qwen 2.5 (0.5B, 1.5B, 3B, 7B, 14B, 32B, 72B) und Qwen 2.5 Coder

Stärken:

  • Hervorragend bei Code — Qwen 2.5 Coder ist speziell dafür trainiert
  • Starke Mehrsprachigkeit: Deutsch, Englisch, Chinesisch, Französisch funktionieren alle gut
  • Breite Größenpalette — von 0.5B für Edge-Geräte bis 72B für Qualitätsansprüche
  • Mathematisches Reasoning deutlich besser als Llama in der gleichen Größenklasse
  • 32B-Variante bietet ein exzellentes Qualität-Speicher-Verhältnis

Schwächen:

  • Community kleiner als bei Llama — weniger Fine-Tunes, weniger Tutorials
  • Bei kreativen Texten auf Deutsch manchmal etwas steif
  • Lizenzbedingungen komplexer als bei Llama (Apache 2.0 vs. Qwen License)

Wann Qwen wählen: Wenn Code ein Hauptuse-Case ist, oder wenn du Modelle in verschiedenen Größen brauchst. Qwen 2.5 32B ist mein Go-To-Modell für Code-Reviews und Refactoring.

Bestes Modell pro Größe:

  • 7B: Qwen 2.5 7B Instruct — stark für die Größe
  • 14B: Qwen 2.5 14B Instruct — exzellenter Sweet Spot
  • 32B: Qwen 2.5 32B Instruct — mein Favorit für Code
  • 72B: Qwen 2.5 72B Instruct — wenn VRAM keine Rolle spielt

Mistral AI — der effiziente Europäer

Aktuelle Modelle: Mistral 7B, Mistral Small (22B), Mixtral 8x7B (MoE)

Stärken:

  • Hohe Effizienz: Mistral Small (22B) liefert Qualität, die an 30B+-Modelle anderer Familien herankommt
  • Europäisches Unternehmen — für EU-Compliance interessant
  • Mixtral (Mixture of Experts) nutzt nur einen Teil der Parameter pro Anfrage — schneller bei gleichem Speicher
  • Schnelle Inferenz, besonders gut für hohen Durchsatz und Agent-Loops

Schwächen:

  • Deutsch ist schwächer als bei Llama und Qwen — Mistral optimiert primär für Englisch und Französisch
  • Weniger Größenvarianten als Qwen — du hast 7B, ~22B und Mixtral, aber kein 14B oder 32B
  • Community und Ökosystem kleiner als bei Llama

Wann Mistral wählen: Wenn Geschwindigkeit und Effizienz wichtiger sind als maximale Qualität. Mistral Small ist ideal für Klassifizierungsaufgaben, Auto-Tagging und schnelle Agent-Loops, bei denen du viele kurze Anfragen brauchst.

Bestes Modell pro Größe:

  • 7B: Mistral 7B Instruct v0.3 — schnell und effizient
  • 22B: Mistral Small 3 — bestes Preis-Leistungs-Verhältnis bei Mistral
  • MoE: Mixtral 8x7B — wenn du viel VRAM hast und Throughput brauchst

Empfehlungen nach Use Case

Statt abstraktem Benchmark-Vergleich — hier konkrete Empfehlungen für typische Aufgaben:

Texte schreiben (E-Mails, Blog-Posts, Kundenkommunikation)

  • 8 GB VRAM: Llama 3.1 8B Q4 — brauchbar für Entwürfe, die du überarbeitest
  • 12 GB VRAM: Qwen 2.5 14B Q4 — deutlich bessere Qualität, weniger Nacharbeit
  • 24 GB VRAM: Llama 3.3 70B Q4 — nahe an ChatGPT für deutschsprachige Texte

Code schreiben und reviewen

  • 8 GB VRAM: Qwen 2.5 Coder 7B Q4 — spezialisiert und überraschend gut
  • 12 GB VRAM: Qwen 2.5 14B Q4 — starker Allrounder mit Code-Fokus
  • 24 GB VRAM: Qwen 2.5 32B Q5 — mein persönlicher Favorit für Code-Tasks

Analyse und Zusammenfassung

  • 8 GB VRAM: Mistral 7B Q4 — schnelle Klassifizierung und Extraktion
  • 12 GB VRAM: Qwen 2.5 14B Q4 — gutes Reasoning für mittellange Dokumente
  • 24 GB VRAM: Llama 3.3 70B Q4 — für anspruchsvolle Analysen

Agent-Pipelines (viele kurze Anfragen)

  • 8 GB VRAM: Mistral 7B Q4 — niedrige Latenz, schnelle Antworten
  • 12 GB VRAM: Mistral Small 3 Q4 — bester Throughput in der Klasse
  • 24 GB VRAM: Qwen 2.5 32B Q4 — wenn Qualität und Speed zusammenkommen sollen

Deutsch als Hauptsprache

Wenn du primär auf Deutsch arbeitest, ist die Reihenfolge klar:

  1. Qwen 2.5 — konsistent gutes Deutsch, besonders in den größeren Varianten
  2. Llama 3.3/3.1 — solides Deutsch, gelegentlich englische Einsprengsel
  3. Mistral — Deutsch funktioniert, aber mit spürbaren Schwächen bei Grammatik und Idiomatik

Hardware-Empfehlungen im Überblick

VRAMBeste ModelleErwartbare Qualität
8 GB (RTX 4060, RX 7600)7B-Modelle, Q4Brauchbar für Routine
12 GB (RTX 4070, RX 7700 XT)14B Q4, 7B Q8Gut für die meisten Business-Tasks
16 GB (RTX 4070 Ti Super)14B Q8, 32B Q4 (knapp)Sehr gut, flexibel
24 GB (RTX 4090, RX 7900 XTX)32B Q5/Q8, 70B Q4Nahe an Cloud-Qualität

Wenn du deinen Rechner speziell für lokale KI zusammenstellst, findest du eine vollständige Komponentenliste im Hardware-Guide. AMD-Nutzer finden spezifische Tipps in Folge 4: Lokale KI auf AMD.

Mein Setup: Was ich wann nutze

Für Transparenz — so sieht mein täglicher Modell-Workflow aus (auf einer AMD RX 7900 XTX mit 24 GB VRAM):

  • Llama 3.3 70B Q4_K_M — für längere Texte, Brainstorming, wenn ich „Claude-ähnliche” Qualität lokal brauche. Läuft mit ~7 tok/s, also nicht schnell, aber die Qualität rechtfertigt das.
  • Qwen 2.5 32B Q4_K_M — mein Hauptmodell für Code-Reviews, TypeScript-Refactoring, Datenbankabfragen. ~15 tok/s, guter Kompromiss.
  • Mistral Small 3 Q4_K_M — für Agent-Loops und Klassifizierung. ~25 tok/s, perfekt wenn viele kurze Anfragen laufen.
  • Llama 3.1 8B Q4_K_M — für schnelle Tests und wenn ich ein Prompt-Template debugge. ~80 tok/s, quasi Echtzeit.

Alle vier Modelle brauchen zusammen etwa 120 GB Festplattenspeicher. Im VRAM ist immer nur eins gleichzeitig geladen.

Nächste Schritte

Du weißt jetzt, welches Modell für deinen Use Case passt. Aber was, wenn du eine AMD-Grafikkarte hast und nicht sicher bist, ob das alles funktioniert?

Folge 4: Lokale KI auf AMD (RX 7900 XTX) — AMD-Setup, ROCm, Vulkan-Backend und Performance-Vergleich mit NVIDIA.

Weitere Artikel in dieser Serie:

Porträt von Christian Ohle

Geschrieben von

Christian Ohle

KI-Entwickler & Online-Marketer · seit 2005 im Web

Seit 2005 mit dem Web. Online-Marketing, Coding, lokale KI. Schreibt auf christianohle über Agents, MCP, lokale LLMs und Workflow-Automation — alles selbst getestet. Wöchentlicher Newsletter mit aktuellen News & Tutorials.