TL;DR — Was du nach diesem Artikel hast
- Verstanden, wie RAG (Retrieval Augmented Generation) funktioniert — in einfachen Worten.
- Ein laufendes Setup: AnythingLLM + Ollama, das deine Dokumente offline durchsuchbar macht.
- Wissen, welche Tools es gibt — AnythingLLM, PrivateGPT, Open WebUI mit RAG.
- Konkrete Use Cases — Verträge, Handbücher, internes Wiki, Buchhaltungsbelege.
- Klarheit, warum lokale RAG für vertrauliche Dokumente der einzig saubere Weg ist.
Warum du deine Dokumente nicht in die Cloud schicken solltest
Du hast Verträge, Handbücher, interne Protokolle, Kundendaten. Du willst eine Frage stellen — „Was steht in Paragraph 7 des Mietvertrags?” oder „Welche Fristen gelten laut unserem Projektvertrag?” — und eine KI soll die Antwort aus deinen eigenen Dokumenten ziehen.
Das Problem: Wenn du deine Dokumente bei ChatGPT, Claude oder einem anderen Cloud-Dienst hochlädst, verlassen sie dein Netzwerk. Für private Notizen ist das egal. Für vertrauliche Firmendokumente, Verträge mit NDA-Klauseln, Kundendaten oder Personalakten ist das ein Datenschutz-Problem — und je nach Branche ein rechtliches.
Die Lösung heißt RAG — Retrieval Augmented Generation. Und das Beste daran: Du kannst es komplett lokal betreiben. Kein Cloud-Upload, kein API-Call, keine Daten, die dein Netzwerk verlassen.
Was ist RAG — in drei Sätzen
RAG steht für Retrieval Augmented Generation. Die Idee ist einfach:
- Retrieval: Bevor die KI antwortet, sucht sie in deinen Dokumenten nach relevanten Abschnitten.
- Augmented: Diese Abschnitte werden dem Modell als Kontext mitgegeben.
- Generation: Das Modell generiert seine Antwort basierend auf deinen Dokumenten — nicht nur auf seinem Trainingswissen.
Stell dir RAG vor wie einen Sachbearbeiter, der vor jeder Antwort erst im Aktenschrank nachschaut. Er erfindet nichts (oder zumindest weniger), sondern zitiert aus deinen Unterlagen.
Wie RAG technisch funktioniert
Hinter dem einfachen Konzept steckt eine Pipeline aus vier Schritten. Du musst die Details nicht verstehen, um RAG zu nutzen — aber es hilft zu wissen, was unter der Haube passiert, wenn etwas nicht funktioniert.
Schritt 1: Dokumente in Chunks aufteilen
Deine Dokumente — PDFs, Word-Dateien, Textdateien — werden in kleinere Abschnitte aufgeteilt, sogenannte Chunks. Ein Chunk ist typischerweise 500-1.000 Zeichen lang, also ungefähr ein Absatz.
Warum? Weil ein LLM einen begrenzten Kontext hat. Du kannst nicht ein 200-seitiges Handbuch komplett ins Modell schieben. Stattdessen werden nur die relevanten Abschnitte übergeben.
Schritt 2: Chunks in Vektoren umwandeln (Embeddings)
Jeder Chunk wird durch ein Embedding-Modell in einen mathematischen Vektor umgewandelt — eine Liste von Zahlen, die die „Bedeutung” des Texts repräsentiert.
Ähnliche Texte erzeugen ähnliche Vektoren. „Der Mietvertrag läuft bis 2027” und „Die Vertragslaufzeit endet im Jahr 2027” haben sehr ähnliche Vektoren, obwohl die Worte unterschiedlich sind.
Beliebte Embedding-Modelle für lokale Nutzung:
- nomic-embed-text — klein (274 MB), schnell, gut genug für die meisten Anwendungen
- mxbai-embed-large — besser bei komplexen Dokumenten, braucht mehr Ressourcen
- all-MiniLM-L6-v2 — der Klassiker, funktioniert überall
Schritt 3: Vektoren in einer Datenbank speichern
Die Vektoren werden in einer Vektordatenbank gespeichert. Das ist eine spezielle Datenbank, die sehr schnell nach ähnlichen Vektoren suchen kann.
Lokale Vektordatenbanken:
- LanceDB — leichtgewichtig, wird von AnythingLLM genutzt
- ChromaDB — beliebt, Open Source, Python-nativ
- Qdrant — performant, Docker-Image verfügbar
Schritt 4: Frage stellen → relevante Chunks finden → Antwort generieren
Wenn du eine Frage stellst, passiert Folgendes:
- Deine Frage wird ebenfalls in einen Vektor umgewandelt
- Die Vektordatenbank findet die ähnlichsten Chunks
- Diese Chunks werden dem LLM als Kontext mitgegeben
- Das LLM generiert eine Antwort basierend auf den gefundenen Abschnitten
Deine Frage: "Wann läuft der Mietvertrag aus?"
↓
Embedding: [0.23, -0.87, 0.44, ...]
↓
Vektordatenbank: findet 3 ähnliche Chunks aus deinen PDFs
↓
LLM bekommt: "Beantworte die Frage basierend auf diesen Abschnitten: [Chunk 1] [Chunk 2] [Chunk 3]"
↓
Antwort: "Laut dem Mietvertrag vom 15.03.2024 (Seite 4, §7) endet die Laufzeit am 31.12.2027."
Tools im Überblick
Es gibt mehrere Tools, die lokale RAG in eine benutzerfreundliche Oberfläche verpacken. Hier die wichtigsten:
AnythingLLM — meine Empfehlung für den Einstieg
AnythingLLM ist eine Desktop-App (und Docker-Container), die alles mitbringt: Dokumenten-Upload, Embedding, Vektordatenbank und Chat-Interface. Du brauchst nur noch ein LLM-Backend — Ollama oder LM Studio.
Stärken:
- Grafische Oberfläche — kein Terminal nötig
- Workspace-Konzept: separate Dokumentensammlungen für verschiedene Projekte
- Unterstützt PDF, DOCX, TXT, Markdown, CSV, Webseiten, YouTube-URLs
- Eingebaute Vektordatenbank (LanceDB)
- Ollama-Integration mit einem Klick
PrivateGPT
PrivateGPT ist ein Open-Source-Projekt, das sich auf Privacy-first RAG spezialisiert hat. Es ist technischer als AnythingLLM, bietet aber mehr Konfigurationsmöglichkeiten.
Stärken:
- Komplett Open Source
- API-first — gut für Entwickler
- Modularer Aufbau (austauschbare LLMs, Embedding-Modelle, Vektordatenbanken)
- Aktive Community
Open WebUI mit RAG
Open WebUI — das Tool, das du vielleicht schon als lokales ChatGPT-Frontend kennst — hat eine eingebaute RAG-Funktion. Du kannst Dokumente direkt im Chat hochladen und Fragen dazu stellen.
Stärken:
- Falls du Open WebUI schon nutzt: RAG ist eingebaut, keine Extra-Installation
- Dokument-Upload direkt im Chat
- Funktioniert mit jedem Ollama-Modell
Schwäche: Weniger ausgereift als AnythingLLM bei der Dokumentenverwaltung. Kein Workspace-Konzept, weniger Dateiformate.
Schritt-für-Schritt: Lokale RAG mit AnythingLLM und Ollama
Hier ist der konkrete Weg vom leeren Rechner zur ersten Dokumenten-Suche. Voraussetzung: Du hast Ollama installiert und eine GPU mit mindestens 8 GB VRAM.
Schritt 1: Ollama vorbereiten
Du brauchst zwei Modelle in Ollama: ein LLM für die Antworten und ein Embedding-Modell für die Vektoren.
# LLM herunterladen (wähle nach deinem VRAM)
ollama pull llama3.3 # 8B, braucht ~5 GB VRAM
# oder
ollama pull qwen2.5:14b # 14B, braucht ~9 GB VRAM
# Embedding-Modell herunterladen
ollama pull nomic-embed-text # 274 MB, schnell, reicht für die meisten Fälle
Schritt 2: AnythingLLM installieren
Desktop-App (Windows/Mac/Linux):
- Geh auf anythingllm.com
- Lade die Desktop-Version herunter
- Installieren und starten
Docker (für Server-Setups):
docker pull mintplexlabs/anythingllm
docker run -d \
-p 3001:3001 \
-v anythingllm_storage:/app/server/storage \
--name anythingllm \
mintplexlabs/anythingllm
Schritt 3: AnythingLLM konfigurieren
Beim ersten Start fragt AnythingLLM nach deinem LLM-Backend:
- LLM Provider: Wähle „Ollama”
- Ollama URL:
http://localhost:11434(Standard) - Modell: Wähle das Modell, das du in Schritt 1 heruntergeladen hast
- Embedding Provider: Wähle „Ollama”
- Embedding-Modell:
nomic-embed-text - Vektordatenbank: LanceDB (Standard, eingebaut)
Schritt 4: Workspace erstellen und Dokumente hochladen
- Klicke auf „New Workspace” — z.B. „Mietverträge” oder „Firmen-Wiki”
- Klicke auf das Upload-Icon im Workspace
- Ziehe deine Dokumente rein — PDFs, Word-Dateien, Textdateien
- AnythingLLM chunked und embedded die Dokumente automatisch (das dauert je nach Menge 30 Sekunden bis einige Minuten)
Schritt 5: Fragen stellen
Tippe deine Frage ins Chat-Fenster. AnythingLLM durchsucht die Vektordatenbank, findet relevante Abschnitte und generiert eine Antwort mit Quellenangabe.
Du: "Wann endet der Mietvertrag für die Berliner Straße?"
AnythingLLM: "Laut dem Mietvertrag vom 15. März 2024
(Seite 4, §7 Vertragslaufzeit) endet das Mietverhältnis
am 31. Dezember 2027. Eine Verlängerungsoption um
weitere 2 Jahre ist in §8 vorgesehen."
📄 Quellen: Mietvertrag_Berliner_Str.pdf (S. 4-5)
Use Cases — wofür lokale RAG wirklich nützlich ist
Verträge und juristische Dokumente
Du hast 50 Verträge als PDF. Statt jeden einzeln zu öffnen und mit Strg+F zu suchen, fragst du:
- „Welche Verträge laufen 2027 aus?”
- „In welchen Verträgen gibt es eine Preisanpassungsklausel?”
- „Was steht in der Haftungsregelung des Vertrags mit Firma XYZ?”
Internes Firmenwiki
Dein Team hat Prozessdokumentation, Onboarding-Guides und technische Specs in hunderten Dokumenten verteilt. Neue Mitarbeiter können fragen:
- „Wie ist der Ablauf für eine Reisekostenabrechnung?”
- „Welche Tools nutzen wir für Projektmanagement?”
- „Wo finde ich die Vorlage für Kundenangebote?”
Technische Handbücher
Du arbeitest mit einer Software, die ein 500-seitiges Handbuch hat. Statt zu blättern:
- „Wie konfiguriere ich die LDAP-Anbindung?”
- „Welche Ports müssen für die Cluster-Kommunikation offen sein?”
- „Was sind die Systemanforderungen für Version 4.2?”
Buchhaltung und Belege
Du hast Hunderte Rechnungen und Belege als PDF. Mit RAG kannst du fragen:
- „Wie viel haben wir 2025 für Softwarelizenzen ausgegeben?”
- „Welche Rechnungen von Firma ABC sind noch offen?”
- „Gibt es Belege über 1.000 € aus dem letzten Quartal?”
Wichtig: RAG ersetzt keinen Buchhalter und keine rechtliche Prüfung. Die Antworten basieren auf dem, was in deinen Dokumenten steht — wenn ein Dokument fehlt oder fehlerhaft ist, ist auch die Antwort falsch. Nutze RAG als schnelle Recherche-Hilfe, nicht als rechtlich verbindliche Quelle.
Tipps für bessere Ergebnisse
Chunk-Größe anpassen
Die Standard-Chunk-Größe in AnythingLLM ist 1.000 Zeichen. Das funktioniert für die meisten Dokumente. Aber:
- Verträge mit langen Paragraphen: Erhöhe auf 1.500-2.000 Zeichen, damit ein Paragraph nicht mitten im Satz zerschnitten wird
- FAQ-Dokumente mit kurzen Antworten: Reduziere auf 500 Zeichen
- Tabellarische Daten: Chunk-Größe ist weniger wichtig — probier verschiedene Werte aus
Das richtige LLM wählen
Für RAG brauchst du kein riesiges Modell. Das LLM muss hauptsächlich den gefundenen Text verstehen und eine Antwort formulieren — es muss nicht selbst „wissen”.
- 7B-Modelle (Llama 3.2 8B, Qwen 2.5 7B): Reichen für einfache Fragen an kurze Dokumente
- 13-14B-Modelle (Qwen 2.5 14B, Phi-4): Besser für komplexe Fragen und längere Dokumente
- 32B+ Modelle: Wenn du präzise Zusammenfassungen oder Vergleiche zwischen Dokumenten brauchst
Dokumente vorbereiten
- Gescannte PDFs: Müssen erst durch OCR (z.B. mit
ocrmypdf), bevor sie als Text verarbeitet werden können - Dateinamen: Gib deinen Dateien sprechende Namen — „Mietvertrag_Berlin_2024.pdf” statt „scan_0047.pdf”
- Struktur: Dokumente mit Überschriften und Absätzen funktionieren besser als Fließtext ohne Struktur
Embedding-Modell
nomic-embed-text ist der Standard und reicht für 90 % der Anwendungen. Wenn du merkst, dass die falschen Abschnitte gefunden werden, teste mxbai-embed-large — es ist größer, aber genauer:
ollama pull mxbai-embed-large
Was RAG nicht kann
Ehrlichkeit gehört dazu:
- RAG ersetzt keine Volltextsuche. Wenn du den exakten Wortlaut eines Satzes suchst, ist Strg+F schneller und zuverlässiger.
- RAG halluziniert trotzdem. Seltener als ohne Kontext, aber es passiert. Prüfe wichtige Antworten immer gegen das Quelldokument.
- RAG funktioniert schlecht mit Tabellen und Bildern. Tabellen werden oft falsch gechunkt, Bilder werden ignoriert. Für tabellarische Daten ist eine Datenbank besser.
- RAG braucht gute Dokumente. „Garbage in, garbage out” gilt auch hier. Schlecht formatierte Scans oder Dokumente ohne Struktur liefern schlechte Ergebnisse.
Nächste Schritte
Du hast jetzt ein laufendes Setup für lokale Dokumenten-Suche. Hier sind ein paar Ideen, wie du weitermachen kannst:
- Mehr Workspaces: Erstelle separate Workspaces für verschiedene Dokumentensammlungen — einen für Verträge, einen für technische Docs, einen für Protokolle.
- Open WebUI als Alternative: Wenn du Open WebUI schon nutzt, probier die eingebaute RAG-Funktion — manchmal reicht sie aus.
- Automatisierung: AnythingLLM hat eine API. Du kannst Dokumente per Script hochladen und Fragen programmatisch stellen.
- Bessere Modelle: Upgrade auf ein größeres LLM, wenn du merkst, dass die Antwortqualität nicht reicht — hier die Hardware-Anforderungen.
Die Lokale-KI-Serie
Dieser Artikel ist Teil meiner Serie über lokale KI:
- Was ist lokale KI? — Grundlagen und warum das Thema wichtig ist
- LM Studio einrichten — Schritt-für-Schritt dein erstes lokales LLM
- Dein eigenes ChatGPT lokal — Open WebUI + Ollama als komplettes Setup
- Ollama oder LM Studio? — Der ehrliche Vergleich
- Welche Hardware brauchst du? — GPU, RAM, SSD — was du wirklich brauchst
- Llama vs. Qwen vs. Mistral — Welches Modell für welchen Zweck


