CHRISTIAN OHLE
Zurück zu Bauen

Bauen

Eigene Dokumente offline durchsuchen mit lokaler KI (RAG)

RAG lokal einrichten: Deine Verträge, Handbücher und Firmendokumente mit einer lokalen KI durchsuchen — ohne Cloud, ohne Datenschutz-Risiko. Schritt-für-Schritt mit AnythingLLM und Ollama.

9 Min Lesezeit rag lokal · dokumente ki durchsuchen · anythingllm tutorial · lokale ki dokumente · rag offline · private gpt · eigene dokumente ki · retrieval augmented generation deutsch · ki dokumentensuche · anythingllm ollama · vektordatenbank lokal · datenschutz ki dokumente
Hero-Image: Eigene Dokumente offline durchsuchen mit lokaler KI (RAG)

TL;DR — Was du nach diesem Artikel hast

  • Verstanden, wie RAG (Retrieval Augmented Generation) funktioniert — in einfachen Worten.
  • Ein laufendes Setup: AnythingLLM + Ollama, das deine Dokumente offline durchsuchbar macht.
  • Wissen, welche Tools es gibt — AnythingLLM, PrivateGPT, Open WebUI mit RAG.
  • Konkrete Use Cases — Verträge, Handbücher, internes Wiki, Buchhaltungsbelege.
  • Klarheit, warum lokale RAG für vertrauliche Dokumente der einzig saubere Weg ist.
Video

Folge 9: Eigene Dokumente offline durchsuchen mit lokaler KI

Warum du deine Dokumente nicht in die Cloud schicken solltest

Du hast Verträge, Handbücher, interne Protokolle, Kundendaten. Du willst eine Frage stellen — „Was steht in Paragraph 7 des Mietvertrags?” oder „Welche Fristen gelten laut unserem Projektvertrag?” — und eine KI soll die Antwort aus deinen eigenen Dokumenten ziehen.

Das Problem: Wenn du deine Dokumente bei ChatGPT, Claude oder einem anderen Cloud-Dienst hochlädst, verlassen sie dein Netzwerk. Für private Notizen ist das egal. Für vertrauliche Firmendokumente, Verträge mit NDA-Klauseln, Kundendaten oder Personalakten ist das ein Datenschutz-Problem — und je nach Branche ein rechtliches.

Die Lösung heißt RAG — Retrieval Augmented Generation. Und das Beste daran: Du kannst es komplett lokal betreiben. Kein Cloud-Upload, kein API-Call, keine Daten, die dein Netzwerk verlassen.

Was ist RAG — in drei Sätzen

RAG steht für Retrieval Augmented Generation. Die Idee ist einfach:

  1. Retrieval: Bevor die KI antwortet, sucht sie in deinen Dokumenten nach relevanten Abschnitten.
  2. Augmented: Diese Abschnitte werden dem Modell als Kontext mitgegeben.
  3. Generation: Das Modell generiert seine Antwort basierend auf deinen Dokumenten — nicht nur auf seinem Trainingswissen.

Stell dir RAG vor wie einen Sachbearbeiter, der vor jeder Antwort erst im Aktenschrank nachschaut. Er erfindet nichts (oder zumindest weniger), sondern zitiert aus deinen Unterlagen.

Wie RAG technisch funktioniert

Hinter dem einfachen Konzept steckt eine Pipeline aus vier Schritten. Du musst die Details nicht verstehen, um RAG zu nutzen — aber es hilft zu wissen, was unter der Haube passiert, wenn etwas nicht funktioniert.

Schritt 1: Dokumente in Chunks aufteilen

Deine Dokumente — PDFs, Word-Dateien, Textdateien — werden in kleinere Abschnitte aufgeteilt, sogenannte Chunks. Ein Chunk ist typischerweise 500-1.000 Zeichen lang, also ungefähr ein Absatz.

Warum? Weil ein LLM einen begrenzten Kontext hat. Du kannst nicht ein 200-seitiges Handbuch komplett ins Modell schieben. Stattdessen werden nur die relevanten Abschnitte übergeben.

Schritt 2: Chunks in Vektoren umwandeln (Embeddings)

Jeder Chunk wird durch ein Embedding-Modell in einen mathematischen Vektor umgewandelt — eine Liste von Zahlen, die die „Bedeutung” des Texts repräsentiert.

Ähnliche Texte erzeugen ähnliche Vektoren. „Der Mietvertrag läuft bis 2027” und „Die Vertragslaufzeit endet im Jahr 2027” haben sehr ähnliche Vektoren, obwohl die Worte unterschiedlich sind.

Beliebte Embedding-Modelle für lokale Nutzung:

  • nomic-embed-text — klein (274 MB), schnell, gut genug für die meisten Anwendungen
  • mxbai-embed-large — besser bei komplexen Dokumenten, braucht mehr Ressourcen
  • all-MiniLM-L6-v2 — der Klassiker, funktioniert überall

Schritt 3: Vektoren in einer Datenbank speichern

Die Vektoren werden in einer Vektordatenbank gespeichert. Das ist eine spezielle Datenbank, die sehr schnell nach ähnlichen Vektoren suchen kann.

Lokale Vektordatenbanken:

  • LanceDB — leichtgewichtig, wird von AnythingLLM genutzt
  • ChromaDB — beliebt, Open Source, Python-nativ
  • Qdrant — performant, Docker-Image verfügbar

Schritt 4: Frage stellen → relevante Chunks finden → Antwort generieren

Wenn du eine Frage stellst, passiert Folgendes:

  1. Deine Frage wird ebenfalls in einen Vektor umgewandelt
  2. Die Vektordatenbank findet die ähnlichsten Chunks
  3. Diese Chunks werden dem LLM als Kontext mitgegeben
  4. Das LLM generiert eine Antwort basierend auf den gefundenen Abschnitten
Deine Frage: "Wann läuft der Mietvertrag aus?"

Embedding: [0.23, -0.87, 0.44, ...]

Vektordatenbank: findet 3 ähnliche Chunks aus deinen PDFs

LLM bekommt: "Beantworte die Frage basierend auf diesen Abschnitten: [Chunk 1] [Chunk 2] [Chunk 3]"

Antwort: "Laut dem Mietvertrag vom 15.03.2024 (Seite 4, §7) endet die Laufzeit am 31.12.2027."

Tools im Überblick

Es gibt mehrere Tools, die lokale RAG in eine benutzerfreundliche Oberfläche verpacken. Hier die wichtigsten:

AnythingLLM — meine Empfehlung für den Einstieg

AnythingLLM ist eine Desktop-App (und Docker-Container), die alles mitbringt: Dokumenten-Upload, Embedding, Vektordatenbank und Chat-Interface. Du brauchst nur noch ein LLM-Backend — Ollama oder LM Studio.

Stärken:

  • Grafische Oberfläche — kein Terminal nötig
  • Workspace-Konzept: separate Dokumentensammlungen für verschiedene Projekte
  • Unterstützt PDF, DOCX, TXT, Markdown, CSV, Webseiten, YouTube-URLs
  • Eingebaute Vektordatenbank (LanceDB)
  • Ollama-Integration mit einem Klick

PrivateGPT

PrivateGPT ist ein Open-Source-Projekt, das sich auf Privacy-first RAG spezialisiert hat. Es ist technischer als AnythingLLM, bietet aber mehr Konfigurationsmöglichkeiten.

Stärken:

  • Komplett Open Source
  • API-first — gut für Entwickler
  • Modularer Aufbau (austauschbare LLMs, Embedding-Modelle, Vektordatenbanken)
  • Aktive Community

Open WebUI mit RAG

Open WebUI — das Tool, das du vielleicht schon als lokales ChatGPT-Frontend kennst — hat eine eingebaute RAG-Funktion. Du kannst Dokumente direkt im Chat hochladen und Fragen dazu stellen.

Stärken:

  • Falls du Open WebUI schon nutzt: RAG ist eingebaut, keine Extra-Installation
  • Dokument-Upload direkt im Chat
  • Funktioniert mit jedem Ollama-Modell

Schwäche: Weniger ausgereift als AnythingLLM bei der Dokumentenverwaltung. Kein Workspace-Konzept, weniger Dateiformate.

Schritt-für-Schritt: Lokale RAG mit AnythingLLM und Ollama

Hier ist der konkrete Weg vom leeren Rechner zur ersten Dokumenten-Suche. Voraussetzung: Du hast Ollama installiert und eine GPU mit mindestens 8 GB VRAM.

Schritt 1: Ollama vorbereiten

Du brauchst zwei Modelle in Ollama: ein LLM für die Antworten und ein Embedding-Modell für die Vektoren.

# LLM herunterladen (wähle nach deinem VRAM)
ollama pull llama3.3          # 8B, braucht ~5 GB VRAM
# oder
ollama pull qwen2.5:14b       # 14B, braucht ~9 GB VRAM

# Embedding-Modell herunterladen
ollama pull nomic-embed-text   # 274 MB, schnell, reicht für die meisten Fälle

Schritt 2: AnythingLLM installieren

Desktop-App (Windows/Mac/Linux):

  1. Geh auf anythingllm.com
  2. Lade die Desktop-Version herunter
  3. Installieren und starten

Docker (für Server-Setups):

docker pull mintplexlabs/anythingllm
docker run -d \
  -p 3001:3001 \
  -v anythingllm_storage:/app/server/storage \
  --name anythingllm \
  mintplexlabs/anythingllm

Schritt 3: AnythingLLM konfigurieren

Beim ersten Start fragt AnythingLLM nach deinem LLM-Backend:

  1. LLM Provider: Wähle „Ollama”
  2. Ollama URL: http://localhost:11434 (Standard)
  3. Modell: Wähle das Modell, das du in Schritt 1 heruntergeladen hast
  4. Embedding Provider: Wähle „Ollama”
  5. Embedding-Modell: nomic-embed-text
  6. Vektordatenbank: LanceDB (Standard, eingebaut)

Schritt 4: Workspace erstellen und Dokumente hochladen

  1. Klicke auf „New Workspace” — z.B. „Mietverträge” oder „Firmen-Wiki”
  2. Klicke auf das Upload-Icon im Workspace
  3. Ziehe deine Dokumente rein — PDFs, Word-Dateien, Textdateien
  4. AnythingLLM chunked und embedded die Dokumente automatisch (das dauert je nach Menge 30 Sekunden bis einige Minuten)

Schritt 5: Fragen stellen

Tippe deine Frage ins Chat-Fenster. AnythingLLM durchsucht die Vektordatenbank, findet relevante Abschnitte und generiert eine Antwort mit Quellenangabe.

Du: "Wann endet der Mietvertrag für die Berliner Straße?"

AnythingLLM: "Laut dem Mietvertrag vom 15. März 2024 
(Seite 4, §7 Vertragslaufzeit) endet das Mietverhältnis 
am 31. Dezember 2027. Eine Verlängerungsoption um 
weitere 2 Jahre ist in §8 vorgesehen."

📄 Quellen: Mietvertrag_Berliner_Str.pdf (S. 4-5)

Use Cases — wofür lokale RAG wirklich nützlich ist

Verträge und juristische Dokumente

Du hast 50 Verträge als PDF. Statt jeden einzeln zu öffnen und mit Strg+F zu suchen, fragst du:

  • „Welche Verträge laufen 2027 aus?”
  • „In welchen Verträgen gibt es eine Preisanpassungsklausel?”
  • „Was steht in der Haftungsregelung des Vertrags mit Firma XYZ?”

Internes Firmenwiki

Dein Team hat Prozessdokumentation, Onboarding-Guides und technische Specs in hunderten Dokumenten verteilt. Neue Mitarbeiter können fragen:

  • „Wie ist der Ablauf für eine Reisekostenabrechnung?”
  • „Welche Tools nutzen wir für Projektmanagement?”
  • „Wo finde ich die Vorlage für Kundenangebote?”

Technische Handbücher

Du arbeitest mit einer Software, die ein 500-seitiges Handbuch hat. Statt zu blättern:

  • „Wie konfiguriere ich die LDAP-Anbindung?”
  • „Welche Ports müssen für die Cluster-Kommunikation offen sein?”
  • „Was sind die Systemanforderungen für Version 4.2?”

Buchhaltung und Belege

Du hast Hunderte Rechnungen und Belege als PDF. Mit RAG kannst du fragen:

  • „Wie viel haben wir 2025 für Softwarelizenzen ausgegeben?”
  • „Welche Rechnungen von Firma ABC sind noch offen?”
  • „Gibt es Belege über 1.000 € aus dem letzten Quartal?”

Wichtig: RAG ersetzt keinen Buchhalter und keine rechtliche Prüfung. Die Antworten basieren auf dem, was in deinen Dokumenten steht — wenn ein Dokument fehlt oder fehlerhaft ist, ist auch die Antwort falsch. Nutze RAG als schnelle Recherche-Hilfe, nicht als rechtlich verbindliche Quelle.

Tipps für bessere Ergebnisse

Chunk-Größe anpassen

Die Standard-Chunk-Größe in AnythingLLM ist 1.000 Zeichen. Das funktioniert für die meisten Dokumente. Aber:

  • Verträge mit langen Paragraphen: Erhöhe auf 1.500-2.000 Zeichen, damit ein Paragraph nicht mitten im Satz zerschnitten wird
  • FAQ-Dokumente mit kurzen Antworten: Reduziere auf 500 Zeichen
  • Tabellarische Daten: Chunk-Größe ist weniger wichtig — probier verschiedene Werte aus

Das richtige LLM wählen

Für RAG brauchst du kein riesiges Modell. Das LLM muss hauptsächlich den gefundenen Text verstehen und eine Antwort formulieren — es muss nicht selbst „wissen”.

  • 7B-Modelle (Llama 3.2 8B, Qwen 2.5 7B): Reichen für einfache Fragen an kurze Dokumente
  • 13-14B-Modelle (Qwen 2.5 14B, Phi-4): Besser für komplexe Fragen und längere Dokumente
  • 32B+ Modelle: Wenn du präzise Zusammenfassungen oder Vergleiche zwischen Dokumenten brauchst

Dokumente vorbereiten

  • Gescannte PDFs: Müssen erst durch OCR (z.B. mit ocrmypdf), bevor sie als Text verarbeitet werden können
  • Dateinamen: Gib deinen Dateien sprechende Namen — „Mietvertrag_Berlin_2024.pdf” statt „scan_0047.pdf”
  • Struktur: Dokumente mit Überschriften und Absätzen funktionieren besser als Fließtext ohne Struktur

Embedding-Modell

nomic-embed-text ist der Standard und reicht für 90 % der Anwendungen. Wenn du merkst, dass die falschen Abschnitte gefunden werden, teste mxbai-embed-large — es ist größer, aber genauer:

ollama pull mxbai-embed-large

Was RAG nicht kann

Ehrlichkeit gehört dazu:

  • RAG ersetzt keine Volltextsuche. Wenn du den exakten Wortlaut eines Satzes suchst, ist Strg+F schneller und zuverlässiger.
  • RAG halluziniert trotzdem. Seltener als ohne Kontext, aber es passiert. Prüfe wichtige Antworten immer gegen das Quelldokument.
  • RAG funktioniert schlecht mit Tabellen und Bildern. Tabellen werden oft falsch gechunkt, Bilder werden ignoriert. Für tabellarische Daten ist eine Datenbank besser.
  • RAG braucht gute Dokumente. „Garbage in, garbage out” gilt auch hier. Schlecht formatierte Scans oder Dokumente ohne Struktur liefern schlechte Ergebnisse.

Nächste Schritte

Du hast jetzt ein laufendes Setup für lokale Dokumenten-Suche. Hier sind ein paar Ideen, wie du weitermachen kannst:

  1. Mehr Workspaces: Erstelle separate Workspaces für verschiedene Dokumentensammlungen — einen für Verträge, einen für technische Docs, einen für Protokolle.
  2. Open WebUI als Alternative: Wenn du Open WebUI schon nutzt, probier die eingebaute RAG-Funktion — manchmal reicht sie aus.
  3. Automatisierung: AnythingLLM hat eine API. Du kannst Dokumente per Script hochladen und Fragen programmatisch stellen.
  4. Bessere Modelle: Upgrade auf ein größeres LLM, wenn du merkst, dass die Antwortqualität nicht reicht — hier die Hardware-Anforderungen.

Die Lokale-KI-Serie

Dieser Artikel ist Teil meiner Serie über lokale KI:

Porträt von Christian Ohle

Geschrieben von

Christian Ohle

KI-Entwickler & Online-Marketer · seit 2005 im Web

Seit 2005 mit dem Web. Online-Marketing, Coding, lokale KI. Schreibt auf christianohle über Agents, MCP, lokale LLMs und Workflow-Automation — alles selbst getestet. Wöchentlicher Newsletter mit aktuellen News & Tutorials.