CHRISTIAN OHLE

Glossar · Lokale KI & Hardware

Inference-Server

Ein Server, der ein LLM lädt und API-Anfragen entgegennimmt. Bekannte Optionen: vLLM (Python, schnell), llama.cpp (C++, low-overhead), Text Generation Inference (HuggingFace). Wer nicht selbst hosten will: Replicate, Together, Fireworks.

Mehr aus diesem Bereich

Lokale KI & Hardware

Self-Hosting, GPU-Begriffe, Inference-Server.

← Zurück zum vollständigen Glossar