Glossar · Lokale KI & Hardware
Inference-Server
Ein Server, der ein LLM lädt und API-Anfragen entgegennimmt. Bekannte Optionen: vLLM (Python, schnell), llama.cpp (C++, low-overhead), Text Generation Inference (HuggingFace). Wer nicht selbst hosten will: Replicate, Together, Fireworks.
Mehr aus diesem Bereich
Lokale KI & Hardware
Self-Hosting, GPU-Begriffe, Inference-Server.