Glossar · Lokale KI & Hardware
vLLM
High-Throughput-Inference-Server in Python. Optimiert mit PagedAttention für massive Parallelität — wer 1000 Requests/Min auf einer A100 will, nimmt vLLM. Komplexer als llama.cpp, aber state-of-the-art bei Latenz und Durchsatz.
Mehr aus diesem Bereich
Lokale KI & Hardware
Self-Hosting, GPU-Begriffe, Inference-Server.