CHRISTIAN OHLE

Glossar · Lokale KI & Hardware

vLLM

High-Throughput-Inference-Server in Python. Optimiert mit PagedAttention für massive Parallelität — wer 1000 Requests/Min auf einer A100 will, nimmt vLLM. Komplexer als llama.cpp, aber state-of-the-art bei Latenz und Durchsatz.

Mehr aus diesem Bereich

Lokale KI & Hardware

Self-Hosting, GPU-Begriffe, Inference-Server.

← Zurück zum vollständigen Glossar