Glossar · Lokale KI & Hardware
KV-Cache
Zwischenspeicher für Key/Value-Tensoren der bisherigen Tokens — sodass bei jedem neuen Token nicht der ganze Context neu berechnet werden muss. Größter VRAM-Fresser bei langen Contexten. Quantisierter KV-Cache spart bei langen Sessions Gigabytes.
Verwandt: VRAM, Context Window
Mehr aus diesem Bereich
Lokale KI & Hardware
Self-Hosting, GPU-Begriffe, Inference-Server.