CHRISTIAN OHLE

Glossar · Lokale KI & Hardware

KV-Cache

Zwischenspeicher für Key/Value-Tensoren der bisherigen Tokens — sodass bei jedem neuen Token nicht der ganze Context neu berechnet werden muss. Größter VRAM-Fresser bei langen Contexten. Quantisierter KV-Cache spart bei langen Sessions Gigabytes.

Verwandt: VRAM, Context Window

Mehr aus diesem Bereich

Lokale KI & Hardware

Self-Hosting, GPU-Begriffe, Inference-Server.

← Zurück zum vollständigen Glossar