Glossar · Lokale KI & Hardware
Quantisierung
Komprimierung eines Modells: 16-bit-Gewichte werden auf 8, 4 oder sogar 2 Bit reduziert. Trade-Off: weniger VRAM, leichter Qualitätsverlust. Für lokale Deployments fast immer Pflicht. Q4_K_M ist ein gängiger Sweet-Spot in der GGUF-Welt.
Verwandt: VRAM
Mehr aus diesem Bereich
Lokale KI & Hardware
Self-Hosting, GPU-Begriffe, Inference-Server.