CHRISTIAN OHLE

Glossar · Lokale KI & Hardware

Quantisierung

Komprimierung eines Modells: 16-bit-Gewichte werden auf 8, 4 oder sogar 2 Bit reduziert. Trade-Off: weniger VRAM, leichter Qualitätsverlust. Für lokale Deployments fast immer Pflicht. Q4_K_M ist ein gängiger Sweet-Spot in der GGUF-Welt.

Verwandt: VRAM

Mehr aus diesem Bereich

Lokale KI & Hardware

Self-Hosting, GPU-Begriffe, Inference-Server.

← Zurück zum vollständigen Glossar