Korte definitie
Kwantisatie — het opslaan van de gewichten van een AI-model met minder bits per getal, zodat het model minder geheugen vraagt en op kleinere hardware draait, ten koste van een klein verlies aan nauwkeurigheid.
Ook bekend als: quantization, modelkwantisatie, quant.
Kwantisatie (Engels: quantization) laat een groot AI-model passen op kleinere hardware. In plaats van elk gewicht als 16-bitgetal op te slaan, gebruik je minder bits, vaak tussen 2 en 8. Het model vraagt dan veel minder geheugen, in ruil voor een klein, meetbaar verlies aan nauwkeurigheid.
Hoe werkt kwantisatie?
Een taalmodel bestaat uit miljarden getallen, de gewichten. In de originele versie zijn dat meestal 16-bit kommagetallen. Kwantisatie zet ze om naar een kleinere set waarden die in minder bits past, plus wat extra gegevens om ze tijdens het draaien terug te rekenen.
De eenvoudigste methodes ronden elk gewicht apart af. Nieuwere methodes bekijken groepen gewichten tegelijk en gebruiken kalibratiedata om te bepalen welke details het zwaarst wegen. Daarom kunnen twee kwantisaties met hetzelfde aantal bits per gewicht toch in kwaliteit verschillen: de methode telt even zwaar als het aantal bits.
Gangbare formaten
Je komt kwantisatie vooral tegen via het bestandsformaat van een download:
- GGUF is het formaat van llama.cpp. Het draait op processors, Apple Silicon en de meeste videokaarten en is daarmee de breedste keuze.
- EXL3 is het formaat van ExLlamaV3, gemaakt voor NVIDIA-videokaarten. Het is gebaseerd op QTIP, een methode van Cornell RelaxML.
- GPTQ en AWQ zijn oudere methodes voor videokaarten die nog vaak in serverframeworks opduiken.
Waar let je op bij het kiezen van een kwantisatie?
- Geheugen: de kwantisatie moet in je videogeheugen passen, of in videogeheugen plus werkgeheugen wanneer een deel van het model op de processor draait.
- Kwaliteit: vergelijk gepubliceerde metingen zoals KL-divergentie of perplexiteit voor hetzelfde model, niet alleen het aantal bits.
- Ondersteuning: een formaat is pas bruikbaar als je software en hardware het kunnen draaien.
Betrouwbare bron en verder lezen
De documentatie van Hugging Face Transformers over kwantisatie geeft een overzicht van de belangrijkste methodes en wanneer je ze gebruikt.