Generativ AI och språkmodeller
Kvantisering
Vad är Kvantisering?
Kvantisering är att krympa en AI-modell genom att spara dess tal med lägre precision. En språkmodell består av miljarder tal (vikter), och från början sparas vart och ett med många decimaler. Kvantisering avrundar dem, ungefär som att skriva 3,14 i stället för 3,14159265: det räcker oftast, och det tar mycket mindre plats. Resultatet är en modell som kräver mindre minne och svarar snabbare, till priset av något sämre kvalitet.
Det låter som en detalj men avgör ofta om en modell alls går att köra på din egen dator. En modell med 7 miljarder vikter tar ungefär 14 GB i vanlig 16-bitarsprecision, men drygt 3,5 GB i 4 bitar. Därför står det "4-bit" eller "Q4" i filnamnen när du laddar ner modeller att köra lokalt: siffran anger hur många bitar varje vikt får. Ju färre bitar, desto mindre och snabbare modell, men desto större risk att svaren blir sämre.
Kvantisering ska inte förväxlas med distillation, som tränar en ny och mindre modell. Kvantisering behåller samma modell med samma antal vikter och ändrar bara hur noggrant varje vikt sparas.
Ursprung och källa
Begrepp från signalbehandlingen; för språkmodeller Tim Dettmers m.fl., 2022
Se även
Läs mer
Nu kan du det här ordet.
Hur många fler har du koll på? Spela Ordkollen →