This content is still in French
The page itself is translated, but its detailed content is not yet. Hardware sheets, guides and catalogues are still shown in French: we would rather give you the original than a rough machine translation. View the French site
Choisir sa quantification GGUF
Étape 1 sur 7
Avant de commencer
- Avoir déjà fait tourner un modèle localement
- Savoir télécharger un fichier depuis un dépôt de modèles
Ce que la quantification fait vraiment
Un modèle est entraîné avec des poids en 16 bits. La quantification réduit chaque poids à 8, 5, 4, parfois 2 bits. Le fichier rétrécit d'autant, la mémoire nécessaire aussi, et le calcul devient plus rapide — car sur ces machines, c'est la bande passante mémoire qui limite, pas le processeur.
En contrepartie, le modèle perd en précision. Toute la question est de savoir jusqu'où on peut descendre sans que ça se voie.