Este conteúdo ainda está em francês
A página está traduzida, mas o conteúdo detalhado ainda não. As fichas, os guias e os catálogos continuam em francês: preferimos mostrar-lhe o original a uma tradução automática aproximada. Ver o site em francês
Guide 3 sur 12
Choisir sa quantification GGUF
Q4_K_M, Q5_K_S, IQ3_XXS : ce que signifient ces suffixes, ce qu'ils coûtent en qualité, et la règle simple qui évite d'y passer une soirée.
Démarrer le pas à pas 7 étapes · 25 minutes · une étape à l'écran, avec Précédent / Suivant
- Avoir déjà fait tourner un modèle localement
- Savoir télécharger un fichier depuis un dépôt de modèles
Ce que la quantification fait vraiment
Un modèle est entraîné avec des poids en 16 bits. La quantification réduit chaque poids à 8, 5, 4, parfois 2 bits. Le fichier rétrécit d'autant, la mémoire nécessaire aussi, et le calcul devient plus rapide — car sur ces machines, c'est la bande passante mémoire qui limite, pas le processeur.
En contrepartie, le modèle perd en précision. Toute la question est de savoir jusqu'où on peut descendre sans que ça se voie.
Lire les suffixes
- Le chiffre — Q4, Q5, Q8 : le nombre de bits par poids, en moyenne.
- La lettre K — quantification « par blocs » de nouvelle génération, meilleure à taille égale que les anciens formats. À privilégier.
- S / M / L — small, medium, large : à l'intérieur d'un même niveau, la variante M protège mieux les couches sensibles.
- Le préfixe I — importance matrix : la quantification est guidée par un jeu de données de calibration. Très efficace en dessous de 4 bits.
Le tableau de décision
| Variante | Taille relative | Perte de qualité | Quand la choisir |
|---|---|---|---|
| Q8_0 | × 2,1 | Négligeable | Modèles d'embedding, petits modèles où la place ne manque pas |
| Q6_K | × 1,6 | Très faible | Quand il reste de la marge mémoire et qu'on veut le maximum |
| Q5_K_M | × 1,3 | Faible | Bon compromis si la RAM le permet |
| Q4_K_M | × 1,0 (référence) | Acceptable | Le choix par défaut, dans la quasi-totalité des cas |
| IQ4_XS | × 0,9 | Acceptable | Quand il manque quelques centaines de Mo pour tenir |
| Q3_K_M | × 0,8 | Visible | Dernier recours pour faire entrer un modèle plus gros |
| Q2_K | × 0,6 | Importante | Curiosité technique, rarement utilisable en production |
La règle SATI
Deuxième règle, plus contre-intuitive : à budget mémoire égal, un modèle plus gros fortement quantifié bat généralement un modèle plus petit peu quantifié. Un 8B en Q4_K_M (≈ 4,7 Go) rend en général de meilleurs services qu'un 4B en Q8_0 (≈ 4,3 Go).
Cette règle a une limite : sous 3 bits, la dégradation devient sévère et le petit modèle reprend l'avantage.
Télécharger la bonne variante
Avec Ollama, l'étiquette suffit :
# Variante par défaut (souvent Q4_K_M)
ollama run qwen3:8b
# Variante explicite
ollama run qwen3:8b-q8_0
Avec llama.cpp, on récupère le fichier GGUF précis :
pip install -U "huggingface_hub[cli]"
# Un seul fichier, pas le dépôt entier
hf download unsloth/Qwen3-8B-GGUF Qwen3-8B-Q4_K_M.gguf \
--local-dir ./modeles
ls -lh ./modeles
Vérifier la dégradation vous-même
Les mesures de perplexité publiées ne disent rien de votre usage. Le test qui compte tient en dix minutes : constituez une vingtaine de questions représentatives de ce que vos utilisateurs demanderont, puis passez-les sur deux quantifications.
# Même question, deux variantes, comparaison à l'œil
for q in q4_K_M q8_0; do
echo "=== $q ==="
ollama run qwen3:8b-$q "Explique la photosynthèse à un enfant de 10 ans."
done
Deux cas particuliers
- Les modèles d'embedding : gardez-les en Q8_0 ou en 16 bits. Ils sont petits, et la précision des vecteurs conditionne directement la qualité de votre recherche documentaire.
- Les très petits modèles (moins de 2 Md) : ils encaissent mal la quantification agressive. Sur un 1B, restez à Q5 ou Q6 — l'économie en valeur absolue est de toute façon dérisoire.
← Guide précédent
Quel modèle pour quelle machine : dimensionner sa RAM
Le calcul complet — poids du modèle, cache d'attention, part du système — pour savoir avant de télécharger si ça va tenir, et quoi faire quand ça ne tient pas.
Guide suivant →
Installer Ollama sur un Raspberry Pi 5
L'installation de référence du projet : préparation du système, choix du stockage, service accessible sur le réseau local, et les réglages qui évitent le bridage thermique.