Ir para o conteúdo

Este conteúdo ainda está em francês

A página está traduzida, mas o conteúdo detalhado ainda não. As fichas, os guias e os catálogos continuam em francês: preferimos mostrar-lhe o original a uma tradução automática aproximada. Ver o site em francês

Guide 3 sur 12

Choisir sa quantification GGUF

Q4_K_M, Q5_K_S, IQ3_XXS : ce que signifient ces suffixes, ce qu'ils coûtent en qualité, et la règle simple qui évite d'y passer une soirée.

Démarrer le pas à pas 7 étapes · 25 minutes · une étape à l'écran, avec Précédent / Suivant

Niveau Intermédiaire
Durée 25 minutes
Étapes 7
Catégorie Modèles
Avant de commencer
  • Avoir déjà fait tourner un modèle localement
  • Savoir télécharger un fichier depuis un dépôt de modèles
1

Ce que la quantification fait vraiment

Un modèle est entraîné avec des poids en 16 bits. La quantification réduit chaque poids à 8, 5, 4, parfois 2 bits. Le fichier rétrécit d'autant, la mémoire nécessaire aussi, et le calcul devient plus rapide — car sur ces machines, c'est la bande passante mémoire qui limite, pas le processeur.

En contrepartie, le modèle perd en précision. Toute la question est de savoir jusqu'où on peut descendre sans que ça se voie.

2

Lire les suffixes

  • Le chiffre — Q4, Q5, Q8 : le nombre de bits par poids, en moyenne.
  • La lettre K — quantification « par blocs » de nouvelle génération, meilleure à taille égale que les anciens formats. À privilégier.
  • S / M / L — small, medium, large : à l'intérieur d'un même niveau, la variante M protège mieux les couches sensibles.
  • Le préfixe I — importance matrix : la quantification est guidée par un jeu de données de calibration. Très efficace en dessous de 4 bits.
3

Le tableau de décision

VarianteTaille relativePerte de qualitéQuand la choisir
Q8_0× 2,1NégligeableModèles d'embedding, petits modèles où la place ne manque pas
Q6_K× 1,6Très faibleQuand il reste de la marge mémoire et qu'on veut le maximum
Q5_K_M× 1,3FaibleBon compromis si la RAM le permet
Q4_K_M× 1,0 (référence)AcceptableLe choix par défaut, dans la quasi-totalité des cas
IQ4_XS× 0,9AcceptableQuand il manque quelques centaines de Mo pour tenir
Q3_K_M× 0,8VisibleDernier recours pour faire entrer un modèle plus gros
Q2_K× 0,6ImportanteCuriosité technique, rarement utilisable en production
4

La règle SATI

Par défaut : Q4_K_MC'est le point où la courbe qualité/taille se casse. Au-dessus, on paie beaucoup de mémoire pour un gain marginal ; en dessous, la dégradation devient perceptible. Ne partez ailleurs que si vous avez une raison mesurée de le faire.

Deuxième règle, plus contre-intuitive : à budget mémoire égal, un modèle plus gros fortement quantifié bat généralement un modèle plus petit peu quantifié. Un 8B en Q4_K_M (≈ 4,7 Go) rend en général de meilleurs services qu'un 4B en Q8_0 (≈ 4,3 Go).

Cette règle a une limite : sous 3 bits, la dégradation devient sévère et le petit modèle reprend l'avantage.

5

Télécharger la bonne variante

Avec Ollama, l'étiquette suffit :

shell
# Variante par défaut (souvent Q4_K_M)
ollama run qwen3:8b

# Variante explicite
ollama run qwen3:8b-q8_0

Avec llama.cpp, on récupère le fichier GGUF précis :

shell
pip install -U "huggingface_hub[cli]"

# Un seul fichier, pas le dépôt entier
hf download unsloth/Qwen3-8B-GGUF Qwen3-8B-Q4_K_M.gguf \
  --local-dir ./modeles

ls -lh ./modeles
6

Vérifier la dégradation vous-même

Les mesures de perplexité publiées ne disent rien de votre usage. Le test qui compte tient en dix minutes : constituez une vingtaine de questions représentatives de ce que vos utilisateurs demanderont, puis passez-les sur deux quantifications.

shell
# Même question, deux variantes, comparaison à l'œil
for q in q4_K_M q8_0; do
  echo "=== $q ==="
  ollama run qwen3:8b-$q "Explique la photosynthèse à un enfant de 10 ans."
done
Ce que vous cherchezPas une réponse « meilleure » — les deux seront plausibles. Cherchez les erreurs factuelles, les répétitions, les phrases qui partent en boucle et les glissements vers l'anglais. Ce sont les premiers symptômes d'une quantification trop agressive.
7

Deux cas particuliers

  • Les modèles d'embedding : gardez-les en Q8_0 ou en 16 bits. Ils sont petits, et la précision des vecteurs conditionne directement la qualité de votre recherche documentaire.
  • Les très petits modèles (moins de 2 Md) : ils encaissent mal la quantification agressive. Sur un 1B, restez à Q5 ou Q6 — l'économie en valeur absolue est de toute façon dérisoire.
GGUF quantification qualité