Choisir sa quantification GGUF
Étape 7 sur 7
Deux cas particuliers
- Les modèles d'embedding : gardez-les en Q8_0 ou en 16 bits. Ils sont petits, et la précision des vecteurs conditionne directement la qualité de votre recherche documentaire.
- Les très petits modèles (moins de 2 Md) : ils encaissent mal la quantification agressive. Sur un 1B, restez à Q5 ou Q6 — l'économie en valeur absolue est de toute façon dérisoire.