Choisir sa quantification GGUF
Étape 5 sur 7
Télécharger la bonne variante
Avec Ollama, l'étiquette suffit :
shell
# Variante par défaut (souvent Q4_K_M)
ollama run qwen3:8b
# Variante explicite
ollama run qwen3:8b-q8_0
Avec llama.cpp, on récupère le fichier GGUF précis :
shell
pip install -U "huggingface_hub[cli]"
# Un seul fichier, pas le dépôt entier
hf download unsloth/Qwen3-8B-GGUF Qwen3-8B-Q4_K_M.gguf \
--local-dir ./modeles
ls -lh ./modeles