Este conteúdo ainda está em francês
A página está traduzida, mas o conteúdo detalhado ainda não. As fichas, os guias e os catálogos continuam em francês: preferimos mostrar-lhe o original a uma tradução automática aproximada. Ver o site em francês
Guide 2 sur 12
Quel modèle pour quelle machine : dimensionner sa RAM
Le calcul complet — poids du modèle, cache d'attention, part du système — pour savoir avant de télécharger si ça va tenir, et quoi faire quand ça ne tient pas.
Démarrer le pas à pas 6 étapes · 20 minutes · une étape à l'écran, avec Précédent / Suivant
- Savoir combien de RAM a votre machine
- Aucune connaissance en mathématiques au-delà de la multiplication
Le poids du modèle
Un modèle quantifié occupe, en gros, le nombre de paramètres multiplié par le nombre de bits par paramètre. En Q4_K_M — la quantification par défaut, environ 4,8 bits par poids — cela donne un repère simple :
Ce chiffre est celui du fichier sur le disque, et c'est aussi, à peu de chose près, ce qu'il occupera en mémoire une fois chargé.
Le cache d'attention, le coût qu'on oublie
À côté du modèle, le moteur garde en mémoire un cache proportionnel à la fenêtre de contexte : plus vous autorisez de tokens, plus il grossit. C'est très souvent lui qui fait déborder une petite machine.
| Contexte | Ordre de grandeur du cache | Usage typique |
|---|---|---|
| 2 048 tokens | quelques centaines de Mo | Questions-réponses courtes |
| 4 096 tokens | le double du précédent | Conversation suivie |
| 8 192 tokens | le quadruple | Analyse de document |
| 32 768 tokens | plusieurs Go | Corpus long — hors de portée d'une SBC |
Le cache dépend aussi de l'architecture du modèle : deux modèles de même taille peuvent avoir des besoins très différents. La règle pratique reste la même : ne réservez jamais plus de contexte que ce dont vous vous servez.
La part du système
Il faut enfin laisser vivre le reste de la machine.
- Linux sans interface graphique : environ 0,5 à 1 Go
- Linux avec bureau : environ 1,5 à 2 Go
- Windows 11 : environ 3 à 4 Go
- Un navigateur ouvert avec quelques onglets : 1 Go de plus
Le tableau de correspondance
En appliquant le calcul, voici ce qui tient réellement, sur un système Linux sans interface graphique, avec un contexte de 4 096 tokens :
| RAM de la machine | Modèle maximum en Q4_K_M | Exemples |
|---|---|---|
| 2 Go | ~1 Md de paramètres | Qwen3 0.6B, Llama 3.2 1B |
| 4 Go | ~3 Md de paramètres | Llama 3.2 3B, Qwen3 1.7B |
| 8 Go | ~8 Md de paramètres | Qwen3 8B, Mistral 7B |
| 16 Go | ~14 Md de paramètres | Qwen3 14B, Gemma 3 12B |
| 32 Go | ~30 Md de paramètres | Modèles de grande taille quantifiés |
Ajoutez une interface graphique ou un navigateur et vous descendez d'une ligne. C'est aussi simple que cela.
Quand ça ne rentre pas
Quatre leviers, dans cet ordre — du moins coûteux en qualité au plus coûteux :
- Réduire le contexte. Passer de 8 192 à 2 048 tokens libère souvent le gigaoctet qui manque, sans toucher à la qualité des réponses courtes.
- Fermer le reste. Sur un poste dédié, pas de bureau graphique, pas de navigateur : c'est un ou deux gigaoctets récupérés.
- Descendre d'une quantification. Q4_K_M vers Q4_0 ou IQ4_XS gagne 10 à 15 % de mémoire pour une perte modeste. Voir le guide sur la quantification.
- Prendre un modèle plus petit. Un 3B qui répond en deux secondes est plus utile qu'un 8B qui rame : dans les faits, c'est presque toujours le bon arbitrage.
Vérifier sur la machine
# Mémoire libre, avant et pendant
free -h
# Ce qu'Ollama a chargé et pour combien de temps
ollama ps
# Surveiller en direct pendant une génération
watch -n 1 free -h
# Le swap est-il utilisé ? S'il grimpe, le modèle est trop gros.
vmstat 1 5
La colonne si/so de vmstat doit rester à zéro pendant la génération. Dès qu'elle bouge, vous avez la réponse.
← Guide précédent
Votre première IA locale en 30 minutes
Partir d'une machine que vous avez déjà et obtenir un assistant qui répond sans connexion, en une demi-heure et sans rien casser.
Guide suivant →
Choisir sa quantification GGUF
Q4_K_M, Q5_K_S, IQ3_XXS : ce que signifient ces suffixes, ce qu'ils coûtent en qualité, et la règle simple qui évite d'y passer une soirée.