本文へ移動

この内容はまだフランス語です

ページ自体は翻訳済みですが、詳細な内容はまだです。機器の解説、ガイド、カタログはフランス語のまま表示されます。粗い機械翻訳よりも原文をお見せするほうがよいと考えました。 フランス語版を見る

Guide 2 sur 12

Quel modèle pour quelle machine : dimensionner sa RAM

Le calcul complet — poids du modèle, cache d'attention, part du système — pour savoir avant de télécharger si ça va tenir, et quoi faire quand ça ne tient pas.

Démarrer le pas à pas 6 étapes · 20 minutes · une étape à l'écran, avec Précédent / Suivant

Niveau Débutant
Durée 20 minutes
Étapes 6
Catégorie Modèles
Avant de commencer
  • Savoir combien de RAM a votre machine
  • Aucune connaissance en mathématiques au-delà de la multiplication
1

Le poids du modèle

Un modèle quantifié occupe, en gros, le nombre de paramètres multiplié par le nombre de bits par paramètre. En Q4_K_M — la quantification par défaut, environ 4,8 bits par poids — cela donne un repère simple :

La règle des 0,6Environ 0,6 Go par milliard de paramètres en Q4_K_M. Un modèle 4B pèse environ 2,5 Go, un 8B environ 4,7 Go, un 14B environ 8,5 Go.

Ce chiffre est celui du fichier sur le disque, et c'est aussi, à peu de chose près, ce qu'il occupera en mémoire une fois chargé.

2

Le cache d'attention, le coût qu'on oublie

À côté du modèle, le moteur garde en mémoire un cache proportionnel à la fenêtre de contexte : plus vous autorisez de tokens, plus il grossit. C'est très souvent lui qui fait déborder une petite machine.

ContexteOrdre de grandeur du cacheUsage typique
2 048 tokensquelques centaines de MoQuestions-réponses courtes
4 096 tokensle double du précédentConversation suivie
8 192 tokensle quadrupleAnalyse de document
32 768 tokensplusieurs GoCorpus long — hors de portée d'une SBC

Le cache dépend aussi de l'architecture du modèle : deux modèles de même taille peuvent avoir des besoins très différents. La règle pratique reste la même : ne réservez jamais plus de contexte que ce dont vous vous servez.

3

La part du système

Il faut enfin laisser vivre le reste de la machine.

  • Linux sans interface graphique : environ 0,5 à 1 Go
  • Linux avec bureau : environ 1,5 à 2 Go
  • Windows 11 : environ 3 à 4 Go
  • Un navigateur ouvert avec quelques onglets : 1 Go de plus
Le calcul completRAM nécessaire = poids du modèle + cache de contexte + part du système. Si le total dépasse votre RAM physique, la machine bascule en swap et le débit s'effondre d'un facteur dix. Ce n'est pas « un peu plus lent » : c'est inutilisable.
4

Le tableau de correspondance

En appliquant le calcul, voici ce qui tient réellement, sur un système Linux sans interface graphique, avec un contexte de 4 096 tokens :

RAM de la machineModèle maximum en Q4_K_MExemples
2 Go~1 Md de paramètresQwen3 0.6B, Llama 3.2 1B
4 Go~3 Md de paramètresLlama 3.2 3B, Qwen3 1.7B
8 Go~8 Md de paramètresQwen3 8B, Mistral 7B
16 Go~14 Md de paramètresQwen3 14B, Gemma 3 12B
32 Go~30 Md de paramètresModèles de grande taille quantifiés

Ajoutez une interface graphique ou un navigateur et vous descendez d'une ligne. C'est aussi simple que cela.

5

Quand ça ne rentre pas

Quatre leviers, dans cet ordre — du moins coûteux en qualité au plus coûteux :

  1. Réduire le contexte. Passer de 8 192 à 2 048 tokens libère souvent le gigaoctet qui manque, sans toucher à la qualité des réponses courtes.
  2. Fermer le reste. Sur un poste dédié, pas de bureau graphique, pas de navigateur : c'est un ou deux gigaoctets récupérés.
  3. Descendre d'une quantification. Q4_K_M vers Q4_0 ou IQ4_XS gagne 10 à 15 % de mémoire pour une perte modeste. Voir le guide sur la quantification.
  4. Prendre un modèle plus petit. Un 3B qui répond en deux secondes est plus utile qu'un 8B qui rame : dans les faits, c'est presque toujours le bon arbitrage.
Ce qu'il ne faut pas faireAugmenter le fichier d'échange pour « faire tenir » un modèle trop gros. Techniquement, ça démarre. En pratique, chaque token généré déclenche des lectures disque et vous obtenez un mot toutes les quelques secondes, tout en usant le SSD.
6

Vérifier sur la machine

shell
# Mémoire libre, avant et pendant
free -h

# Ce qu'Ollama a chargé et pour combien de temps
ollama ps

# Surveiller en direct pendant une génération
watch -n 1 free -h

# Le swap est-il utilisé ? S'il grimpe, le modèle est trop gros.
vmstat 1 5

La colonne si/so de vmstat doit rester à zéro pendant la génération. Dès qu'elle bouge, vous avez la réponse.

dimensionnement RAM méthode