Quel modèle pour quelle machine : dimensionner sa RAM
Étape 5 sur 6
Quand ça ne rentre pas
Quatre leviers, dans cet ordre — du moins coûteux en qualité au plus coûteux :
- Réduire le contexte. Passer de 8 192 à 2 048 tokens libère souvent le gigaoctet qui manque, sans toucher à la qualité des réponses courtes.
- Fermer le reste. Sur un poste dédié, pas de bureau graphique, pas de navigateur : c'est un ou deux gigaoctets récupérés.
- Descendre d'une quantification. Q4_K_M vers Q4_0 ou IQ4_XS gagne 10 à 15 % de mémoire pour une perte modeste. Voir le guide sur la quantification.
- Prendre un modèle plus petit. Un 3B qui répond en deux secondes est plus utile qu'un 8B qui rame : dans les faits, c'est presque toujours le bon arbitrage.
Ce qu'il ne faut pas faireAugmenter le fichier d'échange pour « faire tenir » un modèle trop gros. Techniquement, ça démarre. En pratique, chaque token généré déclenche des lectures disque et vous obtenez un mot toutes les quelques secondes, tout en usant le SSD.