This content is still in French
The page itself is translated, but its detailed content is not yet. Hardware sheets, guides and catalogues are still shown in French: we would rather give you the original than a rough machine translation. View the French site
Mesurer avant d'optimiser
Étape 4 sur 6
Ce qui fait vraiment bouger l'aiguille
| Levier | Gain typique | Coût |
|---|---|---|
| Passer d'un modèle 8B à un 4B | × 2 à × 2,5 | Réponses moins fines |
| Q8_0 vers Q4_K_M | × 1,5 à × 2 | Perte de qualité modeste |
| Compiler avec GGML_NATIVE | + 20 à 40 % | Une heure de mise en place |
| RAM en double canal | + 30 à 80 % | Une barrette supplémentaire |
| Bon refroidissement | + 10 à 30 % | Un dissipateur |
| Réduire le contexte | Mémoire libérée | Historique plus court |
| Ajouter des threads au-delà des cœurs | Nul ou négatif | — |
La leçon généraleSur ces machines, l'inférence est limitée par la bande passante mémoire. Tout ce qui réduit le nombre d'octets à lire par token — modèle plus petit, quantification plus basse — se traduit directement en débit. Tout ce qui n'ajoute que du calcul ne change presque rien.