Skip to content

This content is still in French

The page itself is translated, but its detailed content is not yet. Hardware sheets, guides and catalogues are still shown in French: we would rather give you the original than a rough machine translation. View the French site

Mesurer avant d'optimiser Étape 4 sur 6

Ce qui fait vraiment bouger l'aiguille

LevierGain typiqueCoût
Passer d'un modèle 8B à un 4B× 2 à × 2,5Réponses moins fines
Q8_0 vers Q4_K_M× 1,5 à × 2Perte de qualité modeste
Compiler avec GGML_NATIVE+ 20 à 40 %Une heure de mise en place
RAM en double canal+ 30 à 80 %Une barrette supplémentaire
Bon refroidissement+ 10 à 30 %Un dissipateur
Réduire le contexteMémoire libéréeHistorique plus court
Ajouter des threads au-delà des cœursNul ou négatif—
La leçon généraleSur ces machines, l'inférence est limitée par la bande passante mémoire. Tout ce qui réduit le nombre d'octets à lire par token — modèle plus petit, quantification plus basse — se traduit directement en débit. Tout ce qui n'ajoute que du calcul ne change presque rien.