Aller au contenu
Mesurer avant d'optimiser Étape 4 sur 6

Ce qui fait vraiment bouger l'aiguille

LevierGain typiqueCoût
Passer d'un modèle 8B à un 4B× 2 à × 2,5Réponses moins fines
Q8_0 vers Q4_K_M× 1,5 à × 2Perte de qualité modeste
Compiler avec GGML_NATIVE+ 20 à 40 %Une heure de mise en place
RAM en double canal+ 30 à 80 %Une barrette supplémentaire
Bon refroidissement+ 10 à 30 %Un dissipateur
Réduire le contexteMémoire libéréeHistorique plus court
Ajouter des threads au-delà des cœursNul ou négatif—
La leçon généraleSur ces machines, l'inférence est limitée par la bande passante mémoire. Tout ce qui réduit le nombre d'octets à lire par token — modèle plus petit, quantification plus basse — se traduit directement en débit. Tout ce qui n'ajoute que du calcul ne change presque rien.