Ir para o conteúdo

Este conteúdo ainda está em francês

A página está traduzida, mas o conteúdo detalhado ainda não. As fichas, os guias e os catálogos continuam em francês: preferimos mostrar-lhe o original a uma tradução automática aproximada. Ver o site em francês

Guide 9 sur 12

Mesurer avant d'optimiser

Trois chiffres suffisent à piloter un déploiement : traitement du prompt, vitesse de génération, watts à la prise. Voici comment les obtenir et ce qu'ils changent.

Démarrer le pas à pas 6 étapes · 1 heure · une étape à l'écran, avec Précédent / Suivant

Niveau Intermédiaire
Durée 1 heure
Étapes 6
Catégorie Optimisation
Avant de commencer
  • llama.cpp compilé, ou au minimum Ollama installé
  • Un wattmètre de prise (environ 15 €) pour la partie énergie
1

Les trois chiffres

ChiffreCe qu'il mesureCe qu'il détermine
pp — prompt eval (tok/s)Vitesse de lecture de la question et du contexteLe délai avant le premier mot
tg — text generation (tok/s)Vitesse de production de la réponseLe confort de lecture
W — watts à la priseConsommation réelle en chargeLe coût, l'autonomie, l'argument écologique
Le seuil du confortableEn dessous de 5 tokens par seconde, l'utilisateur attend visiblement. Entre 5 et 10, la réponse arrive à peu près à la vitesse de lecture. Au-delà de 15, la différence ne se perçoit plus.
2

Mesurer avec llama-bench

shell
cd llama.cpp

# Mesure de référence
./build/bin/llama-bench -m ../modeles/Qwen3-4B-Q4_K_M.gguf

# Comparer plusieurs nombres de threads
./build/bin/llama-bench -m ../modeles/Qwen3-4B-Q4_K_M.gguf -t 2,4,6,8

# Comparer deux quantifications du même modèle
./build/bin/llama-bench -m ../modeles/Qwen3-4B-Q4_K_M.gguf \
                        -m ../modeles/Qwen3-4B-Q8_0.gguf

Chaque mesure est répétée et l'écart-type est affiché. Une variation supérieure à 10 % entre deux passages signale presque toujours un bridage thermique : laissez la machine refroidir et recommencez.

3

Le nombre de threads

Le réflexe est de tout donner au moteur. C'est souvent contre-productif.

  • Sur un processeur homogène (Raspberry Pi, N100), le nombre de cœurs physiques est le bon réglage.
  • Sur un processeur hétérogène (RK3588, puces mobiles), n'utilisez que les cœurs performants : les petits cœurs ralentissent la synchronisation.
  • Laisser un cœur libre améliore la réactivité générale du système quand la machine fait autre chose.
  • L'hyperthreading n'aide généralement pas : la limite est la bande passante mémoire, pas le calcul.
4

Ce qui fait vraiment bouger l'aiguille

LevierGain typiqueCoût
Passer d'un modèle 8B à un 4B× 2 à × 2,5Réponses moins fines
Q8_0 vers Q4_K_M× 1,5 à × 2Perte de qualité modeste
Compiler avec GGML_NATIVE+ 20 à 40 %Une heure de mise en place
RAM en double canal+ 30 à 80 %Une barrette supplémentaire
Bon refroidissement+ 10 à 30 %Un dissipateur
Réduire le contexteMémoire libéréeHistorique plus court
Ajouter des threads au-delà des cœursNul ou négatif—
La leçon généraleSur ces machines, l'inférence est limitée par la bande passante mémoire. Tout ce qui réduit le nombre d'octets à lire par token — modèle plus petit, quantification plus basse — se traduit directement en débit. Tout ce qui n'ajoute que du calcul ne change presque rien.
5

Mesurer la consommation

Un wattmètre de prise à 15 € vaut tous les tableaux comparatifs. Le protocole tient en quatre mesures.

  1. Machine éteinte, alimentation branchée : la consommation résiduelle.
  2. Machine allumée, au repos : c'est ce qu'elle coûte 90 % du temps.
  3. Pendant une génération continue de deux minutes : le pic réel.
  4. Sur une séance complète d'une heure : le seul chiffre honnête à communiquer.
calcul
# Énergie par requête
# Wh = (watts en charge) × (durée de la réponse en secondes) / 3600

# Exemple : 8 W pendant 12 s
#   8 × 12 / 3600 = 0,027 Wh par réponse
#   soit environ 37 000 réponses pour 1 kWh
Rester honnêteComparer cette valeur à celle d'un service en ligne demande de la prudence : les chiffres publiés par les grands opérateurs sont partiels et ne couvrent pas les mêmes périmètres. Communiquez sur ce que vous avez mesuré chez vous, avec la méthode. C'est plus solide qu'un facteur spectaculaire invérifiable.
6

Consigner les mesures

Un déploiement se pilote sur des chiffres datés. Tenez un tableau, même rudimentaire — il vous évitera de refaire trois fois les mêmes essais.

journal
date | machine | modèle | quantif | threads | pp t/s | tg t/s | W repos | W charge
-----|---------|--------|---------|---------|--------|--------|---------|----------
03/09 | Pi 5 8G | qwen3  | Q4_K_M  | 4       | 42     | 5,1    | 3,2     | 8,4
mesure performance méthode énergie