This content is still in French
The page itself is translated, but its detailed content is not yet. Hardware sheets, guides and catalogues are still shown in French: we would rather give you the original than a rough machine translation. View the French site
Compiler llama.cpp pour tirer le maximum du processeur
Étape 1 sur 7
Avant de commencer
- Être à l'aise avec le terminal
- Environ 5 Go d'espace disque libre
- Un modèle GGUF déjà téléchargé, ou de quoi le récupérer
Pourquoi compiler
Un binaire distribué doit tourner partout : il n'active que les instructions présentes sur toutes les machines de la famille. Compilé sur place, le moteur utilise les extensions vectorielles réellement disponibles.
- Sur ARM : les instructions
dotprodeti8mmquand le cœur les possède - Sur x86 : AVX2, AVX-512 et les extensions VNNI selon le processeur
- Contrôle direct du nombre de threads, du contexte et de l'attention rapide
- Accès à
llama-bench, l'outil de mesure de référence
Quand ça n'en vaut pas la peineSi Ollama vous donne déjà un débit confortable, gardez-le. Cette étape s'adresse aux machines contraintes où chaque token par seconde compte, ou aux plateformes qu'Ollama ne couvre pas.