Este conteúdo ainda está em francês
A página está traduzida, mas o conteúdo detalhado ainda não. As fichas, os guias e os catálogos continuam em francês: preferimos mostrar-lhe o original a uma tradução automática aproximada. Ver o site em francês
Guide 5 sur 12
Compiler llama.cpp pour tirer le maximum du processeur
Quand Ollama ne suffit plus : compiler le moteur pour votre processeur exact, régler les threads, et récupérer les 20 à 40 % de débit que laisse un binaire générique.
Démarrer le pas à pas 7 étapes · 1 h 30 · une étape à l'écran, avec Précédent / Suivant
- Être à l'aise avec le terminal
- Environ 5 Go d'espace disque libre
- Un modèle GGUF déjà téléchargé, ou de quoi le récupérer
Pourquoi compiler
Un binaire distribué doit tourner partout : il n'active que les instructions présentes sur toutes les machines de la famille. Compilé sur place, le moteur utilise les extensions vectorielles réellement disponibles.
- Sur ARM : les instructions
dotprodeti8mmquand le cœur les possède - Sur x86 : AVX2, AVX-512 et les extensions VNNI selon le processeur
- Contrôle direct du nombre de threads, du contexte et de l'attention rapide
- Accès à
llama-bench, l'outil de mesure de référence
Installer les dépendances
# Debian, Ubuntu, Raspberry Pi OS
sudo apt update
sudo apt install -y build-essential cmake git libcurl4-openssl-dev
# Fedora
sudo dnf install -y gcc-c++ cmake git libcurl-devel
# Termux (Android)
pkg install -y clang cmake git
Compiler
git clone https://github.com/ggml-org/llama.cpp
cd llama.cpp
# Compilation CPU optimisée pour la machine locale
cmake -B build -DCMAKE_BUILD_TYPE=Release -DGGML_NATIVE=ON
cmake --build build --config Release -j$(nproc)
ls build/bin/
Comptez cinq minutes sur un mini-PC, une vingtaine sur un Raspberry Pi. Vous obtenez notamment llama-cli, llama-server et llama-bench.
Avec un GPU NVIDIA (Jetson compris), ajoutez le support CUDA :
cmake -B build -DCMAKE_BUILD_TYPE=Release -DGGML_CUDA=ON
cmake --build build --config Release -j$(nproc)
Récupérer un modèle GGUF
pip install -U "huggingface_hub[cli]"
hf download unsloth/Qwen3-4B-GGUF Qwen3-4B-Q4_K_M.gguf \
--local-dir ./modeles
ls -lh ./modeles
Si Ollama est déjà installé, ses modèles sont sur le disque dans ~/.ollama/models/blobs/ : les fichiers volumineux sont des GGUF utilisables tels quels.
Mesurer, puis régler
Ne réglez rien à l'aveugle. llama-bench donne deux chiffres : le traitement du prompt (pp) et la génération (tg).
# Comparer plusieurs nombres de threads
./build/bin/llama-bench -m ./modeles/Qwen3-4B-Q4_K_M.gguf -t 2,4,8
Lancer le serveur
./build/bin/llama-server \
-m ./modeles/Qwen3-4B-Q4_K_M.gguf \
-c 4096 \
-t 4 \
--host 0.0.0.0 --port 8080
# Interface web sur http://IP:8080
# API compatible OpenAI sur http://IP:8080/v1
| Option | Rôle | Conseil sur petite machine |
|---|---|---|
| -c | Taille du contexte | Le plus bas qui convienne : 2048 ou 4096 |
| -t | Threads de génération | Le nombre de cœurs performants, pas le total |
| -ngl | Couches déchargées sur le GPU | 0 sans GPU, 99 pour tout décharger |
| -fa | Attention rapide | À activer : réduit la mémoire du cache |
| --mlock | Verrouille le modèle en RAM | Utile si la machine a tendance à swapper |
Installer en service
Pour que le serveur redémarre avec la machine :
sudo tee /etc/systemd/system/llama.service >/dev/null <<'EOF'
[Unit]
Description=llama.cpp server
After=network.target
[Service]
User=pi
WorkingDirectory=/home/pi/llama.cpp
ExecStart=/home/pi/llama.cpp/build/bin/llama-server -m /home/pi/modeles/Qwen3-4B-Q4_K_M.gguf -c 4096 -t 4 --host 0.0.0.0 --port 8080
Restart=always
RestartSec=5
[Install]
WantedBy=multi-user.target
EOF
sudo systemctl daemon-reload
sudo systemctl enable --now llama
systemctl status llama
Adaptez User et les chemins à votre installation.
← Guide précédent
Installer Ollama sur un Raspberry Pi 5
L'installation de référence du projet : préparation du système, choix du stockage, service accessible sur le réseau local, et les réglages qui évitent le bridage thermique.
Guide suivant →
Un serveur d'IA pour toute une classe
Une machine, trente navigateurs, aucune connexion internet : monter le service partagé, gérer les comptes et dimensionner la file d'attente sans acheter de matériel.