Compiler llama.cpp pour tirer le maximum du processeur
Étape 6 sur 7
Lancer le serveur
shell
./build/bin/llama-server \
-m ./modeles/Qwen3-4B-Q4_K_M.gguf \
-c 4096 \
-t 4 \
--host 0.0.0.0 --port 8080
# Interface web sur http://IP:8080
# API compatible OpenAI sur http://IP:8080/v1
| Option | Rôle | Conseil sur petite machine |
|---|---|---|
| -c | Taille du contexte | Le plus bas qui convienne : 2048 ou 4096 |
| -t | Threads de génération | Le nombre de cœurs performants, pas le total |
| -ngl | Couches déchargées sur le GPU | 0 sans GPU, 99 pour tout décharger |
| -fa | Attention rapide | À activer : réduit la mémoire du cache |
| --mlock | Verrouille le modèle en RAM | Utile si la machine a tendance à swapper |