Skip to content

This content is still in French

The page itself is translated, but its detailed content is not yet. Hardware sheets, guides and catalogues are still shown in French: we would rather give you the original than a rough machine translation. View the French site

Lancer le serveur

shell
./build/bin/llama-server \
  -m ./modeles/Qwen3-4B-Q4_K_M.gguf \
  -c 4096 \
  -t 4 \
  --host 0.0.0.0 --port 8080

# Interface web sur http://IP:8080
# API compatible OpenAI sur http://IP:8080/v1
OptionRôleConseil sur petite machine
-cTaille du contexteLe plus bas qui convienne : 2048 ou 4096
-tThreads de générationLe nombre de cœurs performants, pas le total
-nglCouches déchargées sur le GPU0 sans GPU, 99 pour tout décharger
-faAttention rapideÀ activer : réduit la mémoire du cache
--mlockVerrouille le modèle en RAMUtile si la machine a tendance à swapper