Ir para o conteúdo

Este conteúdo ainda está em francês

A página está traduzida, mas o conteúdo detalhado ainda não. As fichas, os guias e os catálogos continuam em francês: preferimos mostrar-lhe o original a uma tradução automática aproximada. Ver o site em francês

Lancer le serveur

shell
./build/bin/llama-server \
  -m ./modeles/Qwen3-4B-Q4_K_M.gguf \
  -c 4096 \
  -t 4 \
  --host 0.0.0.0 --port 8080

# Interface web sur http://IP:8080
# API compatible OpenAI sur http://IP:8080/v1
OptionRôleConseil sur petite machine
-cTaille du contexteLe plus bas qui convienne : 2048 ou 4096
-tThreads de générationLe nombre de cœurs performants, pas le total
-nglCouches déchargées sur le GPU0 sans GPU, 99 pour tout décharger
-faAttention rapideÀ activer : réduit la mémoire du cache
--mlockVerrouille le modèle en RAMUtile si la machine a tendance à swapper