本文へ移動

この内容はまだフランス語です

ページ自体は翻訳済みですが、詳細な内容はまだです。機器の解説、ガイド、カタログはフランス語のまま表示されます。粗い機械翻訳よりも原文をお見せするほうがよいと考えました。 フランス語版を見る

Lancer le serveur

shell
./build/bin/llama-server \
  -m ./modeles/Qwen3-4B-Q4_K_M.gguf \
  -c 4096 \
  -t 4 \
  --host 0.0.0.0 --port 8080

# Interface web sur http://IP:8080
# API compatible OpenAI sur http://IP:8080/v1
OptionRôleConseil sur petite machine
-cTaille du contexteLe plus bas qui convienne : 2048 ou 4096
-tThreads de générationLe nombre de cœurs performants, pas le total
-nglCouches déchargées sur le GPU0 sans GPU, 99 pour tout décharger
-faAttention rapideÀ activer : réduit la mémoire du cache
--mlockVerrouille le modèle en RAMUtile si la machine a tendance à swapper