Skip to content

This content is still in French

The page itself is translated, but its detailed content is not yet. Hardware sheets, guides and catalogues are still shown in French: we would rather give you the original than a rough machine translation. View the French site

Préparer le moteur

shell
# Sur le serveur
ollama pull qwen3:8b        # 16 Go de RAM
# ou
ollama pull qwen3:4b        # 8 Go de RAM

sudo systemctl edit ollama
systemd
[Service]
Environment="OLLAMA_HOST=0.0.0.0:11434"
# Garder le modèle chaud pendant la séance
Environment="OLLAMA_KEEP_ALIVE=2h"
# Requêtes traitées simultanément : 1 sur CPU, 2 à 4 avec un GPU
Environment="OLLAMA_NUM_PARALLEL=1"
# Un seul modèle en mémoire à la fois
Environment="OLLAMA_MAX_LOADED_MODELS=1"
shell
sudo systemctl daemon-reload && sudo systemctl restart ollama

OLLAMA_KEEP_ALIVE à deux heures évite le rechargement du modèle entre deux questions : sur une carte SBC, ce rechargement coûte plus cher que la réponse elle-même.