Aller au contenu

Préparer le moteur

shell
# Sur le serveur
ollama pull qwen3:8b        # 16 Go de RAM
# ou
ollama pull qwen3:4b        # 8 Go de RAM

sudo systemctl edit ollama
systemd
[Service]
Environment="OLLAMA_HOST=0.0.0.0:11434"
# Garder le modèle chaud pendant la séance
Environment="OLLAMA_KEEP_ALIVE=2h"
# Requêtes traitées simultanément : 1 sur CPU, 2 à 4 avec un GPU
Environment="OLLAMA_NUM_PARALLEL=1"
# Un seul modèle en mémoire à la fois
Environment="OLLAMA_MAX_LOADED_MODELS=1"
shell
sudo systemctl daemon-reload && sudo systemctl restart ollama

OLLAMA_KEEP_ALIVE à deux heures évite le rechargement du modèle entre deux questions : sur une carte SBC, ce rechargement coûte plus cher que la réponse elle-même.