Ir para o conteúdo

Este conteúdo ainda está em francês

A página está traduzida, mas o conteúdo detalhado ainda não. As fichas, os guias e os catálogos continuam em francês: preferimos mostrar-lhe o original a uma tradução automática aproximada. Ver o site em francês

Préparer le moteur

shell
# Sur le serveur
ollama pull qwen3:8b        # 16 Go de RAM
# ou
ollama pull qwen3:4b        # 8 Go de RAM

sudo systemctl edit ollama
systemd
[Service]
Environment="OLLAMA_HOST=0.0.0.0:11434"
# Garder le modèle chaud pendant la séance
Environment="OLLAMA_KEEP_ALIVE=2h"
# Requêtes traitées simultanément : 1 sur CPU, 2 à 4 avec un GPU
Environment="OLLAMA_NUM_PARALLEL=1"
# Un seul modèle en mémoire à la fois
Environment="OLLAMA_MAX_LOADED_MODELS=1"
shell
sudo systemctl daemon-reload && sudo systemctl restart ollama

OLLAMA_KEEP_ALIVE à deux heures évite le rechargement du modèle entre deux questions : sur une carte SBC, ce rechargement coûte plus cher que la réponse elle-même.