この内容はまだフランス語です
ページ自体は翻訳済みですが、詳細な内容はまだです。機器の解説、ガイド、カタログはフランス語のまま表示されます。粗い機械翻訳よりも原文をお見せするほうがよいと考えました。 フランス語版を見る
Un serveur d'IA pour toute une classe
Étape 2 sur 7
Préparer le moteur
shell
# Sur le serveur
ollama pull qwen3:8b # 16 Go de RAM
# ou
ollama pull qwen3:4b # 8 Go de RAM
sudo systemctl edit ollama
systemd
[Service]
Environment="OLLAMA_HOST=0.0.0.0:11434"
# Garder le modèle chaud pendant la séance
Environment="OLLAMA_KEEP_ALIVE=2h"
# Requêtes traitées simultanément : 1 sur CPU, 2 à 4 avec un GPU
Environment="OLLAMA_NUM_PARALLEL=1"
# Un seul modèle en mémoire à la fois
Environment="OLLAMA_MAX_LOADED_MODELS=1"
shell
sudo systemctl daemon-reload && sudo systemctl restart ollama
OLLAMA_KEEP_ALIVE à deux heures évite le rechargement du modèle entre deux questions : sur une carte SBC, ce rechargement coûte plus cher que la réponse elle-même.