この内容はまだフランス語です
ページ自体は翻訳済みですが、詳細な内容はまだです。機器の解説、ガイド、カタログはフランス語のまま表示されます。粗い機械翻訳よりも原文をお見せするほうがよいと考えました。 フランス語版を見る
Votre première IA locale en 30 minutes
Étape 5 sur 6
Réglez la mémoire et le contexte
Deux réglages évitent la quasi-totalité des ralentissements sur petite machine : la taille du contexte, et la durée pendant laquelle le modèle reste chargé en mémoire.
shell
# Dans une session ollama : réduire le contexte à 2048 tokens
/set parameter num_ctx 2048
# Décharger le modèle dès la fin d'une requête (libère la RAM)
export OLLAMA_KEEP_ALIVE=0
# Voir ce qui est chargé et combien ça occupe
ollama ps
Un contexte large coûte de la mémoire en permanence, même quand vous ne l'utilisez pas. Sur une machine à 4 Go, c'est presque toujours le contexte, et non le modèle, qui déclenche le passage en swap et l'effondrement du débit.