Aller au contenu

Réglez la mémoire et le contexte

Deux réglages évitent la quasi-totalité des ralentissements sur petite machine : la taille du contexte, et la durée pendant laquelle le modèle reste chargé en mémoire.

shell
# Dans une session ollama : réduire le contexte à 2048 tokens
/set parameter num_ctx 2048

# Décharger le modèle dès la fin d'une requête (libère la RAM)
export OLLAMA_KEEP_ALIVE=0

# Voir ce qui est chargé et combien ça occupe
ollama ps

Un contexte large coûte de la mémoire en permanence, même quand vous ne l'utilisez pas. Sur une machine à 4 Go, c'est presque toujours le contexte, et non le modèle, qui déclenche le passage en swap et l'effondrement du débit.