Skip to content

This content is still in French

The page itself is translated, but its detailed content is not yet. Hardware sheets, guides and catalogues are still shown in French: we would rather give you the original than a rough machine translation. View the French site

Réglez la mémoire et le contexte

Deux réglages évitent la quasi-totalité des ralentissements sur petite machine : la taille du contexte, et la durée pendant laquelle le modèle reste chargé en mémoire.

shell
# Dans une session ollama : réduire le contexte à 2048 tokens
/set parameter num_ctx 2048

# Décharger le modèle dès la fin d'une requête (libère la RAM)
export OLLAMA_KEEP_ALIVE=0

# Voir ce qui est chargé et combien ça occupe
ollama ps

Un contexte large coûte de la mémoire en permanence, même quand vous ne l'utilisez pas. Sur une machine à 4 Go, c'est presque toujours le contexte, et non le modèle, qui déclenche le passage en swap et l'effondrement du débit.