Este contenido sigue en francés
La página está traducida, pero su contenido detallado todavía no. Las fichas, las guías y los catálogos se muestran en francés: preferimos darte el original antes que una traducción automática aproximada. Ver el sitio en francés
Votre première IA locale en 30 minutes
Étape 5 sur 6
Réglez la mémoire et le contexte
Deux réglages évitent la quasi-totalité des ralentissements sur petite machine : la taille du contexte, et la durée pendant laquelle le modèle reste chargé en mémoire.
shell
# Dans une session ollama : réduire le contexte à 2048 tokens
/set parameter num_ctx 2048
# Décharger le modèle dès la fin d'une requête (libère la RAM)
export OLLAMA_KEEP_ALIVE=0
# Voir ce qui est chargé et combien ça occupe
ollama ps
Un contexte large coûte de la mémoire en permanence, même quand vous ne l'utilisez pas. Sur une machine à 4 Go, c'est presque toujours le contexte, et non le modèle, qui déclenche le passage en swap et l'effondrement du débit.