この内容はまだフランス語です
ページ自体は翻訳済みですが、詳細な内容はまだです。機器の解説、ガイド、カタログはフランス語のまま表示されます。粗い機械翻訳よりも原文をお見せするほうがよいと考えました。 フランス語版を見る
Guide 1 sur 12
Votre première IA locale en 30 minutes
Partir d'une machine que vous avez déjà et obtenir un assistant qui répond sans connexion, en une demi-heure et sans rien casser.
Démarrer le pas à pas 6 étapes · 30 minutes · une étape à l'écran, avec Précédent / Suivant
- Une machine avec au moins 4 Go de RAM
- Un accès administrateur (sudo) sur cette machine
- Une connexion internet — pour cette installation uniquement
Regardez ce que vous avez déjà
Le premier réflexe n'est pas d'acheter du matériel, c'est de mesurer celui qui traîne. Sur Linux ou macOS, ces deux commandes suffisent à décider quel modèle vous pourrez faire tourner.
# Mémoire vive disponible
free -h
# Architecture du processeur (aarch64 = ARM, x86_64 = Intel/AMD)
uname -m
# Nombre de cœurs
nproc
Sur Windows, ouvrez le Gestionnaire des tâches, onglet Performance : la mémoire installée et le nombre de cœurs y figurent.
| RAM totale | Ce que vous pouvez viser | Confort attendu |
|---|---|---|
| 2 Go | Modèle 0,5B à 1B | Réponses courtes, utilisable |
| 4 Go | Modèle 1B à 3B | Correct pour du quotidien |
| 8 Go | Modèle 3B à 8B | Bon, c'est le palier recommandé |
| 16 Go | Modèle 8B à 14B | Comparable à un service en ligne |
Installez Ollama
Ollama télécharge, stocke et sert les modèles. C'est le chemin le plus court entre une machine vierge et une réponse à l'écran.
# Linux et macOS
curl -fsSL https://ollama.com/install.sh | sh
# Vérification
ollama --version
Sous Windows, téléchargez l'installeur depuis ollama.com et lancez-le : le service démarre tout seul.
Téléchargez votre premier modèle
Choisissez selon la RAM repérée à l'étape 1. En cas de doute, commencez petit : un modèle qui répond vite donne une bien meilleure première impression qu'un modèle brillant qui met deux minutes.
# 4 Go de RAM et plus
ollama run llama3.2:1b
# 8 Go de RAM et plus (recommandé)
ollama run qwen3:4b
# 16 Go de RAM et plus
ollama run qwen3:8b
Le premier lancement télécharge le modèle — de 800 Mo à 5 Go selon le choix. Ensuite, il est sur votre disque, définitivement. Posez-lui une question, puis tapez /bye pour sortir.
Vérifiez que ça marche vraiment hors ligne
C'est l'étape que tout le monde saute, et c'est pourtant la seule qui prouve la promesse. Débranchez le câble réseau, coupez le Wi-Fi, puis relancez.
# Coupez le réseau, puis :
ollama run qwen3:4b
# Posez une question. La réponse arrive : rien n'est parti sur internet.
Réglez la mémoire et le contexte
Deux réglages évitent la quasi-totalité des ralentissements sur petite machine : la taille du contexte, et la durée pendant laquelle le modèle reste chargé en mémoire.
# Dans une session ollama : réduire le contexte à 2048 tokens
/set parameter num_ctx 2048
# Décharger le modèle dès la fin d'une requête (libère la RAM)
export OLLAMA_KEEP_ALIVE=0
# Voir ce qui est chargé et combien ça occupe
ollama ps
Un contexte large coûte de la mémoire en permanence, même quand vous ne l'utilisez pas. Sur une machine à 4 Go, c'est presque toujours le contexte, et non le modèle, qui déclenche le passage en swap et l'effondrement du débit.
La suite
- Comprendre pourquoi tel modèle tient ou ne tient pas : dimensionner sa RAM
- Choisir la bonne version d'un modèle : choisir sa quantification
- Ouvrir l'accès à plusieurs personnes : un serveur pour toute une classe
- Faire lire vos propres documents au modèle : RAG local