本文へ移動

この内容はまだフランス語です

ページ自体は翻訳済みですが、詳細な内容はまだです。機器の解説、ガイド、カタログはフランス語のまま表示されます。粗い機械翻訳よりも原文をお見せするほうがよいと考えました。 フランス語版を見る

Guide 1 sur 12

Votre première IA locale en 30 minutes

Partir d'une machine que vous avez déjà et obtenir un assistant qui répond sans connexion, en une demi-heure et sans rien casser.

Démarrer le pas à pas 6 étapes · 30 minutes · une étape à l'écran, avec Précédent / Suivant

Niveau Débutant
Durée 30 minutes
Étapes 6
Catégorie Installation
Avant de commencer
  • Une machine avec au moins 4 Go de RAM
  • Un accès administrateur (sudo) sur cette machine
  • Une connexion internet — pour cette installation uniquement
1

Regardez ce que vous avez déjà

Le premier réflexe n'est pas d'acheter du matériel, c'est de mesurer celui qui traîne. Sur Linux ou macOS, ces deux commandes suffisent à décider quel modèle vous pourrez faire tourner.

shell
# Mémoire vive disponible
free -h

# Architecture du processeur (aarch64 = ARM, x86_64 = Intel/AMD)
uname -m

# Nombre de cœurs
nproc

Sur Windows, ouvrez le Gestionnaire des tâches, onglet Performance : la mémoire installée et le nombre de cœurs y figurent.

RAM totaleCe que vous pouvez viserConfort attendu
2 GoModèle 0,5B à 1BRéponses courtes, utilisable
4 GoModèle 1B à 3BCorrect pour du quotidien
8 GoModèle 3B à 8BBon, c'est le palier recommandé
16 GoModèle 8B à 14BComparable à un service en ligne
2

Installez Ollama

Ollama télécharge, stocke et sert les modèles. C'est le chemin le plus court entre une machine vierge et une réponse à l'écran.

shell
# Linux et macOS
curl -fsSL https://ollama.com/install.sh | sh

# Vérification
ollama --version

Sous Windows, téléchargez l'installeur depuis ollama.com et lancez-le : le service démarre tout seul.

Un mot sur cette commandeFaire passer un script de téléchargement directement dans un interpréteur est pratique mais aveugle. Dans un contexte institutionnel, téléchargez d'abord le script, lisez-le, puis exécutez-le. C'est trente secondes de plus et une bonne habitude à transmettre.
3

Téléchargez votre premier modèle

Choisissez selon la RAM repérée à l'étape 1. En cas de doute, commencez petit : un modèle qui répond vite donne une bien meilleure première impression qu'un modèle brillant qui met deux minutes.

shell
# 4 Go de RAM et plus
ollama run llama3.2:1b

# 8 Go de RAM et plus (recommandé)
ollama run qwen3:4b

# 16 Go de RAM et plus
ollama run qwen3:8b

Le premier lancement télécharge le modèle — de 800 Mo à 5 Go selon le choix. Ensuite, il est sur votre disque, définitivement. Posez-lui une question, puis tapez /bye pour sortir.

4

Vérifiez que ça marche vraiment hors ligne

C'est l'étape que tout le monde saute, et c'est pourtant la seule qui prouve la promesse. Débranchez le câble réseau, coupez le Wi-Fi, puis relancez.

shell
# Coupez le réseau, puis :
ollama run qwen3:4b
# Posez une question. La réponse arrive : rien n'est parti sur internet.
La démonstration qui convaincEn salle, faites-le en mode avion sur un ordinateur portable. En une minute, l'idée que « l'IA a forcément besoin du cloud » tombe d'elle-même. C'est le cœur du message de SATI, et ça ne se raconte pas : ça se montre.
5

Réglez la mémoire et le contexte

Deux réglages évitent la quasi-totalité des ralentissements sur petite machine : la taille du contexte, et la durée pendant laquelle le modèle reste chargé en mémoire.

shell
# Dans une session ollama : réduire le contexte à 2048 tokens
/set parameter num_ctx 2048

# Décharger le modèle dès la fin d'une requête (libère la RAM)
export OLLAMA_KEEP_ALIVE=0

# Voir ce qui est chargé et combien ça occupe
ollama ps

Un contexte large coûte de la mémoire en permanence, même quand vous ne l'utilisez pas. Sur une machine à 4 Go, c'est presque toujours le contexte, et non le modèle, qui déclenche le passage en swap et l'effondrement du débit.

6

La suite

premier pas Ollama sans code