Guide 4 sur 12
Installer Ollama sur un Raspberry Pi 5
L'installation de référence du projet : préparation du système, choix du stockage, service accessible sur le réseau local, et les réglages qui évitent le bridage thermique.
Démarrer le pas à pas 7 étapes · 1 heure · une étape à l'écran, avec Précédent / Suivant
- Un Raspberry Pi 5 (8 Go recommandé) avec son alimentation officielle
- Un SSD NVMe sur adaptateur PCIe, ou à défaut une microSD A2
- Un dissipateur actif — ce n'est pas optionnel
- Un accès SSH ou un clavier et un écran
Préparer le système
Installez Raspberry Pi OS Lite 64 bits avec Raspberry Pi Imager. La version Lite, sans bureau graphique, libère environ un gigaoctet de RAM — ce qui, sur cette machine, se traduit directement en taille de modèle utilisable.
uname -m : la réponse doit être aarch64.sudo apt update && sudo apt full-upgrade -y
sudo apt install -y curl htop
# Contrôles de base
uname -m # attendu : aarch64
free -h # attendu : ~8 Go
vcgencmd measure_temp
Démarrer sur SSD
C'est le seul changement matériel qui transforme réellement l'expérience. Charger un modèle de 2,5 Go depuis une microSD prend une trentaine de secondes ; depuis un NVMe, quelques secondes.
# Activer le PCIe et sa deuxième génération
sudo rpi-eeprom-config --edit
# ajouter : PCIE_PROBE=1
# Dans /boot/firmware/config.txt
dtparam=pciex1
dtparam=pciex1_gen=3
sudo reboot
Copiez ensuite le système sur le SSD avec l'outil SD Card Copier de Raspberry Pi OS, ou clonez la partition, puis changez l'ordre de démarrage dans l'EEPROM.
Installer Ollama
curl -fsSL https://ollama.com/install.sh | sh
# Le service démarre automatiquement
systemctl status ollama
ollama --version
L'installeur détecte l'architecture ARM64 et pose le binaire adapté. Aucune compilation n'est nécessaire.
Choisir le modèle
Sur un Pi 5 8 Go sans interface graphique, le point d'équilibre se situe autour de 3 à 4 milliards de paramètres.
# Recommandé : bon français, licence Apache 2.0
ollama run qwen3:4b
# Plus rapide, pour un usage question-réponse court
ollama run llama3.2:3b
# Sur un Pi 4 en 4 Go, rester ici
ollama run llama3.2:1b
| Modèle | Poids | Débit indicatif sur Pi 5 | Ressenti |
|---|---|---|---|
| Llama 3.2 1B | 0,8 Go | 12 à 18 tok/s | Instantané |
| Llama 3.2 3B | 2,0 Go | 5 à 7 tok/s | Confortable |
| Qwen3 4B | 2,5 Go | 4 à 6 tok/s | Vitesse de lecture |
| Qwen3 8B | 4,7 Go | 1,5 à 2,5 tok/s | Trop lent en interactif |
Ces valeurs sont des ordres de grandeur : mesurez les vôtres, la méthode est dans le guide Mesurer avant d'optimiser.
Ouvrir le service sur le réseau local
Par défaut, Ollama n'écoute que sur la machine elle-même. Pour que les postes de la salle y accèdent, il faut le faire écouter sur le réseau local — et seulement sur le réseau local.
sudo systemctl edit ollama
[Service]
Environment="OLLAMA_HOST=0.0.0.0:11434"
Environment="OLLAMA_KEEP_ALIVE=10m"
Environment="OLLAMA_NUM_PARALLEL=1"
sudo systemctl daemon-reload
sudo systemctl restart ollama
# Depuis un autre poste du réseau
curl http://IP-DU-PI:11434/api/tags
Thermique et mémoire
Un Pi 5 sans refroidissement actif se bride au bout de quelques minutes de génération continue, et le débit chute d'un tiers. Le dissipateur officiel suffit.
# Surveiller pendant une génération longue
watch -n 2 'vcgencmd measure_temp; vcgencmd get_throttled'
# 0x0 = aucun bridage. Toute autre valeur = problème thermique ou d'alimentation.
Côté mémoire, activez zram plutôt qu'un fichier d'échange sur disque : la compression en RAM absorbe les pics sans détruire le SSD.
sudo apt install -y zram-tools
echo -e 'ALGO=zstd\nPERCENT=50' | sudo tee -a /etc/default/zramswap
sudo systemctl restart zramswap
Vérification finale
systemctl status ollamaindique active (running).ollama psmontre le modèle chargé et sa taille en mémoire.- Une requête depuis un autre poste du réseau reçoit une réponse.
- Câble réseau débranché, la génération fonctionne toujours.
vcgencmd get_throttledrenvoie0x0après cinq minutes de charge.
← Guide précédent
Choisir sa quantification GGUF
Q4_K_M, Q5_K_S, IQ3_XXS : ce que signifient ces suffixes, ce qu'ils coûtent en qualité, et la règle simple qui évite d'y passer une soirée.
Guide suivant →
Compiler llama.cpp pour tirer le maximum du processeur
Quand Ollama ne suffit plus : compiler le moteur pour votre processeur exact, régler les threads, et récupérer les 20 à 40 % de débit que laisse un binaire générique.