Raspberry Pi 5 · 8 Go
La référence du projet SATI : assez de RAM pour un modèle 3-4B utile, assez sobre pour tenir sur une batterie, assez répandu pour être remplacé partout.
Processeur
ARM Cortex-A76 · 4 cœurs · 2,4 GHz
Mémoire
8 Go LPDDR4X (modèle recommandé)
Consommation
5 à 9 W en charge
Prix indicatif
80 à 100 € (carte seule)
Accélérateur
Aucun — inférence CPU uniquement
Stockage
microSD A2 acceptable, SSD NVMe fortement conseillé
Débit indicatif
1B ≈ 12-18 tok/s · 3B ≈ 4-6 tok/s · 7-8B ≈ 1,5-2,5 tok/s
Ce qui tourne
- Assistant texte 1B à 4B quantifié en Q4_K_M
- Transcription vocale avec whisper.cpp (modèles base / small)
- Synthèse vocale Piper en temps réel
- Recherche documentaire RAG sur quelques milliers de pages
Les limites
- Au-delà de 7B le débit tombe sous le seuil du confortable
- Pas de génération d'images sérieuse
- Prévoir un dissipateur actif : sans refroidissement, la carte se bride
L'astuce qui change tout — Démarrez sur SSD NVMe via le connecteur PCIe : le chargement d'un modèle de 2 Go passe de ~40 s sur microSD à quelques secondes, et c'est ce qui change tout dans un usage de classe.
Raspberry Pi 4 · 4 Go
Le parc déjà installé dans beaucoup d'écoles et d'associations. Suffisant pour un assistant 1B et pour toute la chaîne voix, à condition de viser juste.
Processeur
ARM Cortex-A72 · 4 cœurs · 1,5 GHz
Mémoire
4 Go LPDDR4 (2 Go : trop juste)
Consommation
3 à 6 W en charge
Prix indicatif
45 à 60 € d'occasion
Accélérateur
Aucun
Stockage
microSD ou SSD en USB 3.0
Débit indicatif
0,5-1B ≈ 5-9 tok/s · 3B ≈ 1,5-2,5 tok/s
Ce qui tourne
- Assistant texte 0,5B à 1,5B en Q4_K_M
- Whisper.cpp modèle tiny ou base pour la dictée
- Piper pour la lecture à voix haute
- Classification et extraction avec un petit modèle spécialisé
Les limites
- 4 Go de RAM : un modèle 3B laisse très peu de marge au reste du système
- USB 3.0 au lieu du PCIe : chargement des modèles plus lent
- Écarter les versions 1 et 2 Go pour du LLM
L'astuce qui change tout — Sur 4 Go, réduisez la fenêtre de contexte à 2048 tokens : le cache d'attention est souvent ce qui fait basculer la machine dans le swap, pas le modèle lui-même.
Mini-PC Intel N100 · 16 Go
Le meilleur rapport confort / consommation / prix aujourd'hui pour un serveur d'IA locale de salle de classe ou de petite structure.
Processeur
Intel N100 · 4 cœurs Alder Lake-N · jusqu'à 3,4 GHz
Mémoire
16 Go DDR4/DDR5 (extensible sur la plupart des modèles)
Consommation
6 W au repos, 12 à 20 W en inférence
Prix indicatif
140 à 190 € avec boîtier, RAM et SSD
Accélérateur
iGPU Intel UHD — utilisable via Vulkan ou SYCL
Stockage
SSD NVMe inclus
Débit indicatif
1B ≈ 25-35 tok/s · 3B ≈ 10-15 tok/s · 8B ≈ 4-6 tok/s
Ce qui tourne
- Assistant 7-8B quantifié, utilisable à plusieurs en file d'attente
- Serveur Open WebUI pour une classe entière sur le réseau local
- RAG sur une base documentaire complète (dizaines de milliers de pages)
- Transcription whisper.cpp modèle small, quasi temps réel
Les limites
- Un seul canal mémoire sur beaucoup de modèles : c'est la bande passante qui plafonne, pas le CPU
- Génération d'images possible mais lente (plusieurs minutes par image)
- Vérifier que la RAM est en double barrette avant d'acheter
L'astuce qui change tout — Deux barrettes valent mieux qu'une seule de même capacité : le dual channel double la bande passante mémoire, et l'inférence de LLM sur CPU y est directement proportionnelle.
Portable recyclé · Core i5 · 8 Go
Un portable d'entreprise réformé de 2016-2020 est souvent la machine la moins chère du parc — et la plus capable. Écran, clavier et batterie inclus.
Processeur
Intel Core i5 4 à 8 cœurs (génération 6 à 10)
Mémoire
8 Go DDR4, à passer à 16 Go pour 20 à 30 €
Consommation
15 à 35 W en charge
Prix indicatif
0 € (don) à 150 € (reconditionné)
Accélérateur
iGPU Intel, parfois GPU dédié bas de gamme
Stockage
Remplacer le disque dur par un SSD si besoin
Débit indicatif
1B ≈ 20-30 tok/s · 3B ≈ 8-12 tok/s · 8B ≈ 3-5 tok/s
Ce qui tourne
- Toute la pile SATI en poste autonome, écran et micro compris
- Assistant 3B à 8B selon la RAM disponible
- Atelier de code assisté hors ligne
- Poste de démonstration transportable, avec sa propre batterie
Les limites
- Batteries souvent fatiguées : compter sur le secteur
- Ventilation encrassée = bridage thermique ; un dépoussiérage change les mesures
- Consommation 3 à 5 fois supérieure à une carte SBC
L'astuce qui change tout — Avant tout achat, faites le tour des services informatiques qui réforment leur parc : une association reçoit souvent des lots entiers de machines identiques, ce qui simplifie énormément le déploiement.
SBC RK3588 · Orange Pi 5 · Rock 5 · 16 Go
Plus de RAM et un NPU pour à peine plus cher qu'un Pi 5, au prix d'un écosystème logiciel nettement plus rugueux.
Processeur
Rockchip RK3588 · 4× Cortex-A76 + 4× A55
Mémoire
jusqu'à 16 ou 32 Go LPDDR4X/5
Consommation
5 à 12 W en charge
Prix indicatif
110 à 180 € selon la RAM
Accélérateur
NPU 6 TOPS (via RKNN, hors llama.cpp standard)
Stockage
eMMC + NVMe selon les cartes
Débit indicatif
3B ≈ 6-9 tok/s · 8B ≈ 2,5-4 tok/s en CPU pur
Ce qui tourne
- Assistant 7-8B grâce aux 16 Go, là où le Pi 5 plafonne
- Décodage vidéo matériel pour les usages multimédia
- Modèles de vision convertis en RKNN sur le NPU
Les limites
- Le NPU n'accélère pas les LLM via llama.cpp : il faut passer par la chaîne RKNN de Rockchip
- Noyaux constructeur : les mises à jour sont plus délicates que sur Raspberry Pi
- Documentation communautaire dispersée
L'astuce qui change tout — Réservez ces cartes aux profils qui aiment mettre les mains dans le système. Pour un déploiement à installer et oublier, le Pi 5 ou un mini-PC coûtent moins cher en temps de maintenance.
NVIDIA Jetson Orin Nano · 8 Go
Une vraie accélération CUDA dans une enveloppe de quelques watts. Le meilleur compromis débit / consommation, si le budget suit.
Processeur
6 cœurs ARM Cortex-A78AE + GPU Ampere 1024 cœurs
Mémoire
8 Go LPDDR5 partagée CPU/GPU
Consommation
7 à 25 W selon le profil choisi
Prix indicatif
250 à 400 € (kit développeur)
Accélérateur
GPU CUDA — llama.cpp compilé avec CUDA
Stockage
microSD + NVMe
Débit indicatif
3B ≈ 25-40 tok/s · 8B ≈ 12-20 tok/s
Ce qui tourne
- Assistant 8B fluide pour plusieurs utilisateurs
- Vision par ordinateur en temps réel
- Génération d'images en quelques dizaines de secondes
- Transcription whisper modèle medium
Les limites
- Mémoire partagée : 8 Go pour le système ET le modèle
- Pile logicielle JetPack spécifique, à ne pas mélanger avec un Ubuntu générique
- Prix par machine difficile à justifier pour un déploiement de masse
L'astuce qui change tout — Choisissez le profil de puissance en fonction de l'alimentation disponible : `sudo nvpmodel -m 1` limite la carte à un profil basse consommation, très utile en installation autonome ou solaire.
Poste avec GPU d'occasion · 8 Go de VRAM
Une carte graphique de gamer d'il y a cinq ans reste, à ce jour, le moyen le moins cher d'obtenir un vrai confort d'usage sur un modèle 8B.
Processeur
N'importe quel PC de bureau récent (le GPU fait le travail)
Mémoire
16 Go système + 8 Go de VRAM
Consommation
100 à 220 W en charge
Prix indicatif
150 à 250 € pour la carte seule d'occasion
Accélérateur
CUDA (NVIDIA) ou ROCm / Vulkan (AMD)
Stockage
SSD NVMe conseillé
Débit indicatif
3B ≈ 80-120 tok/s · 8B ≈ 35-60 tok/s
Ce qui tourne
- Assistant 8B à 14B quantifié, plusieurs sessions en parallèle
- Génération d'images en quelques secondes
- Serveur de la salle informatique complète
- Réglage fin (LoRA) de petits modèles
Les limites
- Consommation 20 à 40 fois supérieure à une carte SBC : à l'opposé de la logique frugale
- Encombrement, bruit, alimentation dédiée
- 8 Go de VRAM plafonnent vers 14B en Q4
L'astuce qui change tout — Gardez ce type de poste pour ce qu'il fait vraiment mieux : préparer les contenus, indexer une base documentaire, tester des modèles. Le déploiement final, lui, part sur du matériel sobre.
Téléphone Android recyclé · 4 à 8 Go
La machine que tout le monde a déjà dans un tiroir. Écran, batterie, micro et haut-parleur intégrés, pour une consommation de quelques watts.
Processeur
ARM 8 cœurs, milieu de gamme 2019 ou plus récent
Mémoire
4 à 8 Go partagée
Consommation
2 à 5 W
Prix indicatif
0 € (réemploi) à 80 €
Accélérateur
Non exploitable simplement — inférence CPU
Stockage
Mémoire interne du téléphone
Débit indicatif
1B ≈ 8-15 tok/s · 3B ≈ 3-5 tok/s
Ce qui tourne
- Assistant 1B à 3B via Termux et llama.cpp
- Applications Android dédiées à l'inférence locale
- Démonstration mobile de la souveraineté des données : mode avion activé
Les limites
- Bridage thermique rapide : le débit chute après quelques minutes
- Android tue les processus en arrière-plan sans prévenir
- Installation plus artisanale que sur une machine Linux
L'astuce qui change tout — C'est le support pédagogique le plus convaincant : mode avion, question posée, réponse obtenue. La démonstration que l'IA n'a pas besoin du cloud tient dans une main.