Les logiciels qui font tourner tout ça. Tous libres ou gratuits, tous utilisables sans
compte et sans connexion une fois installés. Pour chacun : ce qu'il apporte, ce qu'il
coûte, et la réserve à connaître avant de bâtir un déploiement dessus.
Cette page est la plus technique du site. Si vous débutez, commencez plutôt par
le diagnostic ou
SATI Installer, qui choisissent
les outils à votre place.
Ollama
Le moyen le plus court entre une machine vierge et un modèle qui répond. Télécharge, quantifie, sert une API compatible OpenAI, gère la mémoire.
LicenceMIT
PlateformesLinux · macOS · Windows · ARM64
Une seule commande pour installer et lancer un modèle
API HTTP compatible OpenAI sur le port 11434
Décharge automatiquement le modèle après inactivité
Fichiers `Modelfile` pour figer un prompt système par usage
mise en place
curl -fsSL https://ollama.com/install.sh | sh
ollama run qwen3:4b
La réserve — Masque les réglages fins de llama.cpp. Sur une machine très contrainte, la compilation manuelle donne de meilleurs résultats.
llama.cpp
Le moteur d'inférence qui a rendu l'IA locale possible sur du petit matériel. C'est lui qui tourne sous la plupart des autres outils, Ollama compris.
LicenceMIT
PlateformesTout ce qui compile du C++ : x86, ARM, RISC-V, Android
Compilé pour votre processeur exactement : les gains sont réels
Contrôle total sur le contexte, les threads, le déchargement GPU
`llama-bench` pour mesurer avant de décider
Serveur HTTP intégré avec une interface web minimale
La réserve — Consomme quelques centaines de mégaoctets de RAM. Sur un Pi 5 partagé avec le modèle, la marge devient mince.
LM Studio
L'application de bureau qui permet de découvrir, télécharger et tester des modèles sans toucher au terminal. Idéale pour la première séance de découverte.
LicenceGratuit, propriétaire
PlateformesWindows · macOS · Linux (x86)
Catalogue de modèles avec les tailles et la compatibilité affichées
Aucune ligne de commande
Serveur local compatible OpenAI en un clic
mise en place
# Téléchargement de l'installeur depuis lmstudio.ai# Aucune commande : tout se fait dans l'interface
La réserve — Logiciel propriétaire : à réserver à la découverte et à la maquette, pas au déploiement d'un dispositif souverain.
whisper.cpp
La reconnaissance vocale de Whisper, réécrite en C++ pour tourner sur du petit matériel, sans Python et sans réseau.
LicenceMIT
PlateformesLinux · macOS · Windows · ARM · Android
Transcription hors ligne en français, y compris sur Raspberry Pi
Modèles de 75 Mo à 3 Go selon la précision voulue
Sortie en texte, SRT ou VTT pour le sous-titrage
Mode flux pour la dictée en direct
mise en place
git clone https://github.com/ggml-org/whisper.cpp && cd whisper.cpp
sh ./models/download-ggml-model.sh small
cmake -B build && cmake --build build -j$(nproc)
La réserve — La qualité dépend fortement du micro et du bruit ambiant. Prévoyez un micro correct avant d'incriminer le modèle.
Piper
Synthèse vocale locale, rapide et naturelle, avec plusieurs voix françaises. Quelques dizaines de mégaoctets par voix.
LicenceMIT
PlateformesLinux · Windows · ARM
Plus rapide que le temps réel, même sur Raspberry Pi 4
Voix françaises de qualité correcte
S'enchaîne facilement avec un LLM pour une borne vocale complète
mise en place
echo 'Bonjour, je fonctionne sans connexion.' \
| piper -m fr_FR-siwis-medium.onnx -f sortie.wav
La réserve — Prosodie moins expressive que les services en ligne : parfaitement audible, mais on entend que c'est une machine.
AnythingLLM
Une base documentaire interrogeable en langage naturel, montée en quelques minutes, entièrement locale : documents, index et modèle restent sur la machine.
LicenceMIT
PlateformesApplication de bureau ou Docker
Import de PDF, Word, pages web, dossiers entiers
Base vectorielle embarquée, aucun service externe
Espaces de travail séparés par classe ou par sujet
mise en place
# Application de bureau : téléchargement depuis anythingllm.com# Docker : docker run -p 3001:3001 mintplexlabs/anythingllm
La réserve — L'indexation d'un gros corpus est longue sur carte SBC : préparez l'index sur une machine plus puissante puis copiez-le.
sqlite-vec
Une extension SQLite qui ajoute la recherche vectorielle. Votre base documentaire tient dans un seul fichier, copiable, sauvegardable, versionnable.
LicenceApache 2.0 / MIT
PlateformesPartout où SQLite tourne
Aucun serveur à administrer : un fichier `.db` et c'est tout
Se sauvegarde et se duplique par simple copie
Empreinte mémoire négligeable, adaptée aux cartes SBC
mise en place
pip install sqlite-vec
# puis, en SQL : SELECT rowid, distance FROM chunks# WHERE embedding MATCH ? ORDER BY distance LIMIT 5;
La réserve — Pour des millions de vecteurs, une base dédiée reste plus rapide. En dessous, la simplicité gagne.
llama-bench
L'outil de mesure officiel : débit de traitement du prompt et de génération, pour un modèle et une machine donnés. À lancer avant toute décision d'achat.
LicenceMIT
PlateformesFourni avec llama.cpp
Chiffres reproductibles au lieu d'impressions
Compare plusieurs quantifications sur la même machine
La réserve — Certains dépôts exigent d'accepter une licence avec un compte : à faire une fois, sur la machine qui prépare les modèles.
Aucun outil ne correspond
Essayez un autre mot-clé, ou retirez le filtre de catégorie.
Que choisir, selon la situation
Votre situation
La pile conseillée
Je découvre, sur mon poste
LM Studio, ou Ollama en ligne de commande
Je veux un poste autonome pour une personne
Ollama + Open WebUI en local
J'équipe une salle de classe
Ollama + Open WebUI sur un mini-PC
Je dois interroger un corpus de documents
AnythingLLM, ou sqlite-vec pour maîtriser la chaîne
Je vise le maximum de débit sur une machine contrainte
llama.cpp compilé + llama-bench
Je distribue sur des postes sans réseau
llamafile sur clé USB
Je monte une borne vocale
whisper.cpp + Ollama + Piper
Je dois documenter la consommation
Wattmètre de prise + llama-bench
Une pile, pas une collection
Ces outils s'assemblent : Ollama et llama.cpp exposent la même API compatible OpenAI,
ce qui permet de changer de moteur sans toucher à l'interface. Choisissez d'abord ce que
voient les utilisateurs, le moteur se remplace ensuite sans douleur.