Skip to content

This content is still in French

The page itself is translated, but its detailed content is not yet. Hardware sheets, guides and catalogues are still shown in French: we would rather give you the original than a rough machine translation. View the French site

12 outils

La boîte à outils

Les logiciels qui font tourner tout ça. Tous libres ou gratuits, tous utilisables sans compte et sans connexion une fois installés. Pour chacun : ce qu'il apporte, ce qu'il coûte, et la réserve à connaître avant de bâtir un déploiement dessus.

Cette page est la plus technique du site. Si vous débutez, commencez plutôt par le diagnostic ou SATI Installer, qui choisissent les outils à votre place.

Ollama

Le moyen le plus court entre une machine vierge et un modèle qui répond. Télécharge, quantifie, sert une API compatible OpenAI, gère la mémoire.

Licence MIT
Plateformes Linux · macOS · Windows · ARM64
  • Une seule commande pour installer et lancer un modèle
  • API HTTP compatible OpenAI sur le port 11434
  • Décharge automatiquement le modèle après inactivité
  • Fichiers `Modelfile` pour figer un prompt système par usage
mise en place
curl -fsSL https://ollama.com/install.sh | sh
ollama run qwen3:4b

La réserve — Masque les réglages fins de llama.cpp. Sur une machine très contrainte, la compilation manuelle donne de meilleurs résultats.

llama.cpp

Le moteur d'inférence qui a rendu l'IA locale possible sur du petit matériel. C'est lui qui tourne sous la plupart des autres outils, Ollama compris.

Licence MIT
Plateformes Tout ce qui compile du C++ : x86, ARM, RISC-V, Android
  • Compilé pour votre processeur exactement : les gains sont réels
  • Contrôle total sur le contexte, les threads, le déchargement GPU
  • `llama-bench` pour mesurer avant de décider
  • Serveur HTTP intégré avec une interface web minimale
mise en place
git clone https://github.com/ggml-org/llama.cpp
cmake -B build -DCMAKE_BUILD_TYPE=Release
cmake --build build -j$(nproc)

La réserve — Il faut compiler, choisir sa quantification et gérer ses fichiers GGUF à la main. Prévoyez une première séance d'apprentissage.

llamafile

Un modèle et son moteur dans un seul fichier exécutable, sans installation. La façon la plus simple de distribuer une IA hors ligne sur une clé USB.

Licence Apache 2.0
Plateformes Un même fichier tourne sur Linux, macOS, Windows, BSD
  • Zéro installation, zéro dépendance, zéro droits administrateur
  • Se distribue sur clé USB dans un établissement sans réseau
  • Ouvre une interface web locale au lancement
mise en place
chmod +x modele.llamafile
./modele.llamafile

La réserve — Fichiers volumineux et mises à jour manuelles. Attention à la limite de 4 Go des clés formatées en FAT32.

Open WebUI

L'interface de conversation qui transforme un serveur Ollama en service utilisable par toute une classe : comptes, historiques, documents, droits.

Licence BSD-3 modifiée
Plateformes Docker ou Python, sur toute machine du réseau local
  • Comptes utilisateurs et rôles : un enseignant, des élèves
  • Import de documents et interrogation façon RAG intégrée
  • Historique des conversations conservé sur votre machine
  • Fonctionne entièrement sur le réseau local
mise en place
docker run -d -p 3000:8080 --add-host=host.docker.internal:host-gateway \
  -v open-webui:/app/backend/data --name open-webui \
  ghcr.io/open-webui/open-webui:main

La réserve — Consomme quelques centaines de mégaoctets de RAM. Sur un Pi 5 partagé avec le modèle, la marge devient mince.

LM Studio

L'application de bureau qui permet de découvrir, télécharger et tester des modèles sans toucher au terminal. Idéale pour la première séance de découverte.

Licence Gratuit, propriétaire
Plateformes Windows · macOS · Linux (x86)
  • Catalogue de modèles avec les tailles et la compatibilité affichées
  • Aucune ligne de commande
  • Serveur local compatible OpenAI en un clic
mise en place
# Téléchargement de l'installeur depuis lmstudio.ai
# Aucune commande : tout se fait dans l'interface

La réserve — Logiciel propriétaire : à réserver à la découverte et à la maquette, pas au déploiement d'un dispositif souverain.

whisper.cpp

La reconnaissance vocale de Whisper, réécrite en C++ pour tourner sur du petit matériel, sans Python et sans réseau.

Licence MIT
Plateformes Linux · macOS · Windows · ARM · Android
  • Transcription hors ligne en français, y compris sur Raspberry Pi
  • Modèles de 75 Mo à 3 Go selon la précision voulue
  • Sortie en texte, SRT ou VTT pour le sous-titrage
  • Mode flux pour la dictée en direct
mise en place
git clone https://github.com/ggml-org/whisper.cpp && cd whisper.cpp
sh ./models/download-ggml-model.sh small
cmake -B build && cmake --build build -j$(nproc)

La réserve — La qualité dépend fortement du micro et du bruit ambiant. Prévoyez un micro correct avant d'incriminer le modèle.

Piper

Synthèse vocale locale, rapide et naturelle, avec plusieurs voix françaises. Quelques dizaines de mégaoctets par voix.

Licence MIT
Plateformes Linux · Windows · ARM
  • Plus rapide que le temps réel, même sur Raspberry Pi 4
  • Voix françaises de qualité correcte
  • S'enchaîne facilement avec un LLM pour une borne vocale complète
mise en place
echo 'Bonjour, je fonctionne sans connexion.' \
  | piper -m fr_FR-siwis-medium.onnx -f sortie.wav

La réserve — Prosodie moins expressive que les services en ligne : parfaitement audible, mais on entend que c'est une machine.

AnythingLLM

Une base documentaire interrogeable en langage naturel, montée en quelques minutes, entièrement locale : documents, index et modèle restent sur la machine.

Licence MIT
Plateformes Application de bureau ou Docker
  • Import de PDF, Word, pages web, dossiers entiers
  • Base vectorielle embarquée, aucun service externe
  • Espaces de travail séparés par classe ou par sujet
mise en place
# Application de bureau : téléchargement depuis anythingllm.com
# Docker : docker run -p 3001:3001 mintplexlabs/anythingllm

La réserve — L'indexation d'un gros corpus est longue sur carte SBC : préparez l'index sur une machine plus puissante puis copiez-le.

sqlite-vec

Une extension SQLite qui ajoute la recherche vectorielle. Votre base documentaire tient dans un seul fichier, copiable, sauvegardable, versionnable.

Licence Apache 2.0 / MIT
Plateformes Partout où SQLite tourne
  • Aucun serveur à administrer : un fichier `.db` et c'est tout
  • Se sauvegarde et se duplique par simple copie
  • Empreinte mémoire négligeable, adaptée aux cartes SBC
mise en place
pip install sqlite-vec
# puis, en SQL : SELECT rowid, distance FROM chunks
#   WHERE embedding MATCH ? ORDER BY distance LIMIT 5;

La réserve — Pour des millions de vecteurs, une base dédiée reste plus rapide. En dessous, la simplicité gagne.

llama-bench

L'outil de mesure officiel : débit de traitement du prompt et de génération, pour un modèle et une machine donnés. À lancer avant toute décision d'achat.

Licence MIT
Plateformes Fourni avec llama.cpp
  • Chiffres reproductibles au lieu d'impressions
  • Compare plusieurs quantifications sur la même machine
  • Montre l'effet réel du nombre de threads
mise en place
./build/bin/llama-bench -m modele-Q4_K_M.gguf -t 4

La réserve — Mesure le moteur, pas la qualité des réponses. Les deux se décident séparément.

PowerTOP & wattmètre

Le contrôle de la promesse énergétique : sans mesure à la prise, l'argument des watts économisés reste une affirmation.

Licence GPL-2.0
Plateformes Linux (x86 surtout)
  • Identifie ce qui empêche la machine de se mettre en veille
  • Un wattmètre à 15 € donne le chiffre qui compte vraiment
  • Permet de documenter honnêtement son déploiement
mise en place
sudo apt install powertop
sudo powertop --auto-tune

La réserve — PowerTOP est peu utile sur ARM : là, seul le wattmètre à la prise fait foi.

Hugging Face CLI

Pour récupérer un fichier GGUF précis, reprendre un téléchargement interrompu et constituer un miroir local de modèles à distribuer hors ligne.

Licence Apache 2.0
Plateformes Python, partout
  • Téléchargement d'un seul fichier au lieu du dépôt entier
  • Reprise après coupure : précieux en connexion instable
  • Permet de constituer un stock de modèles à diffuser sur clé USB
mise en place
pip install -U "huggingface_hub[cli]"
hf download unsloth/Qwen3-4B-GGUF Qwen3-4B-Q4_K_M.gguf --local-dir ./modeles

La réserve — Certains dépôts exigent d'accepter une licence avec un compte : à faire une fois, sur la machine qui prépare les modèles.

Que choisir, selon la situation

Votre situationLa pile conseillée
Je découvre, sur mon posteLM Studio, ou Ollama en ligne de commande
Je veux un poste autonome pour une personneOllama + Open WebUI en local
J'équipe une salle de classeOllama + Open WebUI sur un mini-PC
Je dois interroger un corpus de documentsAnythingLLM, ou sqlite-vec pour maîtriser la chaîne
Je vise le maximum de débit sur une machine contraintellama.cpp compilé + llama-bench
Je distribue sur des postes sans réseaullamafile sur clé USB
Je monte une borne vocalewhisper.cpp + Ollama + Piper
Je dois documenter la consommationWattmètre de prise + llama-bench
Une pile, pas une collection Ces outils s'assemblent : Ollama et llama.cpp exposent la même API compatible OpenAI, ce qui permet de changer de moteur sans toucher à l'interface. Choisissez d'abord ce que voient les utilisateurs, le moteur se remplace ensuite sans douleur.