Partir d'une machine que vous avez déjà et obtenir un assistant qui répond sans connexion, en une demi-heure et sans rien casser.
- Regardez ce que vous avez déjà
- Installez Ollama
- Téléchargez votre premier modèle
- et 3 autres étapes
Le calcul complet — poids du modèle, cache d'attention, part du système — pour savoir avant de télécharger si ça va tenir, et quoi faire quand ça ne tient pas.
- Le poids du modèle
- Le cache d'attention, le coût qu'on oublie
- La part du système
- et 3 autres étapes
Q4_K_M, Q5_K_S, IQ3_XXS : ce que signifient ces suffixes, ce qu'ils coûtent en qualité, et la règle simple qui évite d'y passer une soirée.
- Ce que la quantification fait vraiment
- Lire les suffixes
- Le tableau de décision
- et 4 autres étapes
L'installation de référence du projet : préparation du système, choix du stockage, service accessible sur le réseau local, et les réglages qui évitent le bridage thermique.
- Préparer le système
- Démarrer sur SSD
- Installer Ollama
- et 4 autres étapes
Quand Ollama ne suffit plus : compiler le moteur pour votre processeur exact, régler les threads, et récupérer les 20 à 40 % de débit que laisse un binaire générique.
- Pourquoi compiler
- Installer les dépendances
- Compiler
- et 4 autres étapes
Une machine, trente navigateurs, aucune connexion internet : monter le service partagé, gérer les comptes et dimensionner la file d'attente sans acheter de matériel.
- L'architecture visée
- Préparer le moteur
- Installer l'interface
- et 4 autres étapes
Indexer un corpus — cours, archives, documentation d'une collectivité — dans un simple fichier SQLite, et le rendre interrogeable en langage naturel sans qu'un octet ne sorte de la machine.
- Ce que fait réellement un RAG
- Préparer l'environnement
- Découper le corpus
- et 3 autres étapes
La chaîne vocale complète — micro, transcription, modèle, synthèse — sur une machine à quelques watts. C'est ce qui rend l'outil accessible à ceux qui ne lisent pas encore, ou plus.
- La chaîne complète
- Installer whisper.cpp
- Transcrire
- et 3 autres étapes
Trois chiffres suffisent à piloter un déploiement : traitement du prompt, vitesse de génération, watts à la prise. Voici comment les obtenir et ce qu'ils changent.
- Les trois chiffres
- Mesurer avec llama-bench
- Le nombre de threads
- et 3 autres étapes
Une machine qu'on branche et qui marche : démarrage direct sur l'interface, système qui encaisse les coupures de courant, aucune donnée personnelle conservée, image duplicable sur tout un parc.
- Le cahier des charges
- Préparer le système
- Le moteur en service
- et 4 autres étapes
Un ordinateur réformé, une distribution légère, deux heures de travail : le poste le moins cher du parc est souvent celui qui existe déjà.
- Trier le matériel
- Installer un système léger
- Installer la pile SATI
- et 3 autres étapes
Un fichier de quinze lignes suffit à transformer un modèle généraliste en assistant de mathématiques de sixième, en correcteur bienveillant ou en guide d'un service public.
- Réentraîner coûte cher, cadrer ne coûte rien
- Écrire un Modelfile
- Les réglages qui comptent
- et 3 autres étapes