Skip to content

This content is still in French

The page itself is translated, but its detailed content is not yet. Hardware sheets, guides and catalogues are still shown in French: we would rather give you the original than a rough machine translation. View the French site

Avant de commencer
  • Ollama fonctionnel avec un modèle de génération
  • Python 3.10 ou plus récent
  • Un dossier de documents en texte, Markdown ou PDF converti

Ce que fait réellement un RAG

Le modèle ne connaît pas vos documents et on ne va pas le réentraîner. On procède autrement : on découpe le corpus en passages, on les indexe, et à chaque question on retrouve les passages pertinents pour les coller dans le prompt. Le modèle répond alors sur pièces.

  1. Découper les documents en passages de quelques centaines de mots.
  2. Vectoriser chaque passage avec un modèle d'embedding.
  3. Stocker les vecteurs dans une base interrogeable.
  4. Chercher les passages les plus proches de la question.
  5. Générer la réponse à partir de ces passages, en citant les sources.
Pourquoi ça tient sur petite machineL'indexation est le seul moment coûteux, et elle se fait une fois. Ensuite, chaque question ne coûte qu'une vectorisation — quelques millisecondes — et une génération normale.