Ir al contenido

Este contenido sigue en francés

La página está traducida, pero su contenido detallado todavía no. Las fichas, las guías y los catálogos se muestran en francés: preferimos darte el original antes que una traducción automática aproximada. Ver el sitio en francés

Avant de commencer
  • Ollama fonctionnel avec un modèle de génération
  • Python 3.10 ou plus récent
  • Un dossier de documents en texte, Markdown ou PDF converti

Ce que fait réellement un RAG

Le modèle ne connaît pas vos documents et on ne va pas le réentraîner. On procède autrement : on découpe le corpus en passages, on les indexe, et à chaque question on retrouve les passages pertinents pour les coller dans le prompt. Le modèle répond alors sur pièces.

  1. Découper les documents en passages de quelques centaines de mots.
  2. Vectoriser chaque passage avec un modèle d'embedding.
  3. Stocker les vecteurs dans une base interrogeable.
  4. Chercher les passages les plus proches de la question.
  5. Générer la réponse à partir de ces passages, en citant les sources.
Pourquoi ça tient sur petite machineL'indexation est le seul moment coûteux, et elle se fait une fois. Ensuite, chaque question ne coûte qu'une vectorisation — quelques millisecondes — et une génération normale.