Ir para o conteúdo

Este conteúdo ainda está em francês

A página está traduzida, mas o conteúdo detalhado ainda não. As fichas, os guias e os catálogos continuam em francês: preferimos mostrar-lhe o original a uma tradução automática aproximada. Ver o site em francês

Avant de commencer
  • Ollama fonctionnel avec un modèle de génération
  • Python 3.10 ou plus récent
  • Un dossier de documents en texte, Markdown ou PDF converti

Ce que fait réellement un RAG

Le modèle ne connaît pas vos documents et on ne va pas le réentraîner. On procède autrement : on découpe le corpus en passages, on les indexe, et à chaque question on retrouve les passages pertinents pour les coller dans le prompt. Le modèle répond alors sur pièces.

  1. Découper les documents en passages de quelques centaines de mots.
  2. Vectoriser chaque passage avec un modèle d'embedding.
  3. Stocker les vecteurs dans une base interrogeable.
  4. Chercher les passages les plus proches de la question.
  5. Générer la réponse à partir de ces passages, en citant les sources.
Pourquoi ça tient sur petite machineL'indexation est le seul moment coûteux, et elle se fait une fois. Ensuite, chaque question ne coûte qu'une vectorisation — quelques millisecondes — et une génération normale.