Comment fonctionne un RAG ?
Un LLM ne connaît que ce qu’il a vu pendant son entraînement. Il ne connaît ni vos procédures internes, ni vos contrats, ni le ticket ouvert ce matin. Le RAG (Retrieval-Augmented Generation) résout ce problème : au lieu de réentraîner le modèle, on lui fournit les bons extraits de documents au moment de la question.
Phase 1 — L’indexation (hors ligne)
Elle se fait une fois, puis à chaque mise à jour des documents.
- Documents : PDF, pages Confluence, tickets, e-mails… C’est la matière première.
- Découpage (chunking) : chaque document est coupé en morceaux de quelques centaines de tokens. Trop petits, ils perdent le contexte ; trop gros, ils noient l’information utile.
- Embedding : un modèle transforme chaque morceau en vecteur, une liste de nombres qui représente son sens. Deux textes qui parlent de la même chose auront des vecteurs proches.
- Base vectorielle : les vecteurs sont stockés avec le texte d’origine (pgvector, Qdrant, Vertex AI Vector Search…).
Phase 2 — La requête (en ligne)
- L’utilisateur pose sa question.
- La question est elle aussi transformée en vecteur, puis on recherche les morceaux les plus proches dans la base.
- La base renvoie les top-k extraits les plus pertinents (souvent 3 à 10).
- On construit un prompt augmenté : « Réponds à la question en t’appuyant uniquement sur ces extraits : … »
- Le LLM génère une réponse ancrée dans vos données, idéalement avec les sources citées.
Pourquoi tant de RAG déçoivent
D’expérience, la majorité des mauvaises réponses viennent de la recherche, pas du modèle :
- Ingestion bâclée : tableaux cassés par le parsing PDF, en-têtes répétés, documents obsolètes jamais supprimés.
- Recherche purement vectorielle : elle rate les noms propres, codes produits ou numéros de contrat. Une recherche hybride (vectorielle + mots-clés) et un reranker corrigent souvent l’essentiel.
- Pas de jeu d’évaluation : sans 50 questions de référence avec les réponses attendues, impossible de savoir si un changement améliore ou dégrade le système.
À retenir : un RAG, c’est 20 % de LLM et 80 % de qualité de données et de recherche.
Vous voulez mettre ça en production ?
Je suis AI Engineer freelance : j'aide les entreprises à concevoir et sécuriser leurs agents et systèmes RAG.
Discutons-en