Mehdi ChallakhFreelance IA Réserver un appel
Guide · 12 min de lecture · mis à jour le 9 septembre 2026

RAG : c'est quoi, et comment ça améliore les IA génératives ?

Le RAG (retrieval-augmented generation, recherche augmentée par génération) est la technique qui permet à une IA générative de répondre à partir de vos documents, avec les sources citées, au lieu de deviner. Ce guide explique le principe, les étapes, ce qui fait la différence entre un prototype qui déçoit et un système qui tient en production, et ce que cela coûte.

L'essentiel
  • Le RAG fait chercher au modèle de langage les passages pertinents dans vos documents avant de rédiger sa réponse, ce qui supprime l'essentiel des réponses inventées et permet de citer les sources.
  • Un système RAG enchaîne sept étapes : ingestion, découpage, embeddings, base vectorielle, recherche, génération, citations ; la qualité se joue surtout dans les quatre premières.
  • Chez Delibia, le travail sur la recherche a fait passer le Top@10 de 53 % à 93 % et les réponses satisfaisantes de 26 % à 98 %, chaque étape étant mesurée sur un jeu de test.
  • Un RAG d'entreprise coûte de l'ordre de 8 000 à 40 000 € de mise en place, livré en 4 à 10 semaines, et peut être hébergé entièrement en France.
  • Le fine-tuning ne remplace pas le RAG : il change le comportement du modèle, le RAG lui apporte les faits.

RAG : définition en français

RAG signifie retrieval-augmented generation, traduit par recherche augmentée par génération, ou génération augmentée par la recherche. L'idée tient en une phrase : avant de répondre, le modèle de langage (large language model, LLM) va chercher les passages pertinents dans vos documents, puis rédige sa réponse à partir de ces passages, en les citant.

Sans RAG, un modèle comme ChatGPT, Claude ou Mistral répond à partir de ce qu'il a appris pendant son entraînement, c'est-à-dire des textes publics, figés à une date donnée. Il ne connaît ni vos contrats, ni vos procédures, ni vos comptes rendus. Avec RAG, le modèle reçoit à chaque question les extraits utiles de votre base documentaire et s'en sert comme d'un dossier ouvert devant lui.

La définition courte pour un dirigeant : un RAG d'entreprise, c'est un moteur de recherche interne dont les résultats sont lus et synthétisés par une IA, avec les sources affichées. C'est le socle d'un assistant IA documentaire, et c'est aussi ce qui fait tourner la plupart des chatbots d'entreprise sérieux.

Pourquoi ChatGPT seul ne suffit pas sur les documents d'entreprise

  • Le modèle ne connaît pas vos données. Une question sur la clause de révision des prix du contrat cadre 2024 ou sur la procédure de remboursement en vigueur obtient une réponse plausible, rédigée avec assurance, et fausse. On parle d'hallucination : le modèle comble le vide avec ce qui ressemble le plus à une réponse.
  • La fenêtre de contexte a une taille limitée. Déposer quelques PDF dans ChatGPT fonctionne pour un usage ponctuel. Une base de 10 000 documents, des mises à jour hebdomadaires et des droits d'accès différents selon les équipes ne tiennent dans aucune fenêtre de conversation.
  • Rien n'est vérifiable ni gouverné. Sans citation de la source, l'utilisateur ne peut pas contrôler la réponse. Sans droits d'accès, un stagiaire lit les mêmes documents que la direction financière. Sans journalisation, personne ne sait quelles données ont été envoyées à quel prestataire, ce que détaille le guide ChatGPT en entreprise et confidentialité.

Le RAG répond à ces trois limites : il fournit au modèle les bons extraits, il gère le volume grâce à une base de recherche séparée, et il permet de citer, de filtrer et de journaliser. Voilà comment la RAG améliore les résultats des IA génératives : elle ancre la réponse dans des textes réels.

Les 7 étapes d'un système RAG

  1. Ingestion. Les documents sont collectés depuis leurs sources (SharePoint, Google Drive, GED, messagerie, base métier) et convertis en texte. Les PDF scannés passent par une reconnaissance de caractères (OCR). C'est l'étape la plus sous-estimée : un tableau mal extrait ou un en-tête répété à chaque page dégrade tout ce qui suit.
  2. Découpage (chunking). Chaque document est découpé en passages de quelques centaines de mots, en respectant sa structure (titres, articles, paragraphes).
  3. Embeddings. Chaque passage est transformé en vecteur numérique par un modèle d'embedding (plongement). Deux passages qui parlent de la même chose ont des vecteurs proches, même s'ils n'utilisent pas les mêmes mots. Le choix de ce modèle pèse lourd sur la qualité, en particulier en français.
  4. Base vectorielle. Les vecteurs sont stockés dans une base conçue pour la recherche par similarité : Qdrant, Milvus, pgvector dans PostgreSQL. La base conserve aussi les métadonnées : date, auteur, service, droits d'accès.
  5. Retrieval (recherche). À chaque question, le système calcule le vecteur de la question et retrouve les passages les plus proches, souvent combinés avec une recherche par mots-clés (recherche hybride) et un reclassement (reranking) pour ne garder que les meilleurs.
  6. Génération. Les passages retenus sont insérés dans l'invite (prompt) envoyée au modèle de langage, avec la consigne de répondre uniquement à partir de ces extraits et de dire quand l'information manque.
  7. Citations. La réponse affiche ses sources : nom du document, page ou article, lien vers l'original. C'est ce qui permet de vérifier en dix secondes.

Les frameworks LangChain et LlamaIndex fournissent des briques pour chaque étape (« langchain rag » est d'ailleurs l'une des recherches les plus fréquentes sur le sujet). n8n permet de monter un premier RAG sans code (n8n rag), et Ollama de faire tourner le modèle en local sur un poste (ollama rag).

Vous avez un cas concret en tête ?

Vingt minutes suffisent pour savoir si c'est faisable et par où commencer.

Réserver un appel de 20 minutes

Ce qui fait la qualité d'un RAG : l'exemple Delibia

Un RAG se juge sur deux questions. La recherche retrouve-t-elle les bons passages ? La génération en fait-elle une réponse juste et utile ? Si la première échoue, la seconde ne peut rien rattraper : le modèle rédige avec brio à partir des mauvais extraits.

Chez Delibia (govtech, 1 200 collectivités), le système RAG porte sur 2,7 millions de délibérations. Au départ, la bonne délibération figurait dans les dix premiers résultats (Top@10) dans 53 % des cas, et 26 % des réponses étaient jugées satisfaisantes. Après le travail sur l'ingestion, le découpage, le modèle d'embedding et la recherche hybride, le Top@10 est passé à 93 % et les réponses satisfaisantes à 98 %. La latence est passée de 15 s à 4,3 s, et le modèle d'embedding entraîné pour ce corpus est 4 fois plus léger que bge-m3 pour 95 % de sa qualité en top-100.

Ce que cet exemple montre :

  • la qualité de la recherche est le premier levier, avant le choix du modèle de génération ;
  • le modèle d'embedding se choisit, et parfois s'entraîne, sur le corpus réel, en français ;
  • chaque amélioration a été mesurée sur un jeu de test avant d'être déployée, ce qui a permis de ne garder que ce qui marchait ;
  • la latence fait partie de la qualité : une réponse juste au bout de 15 s est abandonnée par l'utilisateur.

Comment évaluer un RAG : jeu de test et modèle juge

Un RAG sans évaluation se règle au ressenti, et le ressenti change à chaque démonstration. La méthode que j'applique sur chaque projet tient en trois éléments.

Un jeu de test construit avec les métiers

Entre 50 et 200 questions réelles, posées par les personnes qui utiliseront l'outil, avec pour chacune le ou les documents qui contiennent la réponse et, si possible, la réponse attendue. Il se construit en quelques heures d'atelier.

Des métriques de recherche

Pour chaque question, le bon passage est-il dans les 5 ou 10 premiers résultats (Top@5, Top@10) ? À quel rang (MRR) ? Ces mesures automatiques permettent de comparer deux modèles d'embedding en quelques minutes.

Un modèle juge (LLM-as-a-judge)

Pour la génération, un second modèle de langage compare chaque réponse à la réponse attendue et aux extraits fournis, selon une grille : fidélité aux sources, exhaustivité, absence d'invention. Cette notation automatique est calibrée sur un échantillon relu par les métiers, puis appliquée à tout le jeu de test à chaque modification. C'est ce qui permet de dire « cette version est meilleure que la précédente » avec un chiffre. Quand un système RAG existant n'a jamais été mesuré, c'est par là que commence un audit IA.

Héberger un RAG en France

Un RAG manipule vos documents les plus sensibles. Trois architectures existent, à choisir selon vos contraintes.

ArchitectureOù vont les documentsPour qui
API américaine (OpenAI, Anthropic)Extraits envoyés au prestataire à chaque question, sous ses conditions contractuellesDonnées peu sensibles, démarrage rapide
API européenne (Mistral, fournisseurs hébergés dans l'Union européenne)Extraits envoyés à un prestataire soumis au droit européenLa plupart des PME et ETI
Modèle ouvert auto-hébergé (Mistral, Llama, Qwen sur vLLM ou Ollama)Rien ne sort de votre serveur ou d'un serveur dédié en FranceSanté, juridique, défense, marchés publics, secret industriel

Dans les trois cas, la base vectorielle et les documents restent chez vous ou sur un serveur en France : seuls les extraits utiles à une question transitent vers le modèle. Pour Virteem, j'ai construit une plateforme LLM et RAG entièrement auto-hébergée, avec vLLM et Milvus, sans aucune API externe. Le guide IA souveraine et hébergement en France détaille les options, et la page Mistral présente le modèle européen le plus utilisé sur ces projets.

Coûts et délais d'un RAG d'entreprise

Les ordres de grandeur constatés sur ce type de projet en France :

  • Mise en place : de l'ordre de 8 000 € pour une source propre, un usage interne et une interface web, à 40 000 € pour plusieurs sources synchronisées, de l'OCR sur documents scannés, des droits par rôle repris de SharePoint et un hébergement dédié.
  • Exploitation : de l'ordre de 100 à 300 € par mois d'appels API pour un usage courant, ou un serveur GPU en France entre 500 et 1 500 € par mois selon la charge pour un modèle ouvert.
  • Maintenance : réindexation, suivi de la qualité, évolutions, de l'ordre de 10 à 20 % du coût initial par an.
  • Délai : 4 à 10 semaines entre le cadrage et la production, dont une bonne moitié consacrée à la mesure et à l'amélioration.

Le détail par poste est dans la page prix d'un assistant documentaire RAG. Une agence IA facture à la journée (800 à 1 200 € par jour et par profil constatés) ; en freelance IA senior, le forfait est fixé avant de commencer.

Les erreurs fréquentes sur un projet RAG

  1. Indexer tout, sans tri. Les brouillons, les versions obsolètes et les doublons se retrouvent dans les résultats et contredisent la version en vigueur. Un RAG commence par une base documentaire gouvernée : quel document fait foi, qui le met à jour.
  2. Négliger l'ingestion. Tableaux aplatis, colonnes mélangées, en-têtes répétés, PDF scannés lus de travers. Une bonne part des mauvaises réponses se règle avant tout embedding.
  3. Garder le modèle d'embedding par défaut. Le modèle par défaut du framework est souvent anglophone. Sur un corpus français, technique ou juridique, l'écart entre deux modèles se mesure en dizaines de points de Top@10.
  4. Se passer de jeu de test. Sans lui, chaque modification est un pari et le projet s'enlise en démonstrations contradictoires.
  5. Oublier les droits d'accès. Le filtrage par rôle doit se faire au niveau de la recherche, avant que le passage n'atteigne le modèle.
  6. Répondre à tout prix. Un bon RAG sait dire « je ne trouve pas cette information dans les documents ». C'est un réglage de l'invite et du seuil de similarité, et c'est ce qui construit la confiance.
  7. Sous-estimer l'adoption. Sans interface dans l'outil du quotidien (Teams, Slack, la GED) et sans deux heures par semaine de relecture métier pendant la phase de mesure, l'outil est abandonné.

Ces erreurs recoupent celles du guide 7 erreurs des systèmes IA, observées sur des projets audités.

RAG ou fine-tuning : que choisir ?

La question revient dans presque chaque appel de cadrage. Le fine-tuning (ajustement d'un modèle sur vos données) modifie le comportement du modèle : ton, format, vocabulaire métier, tâche spécialisée. Il n'apprend au modèle aucun fait précis et changeant de façon fiable, et il ne cite aucune source. Le RAG, lui, fournit les faits au moment de la question, se met à jour en réindexant un document et affiche ses sources.

En pratique :

  • vos questions portent sur le contenu de documents qui évoluent : RAG ;
  • vous voulez un style, un format de sortie ou une classification très spécifique, sur un volume élevé : fine-tuning, souvent d'un petit modèle ;
  • les deux besoins existent : RAG d'abord, puis un fine-tuning ciblé une fois que le jeu de test montre où le modèle de génération plafonne.

Le comparatif RAG ou fine-tuning détaille les critères et les coûts. Si vous hésitez encore, un appel de 20 minutes suffit en général pour trancher sur votre cas.

Passer à l'action

Assistant IA documentaire (RAG)

Intégration IA générative : un assistant documentaire (RAG) qui répond depuis vos documents et cite ses sources, hébergé en France. Livré en 4 à 10 semaines.

Portrait de Mehdi Challakh
Mehdi Challakh, ingénieur IA freelancePlus de 8 ans en IA de production, 28 systèmes déployés, deux produits IA exploités en propre. Parcours et références.
Questions fréquentes

Questions fréquentes

Combien coûte un RAG pour une PME ?
De l'ordre de 8 000 € pour une source de documents propre et un usage interne, jusqu'à 40 000 € avec plusieurs sources, de l'OCR, des droits par rôle et un hébergement dédié, d'après les fourchettes constatées en France. S'ajoutent de l'ordre de 100 à 300 € par mois d'appels API, ou un serveur GPU en France entre 500 et 1 500 € par mois. Le devis est forfaitaire et écrit avant le démarrage.
Combien de temps faut-il pour mettre un RAG en production ?
Entre 4 et 10 semaines selon le nombre de sources et l'état des documents. Une première version fonctionne en général au bout de trois semaines ; le reste du temps sert à mesurer et à améliorer sur le jeu de test, puis à intégrer l'outil dans Teams, l'intranet ou la GED et à former les équipes.
Peut-on faire un RAG avec n8n ou sans code ?
Oui pour un prototype : n8n propose des nœuds d'ingestion, d'embedding et de base vectorielle qui permettent de monter un premier assistant en quelques jours. Pour la production, les limites arrivent vite sur l'OCR, le découpage fin, la recherche hybride, les droits d'accès et l'évaluation. Le prototype n8n sert alors de preuve d'intérêt avant un développement plus robuste.
Le RAG fonctionne-t-il sur des documents scannés ?
Oui, à condition d'ajouter une étape de reconnaissance de caractères (OCR) de qualité et de vérifier son résultat sur un échantillon. Pour Lokimo, l'extraction de règles d'urbanisme depuis des PLU scannés en est un exemple.
Mes documents sont-ils envoyés à OpenAI avec un RAG ?
Seulement si vous choisissez un modèle OpenAI pour la génération, et dans ce cas uniquement les extraits utiles à chaque question, sous les conditions contractuelles de l'offre. Les documents et la base vectorielle restent chez vous. Avec un modèle Mistral hébergé en Europe ou un modèle ouvert sur votre serveur, rien ne sort.
Faut-il une agence IA ou un freelance IA pour un projet RAG ?
Un projet RAG demande quelqu'un qui a déjà réglé la recherche sur un corpus réel, parce que c'est là que tout se joue. Une agence IA mobilise plusieurs profils à 800 à 1 200 € par jour ; un freelance IA senior fait le cadrage, le code, la mesure et la passation seul, au forfait. Le comparatif freelance IA ou agence IA précise les cas où l'agence reste préférable.

Parlons de votre projet IA en 20 minutes.

Vous décrivez votre situation, je vous dis ce qui est faisable, par où commencer et avec quels ordres de grandeur. Si une autre approche ou un autre prestataire convient mieux, je vous le dis aussi.

Réserver un appel de 20 minutes

Sans engagement. Créneau à choisir directement dans l'agenda.

Réserver un appel de 20 minutes