Mehdi ChallakhFreelance IA Réserver un appel
Comparatif · RAG vs fine-tuning · LLM en entreprise

RAG ou fine-tuning : comment donner vos données à un modèle de langage

Vous voulez qu'un modèle de langage (LLM) réponde à partir de vos documents, de votre vocabulaire et de vos règles. Deux voies existent : la recherche augmentée par génération (retrieval-augmented generation, RAG), qui fournit au modèle les bons extraits au moment de la question, et le fine-tuning, qui réentraîne le modèle sur vos données. Ce comparatif tranche sur huit critères et décrit le cas, fréquent, où l'on combine les deux.

Verdict

Dans neuf projets d'entreprise sur dix que je vois en audit, le RAG est la bonne réponse, et le fine-tuning du grand modèle est une fausse bonne idée. Le RAG donne au modèle une connaissance à jour, citable et modifiable sans réentraînement : c'est ce qu'il faut pour un assistant documentaire, un support client ou une recherche interne. Le fine-tuning sert à changer le comportement du modèle (style, format, vocabulaire métier, tâche très spécialisée) ; il apprend mal des faits qui changent. Là où le fine-tuning brille, c'est sur les petits modèles de la chaîne RAG elle-même : le modèle d'embedding (qui transforme les textes en vecteurs pour la recherche) ou le reranker (qui classe les extraits). C'est ce que j'ai fait pour Delibia : un RAG sur 2,7 millions de délibérations, avec un modèle d'embedding entraîné sur le corpus, quatre fois plus léger que bge-m3 pour 95 % de la qualité en top-100.

Critère par critère

RAG (recherche augmentée par génération) ou Fine-tuning : le comparatif détaillé

CritèreRAG (recherche augmentée par génération)Fine-tuningAvantage
Fraîcheur des donnéesUn document ajouté, modifié ou supprimé est pris en compte à la prochaine indexation, en général en quelques minutes. Les tarifs, procédures et contrats de la semaine sont à jour sans toucher au modèle.La connaissance est figée à la date de l'entraînement. Chaque mise à jour importante demande une nouvelle campagne : préparation des données, entraînement, évaluation, redéploiement. Inadapté aux informations qui changent tous les mois.RAG (recherche augmentée par génération)
Traçabilité et citationsChaque réponse peut afficher les extraits utilisés, avec le document, la page et la date. L'utilisateur vérifie, et l'entreprise peut auditer pourquoi le système a répondu ainsi. C'est souvent une exigence dans les secteurs réglementés.Le modèle a « absorbé » les données ; il ne sait pas dire d'où vient une affirmation. Impossible de citer une source, difficile de prouver qu'une réponse ne vient pas d'un document qui n'aurait pas dû être utilisé.RAG (recherche augmentée par génération)
Coût de mise en place et de mise à jourDe 8 000 à 40 000 € constatés pour un assistant documentaire en production, selon la qualité des sources et l'hébergement. Les mises à jour coûtent le temps d'indexation, presque rien. Le coût récurrent est celui de l'inférence et de la base vectorielle.Un fine-tuning léger (LoRA) sur un modèle ouvert se fait pour quelques centaines à quelques milliers d'euros de calcul, mais la préparation du jeu de données et l'évaluation représentent l'essentiel de la facture. Chaque mise à jour rejoue une bonne partie de ce coût.RAG (recherche augmentée par génération)
Données nécessairesVos documents tels qu'ils existent : PDF, pages intranet, tickets, fiches produit. Le travail porte sur leur nettoyage, leur découpage et leurs métadonnées (date, périmètre, droits d'accès) et non sur leur reformulation.Des milliers d'exemples question-réponse ou instruction-résultat, propres, cohérents, représentatifs. La plupart des entreprises n'ont pas ce jeu de données et doivent le fabriquer, ce qui prend des semaines et introduit des biais.RAG (recherche augmentée par génération)
HallucinationsLe modèle répond à partir des extraits fournis et peut être contraint de répondre « je ne sais pas » s'ils ne contiennent pas la réponse. Les erreurs restantes viennent surtout d'une mauvaise recherche : c'est mesurable et corrigeable extrait par extrait.Le fine-tuning réduit peu les hallucinations sur les faits, et il peut les aggraver : le modèle apprend le ton assuré de vos documents sans en garantir le contenu. Il n'a aucun moyen de vérifier qu'une information est encore vraie.RAG (recherche augmentée par génération)
Style, format et vocabulaire métierLe style se règle par le prompt (consigne donnée au modèle) et par des exemples fournis dans le contexte. Cela suffit dans la plupart des cas, mais reste fragile sur des formats très contraints (structure exacte, jargon interne, langue rare) et consomme des tokens (unités de texte facturées) à chaque appel.C'est son point fort : un modèle affiné adopte de façon stable un ton, un format de sortie, une nomenclature interne ou une tâche de classification précise, avec des prompts plus courts et une sortie plus régulière.Fine-tuning
Latence et coût par requêteChaque question ajoute une étape de recherche et un contexte plus long à traiter. Bien conçu, cela reste de l'ordre de quelques secondes ; mal conçu, on dépasse les dix secondes. Chez Delibia, la refonte du système a fait passer la latence de 15 s à 4,3 s.Aucune recherche, prompts courts : le modèle affiné répond plus vite et coûte moins cher par appel. Sur un petit modèle spécialisé, l'écart peut être d'un facteur dix en volume.Fine-tuning
Quand combiner les deuxLe RAG reste la colonne vertébrale : il apporte les faits, les citations et la fraîcheur. Il gagne beaucoup quand ses composants de recherche sont adaptés à votre corpus.Le fine-tuning s'applique alors aux petits modèles de la chaîne : embedding et reranker entraînés sur vos documents et vos vraies questions. Chez Delibia, c'est ce qui a fait passer le retrieval (recherche des passages pertinents) Top@10 de 53 % à 93 %, avec un modèle d'embedding quatre fois plus léger que bge-m3.Égalité

Vous hésitez encore pour votre cas ?

Vingt minutes suffisent pour savoir si c'est faisable, par où commencer et à quel ordre de grandeur s'attendre.

Réserver un appel de 20 minutes

Choisir RAG (recherche augmentée par génération) quand

  • Vos réponses doivent s'appuyer sur des documents qui changent (contrats, procédures, tarifs, réglementation) et être citées avec leur source.
  • Vous voulez un assistant documentaire, un support client ou une recherche interne en production en quelques semaines, sans jeu de données d'entraînement.
  • La confidentialité impose un contrôle fin des droits d'accès : le RAG filtre les documents par utilisateur, ce qu'un modèle affiné ne sait pas faire.

Choisir Fine-tuning quand

  • Vous avez besoin d'un comportement stable et précis (format de sortie, classification, extraction, ton) sur une tâche répétée des milliers de fois par jour.
  • Vous disposez déjà de milliers d'exemples de qualité, ou vous pouvez les produire à partir de l'historique de votre équipe.
  • Vous voulez un petit modèle spécialisé, rapide et peu coûteux, hébergé chez vous, pour une tâche bornée : embedding, reranking (reclassement des résultats), tri, extraction.

Conclusion

La question « RAG ou fine-tuning » a presque toujours la même réponse : RAG d'abord, mesuré avec un jeu de test sur vos vraies questions, puis fine-tuning des composants de recherche si les mesures le justifient. C'est la méthode que j'applique en freelance IA, en trois semaines d'Audit IA quand un système existe déjà, ou de bout en bout pour un assistant IA documentaire à construire. Un appel de 20 minutes suffit pour savoir laquelle des deux voies correspond à vos données et à votre budget.

Portrait de Mehdi Challakh
Mehdi Challakh, ingénieur IA freelancePlus de 8 ans en IA de production, 28 systèmes déployés, deux produits IA exploités en propre. Parcours et références.
Questions fréquentes

Questions fréquentes : RAG (recherche augmentée par génération) ou Fine-tuning

Comment la RAG améliore-t-elle les résultats des IA génératives ?
En fournissant au modèle, au moment de la question, les extraits pertinents de vos documents. Le modèle ne répond plus de mémoire : il lit, résume et cite. Résultat : des réponses à jour, vérifiables et limitées à votre périmètre. Le guide le RAG expliqué détaille chaque étape, de l'indexation à la génération.
Le fine-tuning permet-il d'apprendre mes documents à ChatGPT ou à Mistral ?
Mal. Le fine-tuning modifie la façon dont un modèle répond ; il ne modifie pas de manière fiable ce qu'il sait. Un modèle affiné sur vos documents restitue des faits approximatifs, sans source, et devient obsolète à la première mise à jour. Pour la connaissance, le RAG est la bonne voie ; le fine-tuning garde son intérêt pour le style, le format et les tâches spécialisées.
Combien coûte un RAG en entreprise ?
De 8 000 à 40 000 € constatés pour un assistant documentaire en production, selon le volume et l'état des sources, les connecteurs et l'hébergement (cloud ou serveur en France). S'ajoutent quelques dizaines à quelques centaines d'euros par mois d'inférence et de base vectorielle. Le détail se trouve sur la page prix d'un assistant documentaire RAG.
Combien coûte un fine-tuning et combien de données faut-il ?
Le calcul lui-même est devenu bon marché : quelques centaines à quelques milliers d'euros pour un fine-tuning léger (LoRA) d'un modèle ouvert. Le vrai coût est le jeu de données : plusieurs milliers d'exemples propres et représentatifs, puis un cadre d'évaluation pour prouver que le modèle affiné fait mieux que le modèle de base avec un bon prompt.
Peut-on faire du RAG sans envoyer ses données à OpenAI ou Anthropic ?
Oui. La chaîne complète (embedding, base vectorielle, modèle de génération) fonctionne avec des modèles ouverts hébergés sur vos serveurs ou chez un hébergeur français, comme je l'ai fait pour Virteem avec vLLM et une base vectorielle auto-hébergée (self-hosted), sans aucune API externe. La qualité est un peu inférieure aux plus grands modèles, mais suffisante pour la plupart des usages documentaires.
Quel modèle d'embedding choisir pour un RAG en français ?
Les modèles multilingues ouverts (bge-m3 et ses équivalents sur Hugging Face) donnent une bonne base. Sur un corpus très spécifique, un modèle d'embedding entraîné sur vos documents et vos vraies questions apporte le plus grand gain de qualité : c'est le fine-tuning utile dans un projet RAG.

Besoin de trancher pour votre cas précis ?

Le bon choix dépend de votre équipe, de vos volumes et de vos contraintes de confidentialité. Vingt minutes suffisent pour vous donner un avis motivé.

Réserver un appel de 20 minutes

Sans engagement. Créneau à choisir directement dans l'agenda.

Réserver un appel de 20 minutes